# Pedro Cuenca 通过 llama.cpp 在 RTX 6000 与 M5 笔记本上跨硬件运行 MiMo 2.6 Flash

Pedro Cuenca 展示了在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 网络跨硬件运行 MiMo 2.6 Flash 原生 mxfp4 权重，利用 llama.cpp 的开箱即用支持，推理速度达到每秒 40 个 token。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/bbb925c04bfb4271b3d0b3ae.html

Content language: zh-CN
Localization state: translated

来源：Pedro Cuenca · 发布于 2026/10/8 02:03:30

Pedro Cuenca 展示了在异构硬件上运行 MiMo 2.6 Flash：通过 10 GbE 网络连接一块 RTX 6000 GPU 与一台 M5 笔记本，该配置实现了每秒 40 个 token 的推理速度。

该运行直接使用了模型的原生 mxfp4 权重，并获得了 llama.cpp 的开箱即用支持。

Tags: llama.cpp, MiMo 2.6 Flash, 推理

[查看主帖原文](https://x.com/pcuenq/status/2107825758442082591)
