# Pedro Cuenca 透過 llama.cpp 於 RTX 6000 與 M5 手提電腦跨硬件運行 MiMo 2.6 Flash

Pedro Cuenca 展示在 RTX 6000 GPU 與 M5 手提電腦之間經由 10 GbE 網絡跨硬件運行 MiMo 2.6 Flash 原生 mxfp4 權重，利用 llama.cpp 的開箱即用支援，推理速度達每秒 40 個 token。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/bbb925c04bfb4271b3d0b3ae.html

Content language: zh-HK
Localization state: translated

來源：Pedro Cuenca · 發布於 8/10/2026 02:03:30

Pedro Cuenca 展示了在異構硬件上運行 MiMo 2.6 Flash：透過 10 GbE 網絡連接一張 RTX 6000 GPU 與一部 M5 手提電腦，該配置達到了每秒 40 個 token 的推理速度。

該運行直接使用模型原生 mxfp4 權重，並獲 llama.cpp 原生開箱即用支援。

Tags: llama.cpp, MiMo 2.6 Flash, 推理

[查看主帖原文](https://x.com/pcuenq/status/2107825758442082591)
