Did Codex Reset
GitHub

QQ·微信群

Pedro Cuenca 透過 llama.cpp 於 RTX 6000 與 M5 手提電腦跨硬件運行 MiMo 2.6 Flash

Pedro Cuenca

Pedro Cuenca 展示了在異構硬件上運行 MiMo 2.6 Flash:透過 10 GbE 網絡連接一張 RTX 6000 GPU 與一部 M5 手提電腦,該配置達到了每秒 40 個 token 的推理速度。

該運行直接使用模型原生 mxfp4 權重,並獲 llama.cpp 原生開箱即用支援。