Did Codex Reset
GitHub

QQ·微信群

Pedro Cuenca 通过 llama.cpp 在 RTX 6000 与 M5 笔记本上跨硬件运行 MiMo 2.6 Flash

Pedro Cuenca

Pedro Cuenca 展示了在异构硬件上运行 MiMo 2.6 Flash:通过 10 GbE 网络连接一块 RTX 6000 GPU 与一台 M5 笔记本,该配置实现了每秒 40 个 token 的推理速度。

该运行直接使用了模型的原生 mxfp4 权重,并获得了 llama.cpp 的开箱即用支持。