Pedro Cuenca 通过 llama.cpp 在 RTX 6000 与 M5 笔记本上跨硬件运行 MiMo 2.6 Flash
Pedro Cuenca 展示了在异构硬件上运行 MiMo 2.6 Flash:通过 10 GbE 网络连接一块 RTX 6000 GPU 与一台 M5 笔记本,该配置实现了每秒 40 个 token 的推理速度。
该运行直接使用了模型的原生 mxfp4 权重,并获得了 llama.cpp 的开箱即用支持。
Pedro Cuenca 展示了在异构硬件上运行 MiMo 2.6 Flash:通过 10 GbE 网络连接一块 RTX 6000 GPU 与一台 M5 笔记本,该配置实现了每秒 40 个 token 的推理速度。
该运行直接使用了模型的原生 mxfp4 权重,并获得了 llama.cpp 的开箱即用支持。