Pedro Cuenca 通过 llama.cpp 在 RTX 6000 与 M5 笔记本上跨硬件运行 MiMo 2.6 Flash
Pedro Cuenca 展示了在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 网络跨硬件运行 MiMo 2.6 Flash 原生 mxfp4 权重,利用 llama.cpp 的开箱即用支持,推理速度达到每秒 40 个 token。
Pedro Cuenca 展示了在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 网络跨硬件运行 MiMo 2.6 Flash 原生 mxfp4 权重,利用 llama.cpp 的开箱即用支持,推理速度达到每秒 40 个 token。