Pedro Cuenca、llama.cppを介してRTX 6000とM5ノートPCでMiMo 2.6 Flashを実行
Pedro Cuencaは、10 GbE経由で接続したRTX 6000 GPUとM5ノートPCをまたぎ、llama.cppの標準サポートを活用してMiMo 2.6 Flashのネイティブmxfp4ウェイトを実行し、毎秒40トークンの推論速度を実証した。
Pedro Cuencaは、10 GbE経由で接続したRTX 6000 GPUとM5ノートPCをまたぎ、llama.cppの標準サポートを活用してMiMo 2.6 Flashのネイティブmxfp4ウェイトを実行し、毎秒40トークンの推論速度を実証した。