Pedro Cuenca、llama.cppを介してRTX 6000とM5ノートPCでMiMo 2.6 Flashを実行
Pedro Cuencaは、10 GbE経由でRTX 6000 GPUとM5ノートPCを組み合わせ、異種ハードウェア間でMiMo 2.6 Flashを実行できることを実証した。この構成で毎秒40トークンの推論速度を達成した。
この実行ではモデルのネイティブmxfp4ウェイトが直接使用され、llama.cppで標準機能としてサポートされている。
Pedro Cuencaは、10 GbE経由でRTX 6000 GPUとM5ノートPCを組み合わせ、異種ハードウェア間でMiMo 2.6 Flashを実行できることを実証した。この構成で毎秒40トークンの推論速度を達成した。
この実行ではモデルのネイティブmxfp4ウェイトが直接使用され、llama.cppで標準機能としてサポートされている。