# Pedro Cuenca、llama.cppを介してRTX 6000とM5ノートPCでMiMo 2.6 Flashを実行

Pedro Cuencaは、10 GbE経由で接続したRTX 6000 GPUとM5ノートPCをまたぎ、llama.cppの標準サポートを活用してMiMo 2.6 Flashのネイティブmxfp4ウェイトを実行し、毎秒40トークンの推論速度を実証した。

Language: ja
Time zone: Asia/Tokyo

HTML: https://didcodexreset.com/ja/news/bbb925c04bfb4271b3d0b3ae.html

Content language: ja
Localization state: translated

出典：Pedro Cuenca · 2026/10/8 03:03:30 公開

Pedro Cuencaは、10 GbE経由でRTX 6000 GPUとM5ノートPCを組み合わせ、異種ハードウェア間でMiMo 2.6 Flashを実行できることを実証した。この構成で毎秒40トークンの推論速度を達成した。

この実行ではモデルのネイティブmxfp4ウェイトが直接使用され、llama.cppで標準機能としてサポートされている。

Tags: llama.cpp, MiMo 2.6 Flash, 推論

[元の投稿を見る](https://x.com/pcuenq/status/2107825758442082591)
