# Pedro Cuenca, llama.cpp 활용해 RTX 6000과 M5 노트북에 걸쳐 MiMo 2.6 Flash 구동

Pedro Cuenca는 10 GbE로 연결된 RTX 6000 GPU와 M5 노트북 환경에서 llama.cpp의 기본 지원을 활용해 MiMo 2.6 Flash의 네이티브 mxfp4 가중치를 초당 40토큰 속도로 구동하는 모습을 시연했다.

Language: ko
Time zone: Asia/Seoul

HTML: https://didcodexreset.com/ko/news/bbb925c04bfb4271b3d0b3ae.html

Content language: ko
Localization state: translated

출처: Pedro Cuenca · 2026. 10. 8. 03:03:30 게시

Pedro Cuenca는 10 GbE로 연결된 RTX 6000 GPU와 M5 노트북을 결합해 이기종 하드웨어 전반에서 MiMo 2.6 Flash를 구동하는 모습을 시연했다. 해당 구성은 초당 40토큰의 추론 속도를 달성했다.

이번 실행은 모델의 네이티브 mxfp4 가중치를 직접 구동했으며, llama.cpp에서 별도 설정 없이 기본 지원된다.

Tags: llama.cpp, MiMo 2.6 Flash, 추론

[원문 게시물 보기](https://x.com/pcuenq/status/2107825758442082591)
