Pedro Cuenca, llama.cpp 활용해 RTX 6000과 M5 노트북에 걸쳐 MiMo 2.6 Flash 구동
Pedro Cuenca는 10 GbE로 연결된 RTX 6000 GPU와 M5 노트북 환경에서 llama.cpp의 기본 지원을 활용해 MiMo 2.6 Flash의 네이티브 mxfp4 가중치를 초당 40토큰 속도로 구동하는 모습을 시연했다.
Pedro Cuenca는 10 GbE로 연결된 RTX 6000 GPU와 M5 노트북 환경에서 llama.cpp의 기본 지원을 활용해 MiMo 2.6 Flash의 네이티브 mxfp4 가중치를 초당 40토큰 속도로 구동하는 모습을 시연했다.