Artificial Analysis, Ming-Image-0.1-Design를 오픈웨이트 UI/UX 모델 1위로 평가
Artificial Analysis Text to Image 리더보드에서 6B Ming-Image-0.1-Design은 UI/UX 디자인 부문 81개 중 17위, 오픈웨이트 모델 중 1위이며 전체 순위는 160개 중 45위다. MIT 라이선스로 공개되고 RGBA 출력을 지원하며, 2K 해상도와 추론 12스텝으로 평가됐다.
Artificial Analysis Text to Image 리더보드에서 6B Ming-Image-0.1-Design은 UI/UX 디자인 부문 81개 중 17위, 오픈웨이트 모델 중 1위이며 전체 순위는 160개 중 45위다. MIT 라이선스로 공개되고 RGBA 출력을 지원하며, 2K 해상도와 추론 12스텝으로 평가됐다.
가중치, 코드, 파인튜닝 레시피, 벤치마크, 재현 가능한 예제가 공개된다. Black Forest Labs는 이 월드 액션 모델이 RoboLab에서 1위를 차지했으며, 기존 최고 오픈 모델보다 6.1%포인트 앞서고 파라미터는 56% 적으며 실행 속도는 최대 3.95배 빠르다고 밝혔다.
B.AI가 Xiaomi MiMo의 오픈 웨이트 모델 MiMo-V2.6-Pro와 MiMo-V2.6-Flash를 API와 웹 채팅에서 제공한다. 둘 다 1M 컨텍스트 윈도우와 텍스트, 이미지, 영상, 오디오 전반을 이해하는 네이티브 멀티모달 추론 모델이다.
Artificial Analysis는 신규 9개 언어 리더보드 전체에서 단일 오픈 웨이트 음성 합성 모델이 모두 앞서지는 않는다고 밝혔다. 선두는 Higgs Audio V3 TTS, OpenAudio S1 Mini, Voxtral TTS, Breeze TTS 2로 나뉜다.
Artificial Analysis 순위에서 아홉 개 언어를 모두 앞서는 단일 오픈 웨이트 텍스트 음성 변환 모델은 없다. Higgs Audio V3 TTS, OpenAudio S1 Mini, Voxtral TTS, Breeze TTS 2가 각각 다른 언어에서 오픈 웨이트 분야 1위이며, 각 순위판에는 오픈 웨이트 모델이 2~6개만 포함된다.
StepFun은 Artificial Analysis 결과를 강조하며 Step 5 Preview가 Intelligence Index에서 44점, 작업당 $0.71를 기록했다고 밝혔고, 10월 15일에 더 많은 내용이 나올 예정이다. 평가는 600B/27B MoE 플래그십으로 자사 API 접근이 가능하며 10월 15일에 오픈 웨이트가 계획되어 있다고 설명한다.
Cline은 플래그십 모델 MiMo-v2.6-Pro가 공식 출시되어 이미 ClinePass에서 이용 가능하다고 밝혔다. 또한 이 모델을 인공지능 지수에서 최고 성능의 오픈 웨이트 모델이라고 평가했다.
알리바바 클라우드가 오픈 웨이트를 갖춘 통합 7B 이미지 생성 및 편집 모델 Qwen-Image-2.1을 발표했다. 회사는 이 모델이 RGBA 레이어를 네이티브로 처리하고, 최대 10개의 참조 이미지를 지원하며, GitHub, ModelScope, Hugging Face에서 이용할 수 있다고 밝혔다.
ComfyUI는 Qwen-Image-2.1이 이제 지원된다고 밝히며, 생성과 편집을 위한 오픈 웨이트 7B 체크포인트를 설명했습니다. Qwen은 해당 발표를 인용하며 ComfyUI 지원을 강조했습니다.
Qwen이 Qwen-Image-2.1을 발표하며, 이 7B 모델이 이미지 생성과 편집을 통합하고 가중치가 이제 오픈되었다고 밝혔다. 회사는 이 모델이 RGBA 레이어를 네이티브로 처리하고, 최대 10장의 참조 이미지를 지원하며, 정밀한 로컬 제어를 제공한다고 말했다.