Opus 5.5, 작업당 토큰 사용량 Opus 5보다 37% 많아
Artificial Analysis에 따르면 Claude Opus 5.5는 Coding Agent Index 작업당 1,560만 토큰을 쓰며, Opus 5는 1,140만 토큰을 쓴다. 캐시된 입력은 1,090만에서 1,460만으로 늘고, 출력은 13만 7천에서 33만 3천으로 두 배 이상 증가한다.
Artificial Analysis에 따르면 Claude Opus 5.5는 Coding Agent Index 작업당 1,560만 토큰을 쓰며, Opus 5는 1,140만 토큰을 쓴다. 캐시된 입력은 1,090만에서 1,460만으로 늘고, 출력은 13만 7천에서 33만 3천으로 두 배 이상 증가한다.
Claude Code에서 max effort로 실행했을 때 Artificial Analysis가 측정한 Opus 5.5 점수는 66점으로, Opus 5의 60점과 Claude Fable 5.1의 62점을 웃돈다. 작업당 비용은 13.04달러로, 토큰 가격이 낮아졌음에도 Opus 5의 10.79달러보다 높다.
Artificial Analysis Text to Image 리더보드에서 6B Ming-Image-0.1-Design은 UI/UX 디자인 부문 81개 중 17위, 오픈웨이트 모델 중 1위이며 전체 순위는 160개 중 45위다. MIT 라이선스로 공개되고 RGBA 출력을 지원하며, 2K 해상도와 추론 12스텝으로 평가됐다.
MiMo-V2.6-Pro, Claude Opus 5.5, GPT-6 Luna, GPT-6 Sol이 서로 다른 reasoning effort에서 Artificial Analysis의 Intelligence Index 대 작업당 비용 파레토 프론티어에 새 지점 11개를 차지했다. Claude Opus 5.5(max with fallback)는 작업당 5.98달러에 58점을 기록해 이 지수에서 가장 높은 결과다.
Artificial Analysis의 Pronunciation Robustness 벤치마크에서 Gemini 3.8 Flash TTS는 89.5%를 기록하며 Gemini 3.1 Flash TTS, SpaceXAI TTS, Gemini 3.8 Flash-Lite TTS를 앞섰다. 개별 발음 항목의 1위는 여러 모델에 나뉘어 있다.
Artificial Analysis는 Gemini 3.8 Flash-Lite TTS를 100만 자당 22.07달러로 표시했다. 둘 다 Gemini 3.1 Flash TTS와 SpaceXAI TTS보다 비싸고 Eleven v3보다 싸다.
이 추정치는 Opus 5 (max)의 5.86달러와 비슷하다. 토큰 사용량 증가는 기본 가격 20% 인하와 캐시 읽기 가격을 0.20달러로 추가 인하한 효과로 상쇄된다.
Artificial Analysis는 GPT-6 Sol과 Luna가 자사 Intelligence Index에서 이전 모델과 비슷한 점수를 기록하면서 비용은 약 절반 수준이며, 이 감소는 토큰 가격이 약 50% 낮아진 데서 비롯된다고 밝혔다.
Artificial Analysis는 신규 9개 언어 리더보드 전체에서 단일 오픈 웨이트 음성 합성 모델이 모두 앞서지는 않는다고 밝혔다. 선두는 Higgs Audio V3 TTS, OpenAudio S1 Mini, Voxtral TTS, Breeze TTS 2로 나뉜다.
Artificial Analysis가 Controlled Voice Arena를 일본어, 중국어(만다린), 힌디어, 스페인어, 독일어, 프랑스어, 포르투갈어, 베트남어, 아랍어의 개별 텍스트 음성 변환 리더보드로 확장했다. 순위는 해당 언어로 작성된 프롬프트, 표준화된 복제 음성, 모국어 화자의 선호도 투표를 사용한다.
다국어 Controlled Voice Arena 리더보드는 9개 신규 언어의 텍스트 음성 변환 모델을 비교한다. 언어를 선택할 수 있는 리더보드, 공개 투표 아레나, 벤치마킹 방법론을 이용할 수 있다.
Artificial Analysis 순위에서 아홉 개 언어를 모두 앞서는 단일 오픈 웨이트 텍스트 음성 변환 모델은 없다. Higgs Audio V3 TTS, OpenAudio S1 Mini, Voxtral TTS, Breeze TTS 2가 각각 다른 언어에서 오픈 웨이트 분야 1위이며, 각 순위판에는 오픈 웨이트 모델이 2~6개만 포함된다.
Controlled Voice Arena가 이제 일본어, 만다린 중국어, 힌디어, 스페인어, 독일어, 프랑스어, 포르투갈어, 베트남어, 아랍어로 텍스트 음성 변환 모델을 순위화한다. Cartesia의 Sonic 제품군이 9개 보드 중 8개에서 선두이고, Inworld AI의 Realtime TTS-2가 만다린 중국어에서 1위다.
Artificial Analysis는 StepAudio 3 ASR의 전사 속도가 실시간의 88배라고 보고했다. 더 빠른 시스템 세 개보다는 뒤지고, ElevenLabs Scribe v2와 Gemini 3.5 Transcribe와는 비슷한 수준이며, Fun-Realtime-ASR-preview보다는 앞선다.
Artificial Analysis에 따르면 StepFun의 StepAudio 3 ASR가 StepFun API를 통해 비스트리밍 전사에 제공된다. AA-WER Index에서 WER 1.7%를 기록해 Alibaba의 Fun-Realtime-ASR-preview와 동률이며, StepAudio 2.5 ASR의 4.7%보다 낮아졌다. 전사 속도는 실시간의 88배이고 요금은 시간당 0.40달러다.
StepFun은 Artificial Analysis 결과를 강조하며 Step 5 Preview가 Intelligence Index에서 44점, 작업당 $0.71를 기록했다고 밝혔고, 10월 15일에 더 많은 내용이 나올 예정이다. 평가는 600B/27B MoE 플래그십으로 자사 API 접근이 가능하며 10월 15일에 오픈 웨이트가 계획되어 있다고 설명한다.