Arena.ai, 개편된 Leaderboard Overview 출시
새 개요는 신규 추가 모델, 카테고리별 성능, 역량 메모, Arena 뉴스의 실시간 신호를 한곳에 모으며, GPT-6 Sol과 Claude Opus 5.5 같은 모델의 아레나 간 점수를 보여 줄 수 있다.
새 개요는 신규 추가 모델, 카테고리별 성능, 역량 메모, Arena 뉴스의 실시간 신호를 한곳에 모으며, GPT-6 Sol과 Claude Opus 5.5 같은 모델의 아레나 간 점수를 보여 줄 수 있다.
Arena.ai는 Anthropic의 Claude Opus 5.5와 OpenAI의 GPT-6 Sol로 나란히 비교한 출력을 생성했으며, Claude Opus 5.5의 점수는 곧 공개될 예정이라고 밝혔다.
동일한 /design 프롬프트로 Command Code는 DeepSeek-V4.1-Flash에 $0.024로 10점 만점에 9점, Mimo-V2.6-Flash에 $0.018로 8점, Grok-4.7에 $0.35로 3점을 줬다.
Artificial Analysis가 Controlled Voice Arena를 일본어, 중국어(만다린), 힌디어, 스페인어, 독일어, 프랑스어, 포르투갈어, 베트남어, 아랍어의 개별 텍스트 음성 변환 리더보드로 확장했다. 순위는 해당 언어로 작성된 프롬프트, 표준화된 복제 음성, 모국어 화자의 선호도 투표를 사용한다.
Controlled Voice Arena가 이제 일본어, 만다린 중국어, 힌디어, 스페인어, 독일어, 프랑스어, 포르투갈어, 베트남어, 아랍어로 텍스트 음성 변환 모델을 순위화한다. Cartesia의 Sonic 제품군이 9개 보드 중 8개에서 선두이고, Inworld AI의 Realtime TTS-2가 만다린 중국어에서 1위다.
OpenAI의 두 모델은 Arena에서 시험할 수 있으며, 실제 에이전트 작업에 대한 투표가 리더보드에 반영된다. Arena.ai는 petergostev가 같은 프롬프트와 최대 추론 설정으로 GPT-6 Sol과 GPT-5.6 Sol을 비교했다고도 밝혔다.
OpenAI는 학습, 평가, 배포 전반에 대한 심층 접근을 통해 독립 평가를 지원하겠다고 밝혔으며, 엄밀하고 안전하며 독립적인 작업을 위한 4가지 우선 영역과 원칙을 제시하고 있다.