Arena.ai, Code Arena WebDev에서 GPT-6 Luna (Max)를 24위로 평가
GPT-6 Luna (Max)는 1,593점으로, 41위인 GPT-5.6 Luna (xHigh)보다 74점 높다. Arena.ai는 이 모델이 Gemini 3.7 Flash High, Qwen 3.8-27B와 비슷한 성능을 보이며 혼합 가격은 토큰 100만 개당 0.40달러라고 밝혔다.
GPT-6 Luna (Max)는 1,593점으로, 41위인 GPT-5.6 Luna (xHigh)보다 74점 높다. Arena.ai는 이 모델이 Gemini 3.7 Flash High, Qwen 3.8-27B와 비슷한 성능을 보이며 혼합 가격은 토큰 100만 개당 0.40달러라고 밝혔다.
Arena.ai는 Claude Opus 5.5 (Max)가 Code Arena WebDev 순위에서 1위이며, 혼합 가격은 토큰 100만 개당 16달러로 다음 순위 모델 GPT-6 Astra (Max)보다 60% 낮다고 밝혔다. 점수는 Arena.ai 글로벌 커뮤니티의 실시간 실제 사용을 기준으로 한다.
Arena.ai는 Claude Opus 5.5 (Max)가 혼합 가격 기준 토큰 100만 개당 16달러로 최고 성능을 제공한다고 밝혔으며, 이 가격 대비 성능 지점이 파레토 프론티어를 재편한다고 설명했다.
Arena.ai는 Code Arena WebDev에서 Claude Opus 5.5 (Max)를 1,818점으로 1위에 올렸다. GPT-6 Astra (Max)보다 26점, Opus 5 (Max)보다 126점 앞선다. Claude는 이 모델이 대부분 작업에서 Claude Fable 5.1 수준이며 실행 비용은 Opus 5보다 40% 낮다고 밝혔다.
WebCraftBench는 에이전트가 실제 앱을 사용한 뒤 심미성, 사용성, 원래 요청의 충족 여부를 평가한다. Tencent Hy는 검증된 197개 쌍에서 인간 선호와 85.3% 일치했다고 밝혔다.
Arena.ai는 두 아레나 모두에서 Qwen-Image-2.1을 오픈소스 모델 1위로 평가했다. Image Edit에서는 1,367점을 기록하고 전체 16위이며, GPT-Image-1.5-high-fidelity보다 3점 낮다.
OpenAI의 두 모델은 Arena에서 시험할 수 있으며, 실제 에이전트 작업에 대한 투표가 리더보드에 반영된다. Arena.ai는 petergostev가 같은 프롬프트와 최대 추론 설정으로 GPT-6 Sol과 GPT-5.6 Sol을 비교했다고도 밝혔다.
OpenAI의 GPT-6 Sol과 GPT-6 Luna를 이제 Arena.ai의 Agent Arena에서 시험할 수 있으며, 점수는 아직 나오지 않았다. Code Arena의 WebDev, Text, Vision, Search, Document에서도 시험할 수 있다. OpenAI는 이 모델들이 GPT-6 Astra를 기반으로 하며, API 가격이 GPT-5.6 프로모션 가격보다 50% 낮다고 밝혔다.
Arena.ai 집계에서 Qwen-Image-2.1은 1,228점으로 오픈 모델 1위, 전체 17위다. Gemini-3-pro-image-preview보다 4점, GPT-Image-1.5-high-fidelity보다 11점 낮다.