Arena.ai, Code Arena WebDev에서 GPT-6 Luna (Max)를 24위로 평가
GPT-6 Luna (Max)는 1,593점으로, 41위인 GPT-5.6 Luna (xHigh)보다 74점 높다. Arena.ai는 이 모델이 Gemini 3.7 Flash High, Qwen 3.8-27B와 비슷한 성능을 보이며 혼합 가격은 토큰 100만 개당 0.40달러라고 밝혔다.
GPT-6 Luna (Max)는 1,593점으로, 41위인 GPT-5.6 Luna (xHigh)보다 74점 높다. Arena.ai는 이 모델이 Gemini 3.7 Flash High, Qwen 3.8-27B와 비슷한 성능을 보이며 혼합 가격은 토큰 100만 개당 0.40달러라고 밝혔다.
Arena.ai는 Claude Opus 5.5 (Max)가 Code Arena WebDev 순위에서 1위이며, 혼합 가격은 토큰 100만 개당 16달러로 다음 순위 모델 GPT-6 Astra (Max)보다 60% 낮다고 밝혔다. 점수는 Arena.ai 글로벌 커뮤니티의 실시간 실제 사용을 기준으로 한다.
Arena.ai는 Code Arena WebDev에서 Claude Opus 5.5 (Max)를 1,818점으로 1위에 올렸다. GPT-6 Astra (Max)보다 26점, Opus 5 (Max)보다 126점 앞선다. Claude는 이 모델이 대부분 작업에서 Claude Fable 5.1 수준이며 실행 비용은 Opus 5보다 40% 낮다고 밝혔다.
WebCraftBench는 에이전트가 실제 앱을 사용한 뒤 심미성, 사용성, 원래 요청의 충족 여부를 평가한다. Tencent Hy는 검증된 197개 쌍에서 인간 선호와 85.3% 일치했다고 밝혔다.
Arena.ai는 OpenAI의 GPT-6 Sol (Max)가 Code Arena: WebDev에서 1,689점을 받아 4위에 올랐으며, 입력과 출력을 합산한 가격은 토큰 100만 개당 8달러라고 전했다. GPT-5.6 Sol (xHigh)보다 72점 높고, Arena.ai는 GPT-6 Luna의 점수가 아직 집계 중이라고 밝혔다.
Arena.ai는 SpaceXAI의 Grok 4.7 (xHigh)에 1,632점을 부여했으며, Grok 4.6 (High)보다 16점, 여섯 계단 높다. Simulations와 Consumer Product 순위도 올랐다.