Arena.ai, GPT-6 Sol과 GPT-6 Luna 점수 곧 공개될 예정이라고 밝혀
OpenAI의 두 모델은 Arena에서 시험할 수 있으며, 실제 에이전트 작업에 대한 투표가 리더보드에 반영된다. Arena.ai는 petergostev가 같은 프롬프트와 최대 추론 설정으로 GPT-6 Sol과 GPT-5.6 Sol을 비교했다고도 밝혔다.
OpenAI의 두 모델은 Arena에서 시험할 수 있으며, 실제 에이전트 작업에 대한 투표가 리더보드에 반영된다. Arena.ai는 petergostev가 같은 프롬프트와 최대 추론 설정으로 GPT-6 Sol과 GPT-5.6 Sol을 비교했다고도 밝혔다.
OpenAI는 두 모델 모두 GPT-5.6 대응 모델보다 개선되었다고 밝혔다.
LangChain은 Jev를 에이전트 평가 심사관으로서 GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6와 비교 테스트했다고 밝혔으며, 모든 호출에서 인간 심사자와 일치하고, 분산이 최대 913배 낮으며, 호출당 0.44초, 전체 실행 비용이 Claude Sonnet 4.6의 $28.17 대비 $0.34라고 보고했다.