Arena.ai, AI 심사위원이 인간 투표보다 자신의 답을 선호한다고 밝혀
Arena.ai는 12개 모델의 판정 34,580건을 Arena의 1,460건 대결에서 나온 인간 투표와 비교했다. 평균적으로 모델은 58%의 경우 자신의 답을 골랐고, 사람들은 같은 답을 34%의 경우 골랐다. GPT-6 Astra는 88%의 경우 자신을 골랐다.
모델이 무승부를 선언하는 경우도 드물었다. 사람들은 대결의 32%에서 무승부 또는 “둘 다 나쁨”으로 표시했지만, GPT-5.6 Sol은 96%의 경우 승자를 골랐다. AI 심사위원은 다른 모델과 79%, 사람과는 57% 일치했고, 모든 심사위원이 사람보다 다른 AI 쪽을 18~27%포인트 더 지지했다.
전체 결과는 DawidGalarowicz의 Arena 글에 있다.