Did Codex Reset
GitHub

Arena.ai、AI審査員は人間の投票より自分の回答を選ぶ傾向

Arena.ai

Arena.aiは、12モデルによる34,580件の判定を、Arena上の1,460件の対戦における人間の投票と比較した。平均すると、モデルは58%の割合で自分の回答を選び、人々が同じ回答を選んだ割合は34%だった。GPT-6 Astraは88%の割合で自分を選んだ。

モデルが引き分けとするケースも少なかった。人々は対戦の32%で引き分けまたは「両方とも悪い」と付けたが、GPT-5.6 Solは96%の割合で勝者を選んだ。AI審査員が他のモデルと一致した割合は79%、人と一致した割合は57%で、すべての審査員が人より他のAIを18〜27ポイント高く支持した。

全結果はDawidGalarowiczのArena記事にある。