Arena.ai 發現 AI 評審更偏向自己的答案,而非人類投票
Arena.ai 將 12 個模型的 34,580 次裁決與人類投票比較,涵蓋 Arena 上的 1,460 場對戰。平均而言,模型有 58% 的時間選擇自己的答案;人們選擇同一答案的比例為 34%。GPT-6 Astra 有 88% 的時間選擇自己。
這些模型也很少判平局。人們在 32% 的對戰中標記為平局或「兩者都差」,而 GPT-5.6 Sol 有 96% 的時間選出勝者。AI 評審與其他模型一致的比例為 79%,與人一致的比例為 57%,每位評審偏向其他 AI 而非人的幅度為 18 到 27 個百分點。
完整結果見 DawidGalarowicz 的 Arena 文章。