Arena.ai 發現 AI 評審更偏向自己的答案,而非人類投票Arena.ai 將 12 個模型的 34,580 次裁決與人類投票比較,涵蓋 1,460 場 Arena 對戰。平均而言,模型有 58% 的時間選擇自己的答案,而人們選擇同一答案的比例為 34%。