Arena.ai 发现 AI 评审更偏向自己的答案,而非人类投票Arena.ai 将 12 个模型的 34,580 次裁决与人类投票进行了比较,覆盖 1,460 场 Arena 对战。平均而言,模型有 58% 的时间选择自己的答案,而人们选择同一答案的比例为 34%。