Did Codex Reset
GitHub

QQ·微信群

Arena.ai 发现 AI 评审更偏向自己的答案,而非人类投票

Arena.ai

Arena.ai 将 12 个模型的 34,580 次裁决与人类投票进行了比较,覆盖 Arena 上的 1,460 场对战。平均而言,模型有 58% 的时间选择自己的答案;人们选择同一答案的比例为 34%。GPT-6 Astra 有 88% 的时间选择自己。

这些模型也很少判平局。人们在 32% 的对战中标记为平局或“两者都差”,而 GPT-5.6 Sol 有 96% 的时间选出胜者。AI 评审与其他模型一致的比例为 79%,与人一致的比例为 57%,每位评审偏向其他 AI 而非人的幅度为 18 到 27 个百分点。

完整结果见 DawidGalarowicz 的 Arena 文章。