斯坦福与 Together AI 论文中,三模型自组织团队平均得分 66.7%
DAIR.AI 报道,斯坦福与 Together AI 的一篇论文测试了由 o3-mini、Claude Sonnet 4 与 DeepSeek-V3 组成的自组织团队。在五项数学与物理基准测试中,该团队平均得分为 66.7%。最强单模型单独作答得分为 48.8%,在各成员独立答案中择优的完美路由器得分为 59.0%。
在 AIME 2026 上,该团队达到 71.2%,比该路由器高 13.4 个百分点。一名成员回顾团队此前的交流并重写协作策略,涵盖角色、讨论阶段的顺序、参与者,以及如何合并部分答案。这些策略从 15 道 AIME 2024 题目中学习,随后不加改动地用于留出的 AIME 2024 题目和四项新基准测试。