史丹福與 Together AI 論文中,三模型自組織團隊平均得分 66.7%
DAIR.AI 報告,史丹福與 Together AI 的論文測試了 o3-mini、Claude Sonnet 4 與 DeepSeek-V3 組成的自組織團隊。在五項數學與物理基準測試中,團隊平均得分 66.7%。最強成員單獨得分 48.8%,而在各成員獨立答案之間作選擇的完美路由器得分 59.0%。
在 AIME 2026 上,團隊達到 71.2%,比該路由器高 13.4 分。其中一名成員檢視團隊較早的交流並改寫協作策略,涵蓋角色、討論階段順序、誰參與,以及如何合併部分答案。這些策略從 15 道 AIME 2024 題目學習而來,其後不作改動,套用到留出的 AIME 2024 題目及四項新基準測試。