史丹福與 Together AI 論文中,三模型自組織團隊平均得分 66.7%
DAIR.AI 報告指,史丹福與 Together AI 的一篇論文發現,o3-mini、Claude Sonnet 4 與 DeepSeek-V3 組成自組織團隊,在五項數學與物理基準測試中平均得分 66.7%,高於最強成員單獨作答的 48.8%,以及完美路由器的 59.0%。
DAIR.AI 報告指,史丹福與 Together AI 的一篇論文發現,o3-mini、Claude Sonnet 4 與 DeepSeek-V3 組成自組織團隊,在五項數學與物理基準測試中平均得分 66.7%,高於最強成員單獨作答的 48.8%,以及完美路由器的 59.0%。