斯坦福与 Together AI 论文中,三模型自组织团队平均得分 66.7%
DAIR.AI 报道,斯坦福与 Together AI 的一篇论文发现,o3-mini、Claude Sonnet 4 与 DeepSeek-V3 组成自组织团队,在五项数学与物理基准测试中平均得分为 66.7%,高于最强单模型单独作答的 48.8%,也高于完美路由器的 59.0%。
DAIR.AI 报道,斯坦福与 Together AI 的一篇论文发现,o3-mini、Claude Sonnet 4 与 DeepSeek-V3 组成自组织团队,在五项数学与物理基准测试中平均得分为 66.7%,高于最强单模型单独作答的 48.8%,也高于完美路由器的 59.0%。