Did Codex Reset
GitHub

スタンフォードとTogether AIの論文で、自己組織化する3モデルのチームが平均66.7%

DAIR.AI

DAIR.AIによると、スタンフォードとTogether AIの論文は、o3-mini、Claude Sonnet 4、DeepSeek-V3を自己組織化するチームとして検証した。数学と物理の5つのベンチマークで、チームの平均は66.7%だった。最も強いメンバー単体のスコアは48.8%で、各メンバーの独立した解答から選ぶ完全なルーターは59.0%だった。

AIME 2026では、チームは71.2%に達し、そのルーターを13.4ポイント上回った。1人のメンバーがチームのそれまでのやり取りを確認し、役割、議論フェーズの順序、参加者、部分的な解答の統合方法を含むチームワーク戦略を書き換える。これらの戦略はAIME 2024の15問から学習され、その後、未使用のAIME 2024問題と4つの新しいベンチマークへ変更せず適用された。