스탠퍼드와 Together AI 논문에서 세 모델의 자기조직화 팀이 평균 66.7%를 기록
DAIR.AI는 스탠퍼드와 Together AI의 논문이 o3-mini, Claude Sonnet 4, DeepSeek-V3를 자기조직화 팀으로 시험했다고 전했다. 수학·물리 벤치마크 다섯 개에서 팀 평균은 66.7%였다. 가장 강한 구성원 단독 점수는 48.8%였고, 구성원들의 독립 답변 가운데 고르는 완벽한 라우터는 59.0%를 기록했다.
AIME 2026에서 팀은 71.2%에 도달해 해당 라우터보다 13.4점 높았다. 한 구성원이 팀의 이전 대화를 검토하고 역할, 토론 단계 순서, 참여자, 부분 답변의 결합 방식을 포함하는 협업 전략을 다시 쓴다. 이 전략은 AIME 2024 문제 15개에서 학습된 뒤, 남겨 둔 AIME 2024 문제와 새로운 벤치마크 네 개에 변경 없이 적용됐다.