Did Codex Reset
GitHub

Meta AI, 장기 연구 에이전트를 위한 MIRA 아키텍처 공개

DAIR.AI

arXiv 논문에서 Meta AI 연구진은 장기 과제 수행 중 연구 에이전트가 다음으로 탐색할 대상을 결정하도록 돕는 아키텍처 MIRA를 제안했다. 긴 실행 궤적 속 희소한 결정으로부터 학습하기 어려운 문제를 해결하기 위해, MIRA는 영구적인 연구 기록을 읽고 작업 지시를 내리는 외부 메타 추론기와 각 지시를 수행하는 신규 실행기로 에이전트를 분리한다.

의사결정은 작업 지시 경계에서만 일어나므로, 연구진은 해당 지점에서 남은 보상을 예측하도록 크리틱(Critic)을 훈련한 뒤 부분적 진행 상황을 평가하고 다음 작업을 선택하는 통합 액터-크리틱 모델(MIRA-AC)을 구축했다. 이러한 구조적 분리는 별도 훈련 없이도 정리 증명과 개방형 아키텍처 연구 성능을 높였으며, 모델의 대리 신호로 훈련된 MIRA-AC는 4개 자동 연구 환경 전반에서 골드 스코어를 개선했다.