Meta AI 推出面向長週期研究智能體的 MIRA 架構
在一篇 arXiv 論文 中,Meta AI 研究人員提出了 MIRA 架構,旨在協助研究智能體在長週期任務中決定下一步要探索的方向。為了解決在漫長執行軌跡中難以從稀疏決策中學習的難題,MIRA 將智能體拆分為兩部分:負責讀取持久研究記錄並發布工單的外部元推理器,以及執行每項工單的全新執行器。
由於決策僅在工單邊界發生,研究人員在這些節點訓練了一個 Critic 來預測剩餘回報,隨後構建了統一的 Actor-Critic 模型(MIRA-AC),用以評估階段進展並選擇下一項任務。這種架構分離在未經訓練的情況下提升了定理證明與開放式架構研究的表現;而基於該模型代理信號訓練的 MIRA-AC 則在四個自動研究環境中提高了黃金標準評分。