Did Codex Reset
GitHub

QQ·微信群

NVIDIA 論文提出 VERA 架構,協同演進 Agent Harness 與模型

elvis

VERA 將基準軌跡轉換為超過 9,000 個具備評分標準的可重啟沙盒,僅保留能夠執行且可依可觀察證據評估的環境。訓練期間,該架構同步協同演進 Agent Harness 與模型權重。Harness 的修改只有在通過自我測試且在開發集上取得至少 5 分提升時才會保留;若模型 Checkpoint 的表現下跌超過 20%,則會被捨棄。

根據研究論文,9B 協同演進 Agent 在 AutoCoWorkBench 和 AutoMedBench 上的表現,分別比最強的單軸基準高出 10.3 分與 13.0 分。在 27B 規模下,該 Agent 在 AutoCoWorkBench 取得 71.6 分,超越 Claude Opus 4.8。NVIDIA 現已開源該環境語料庫。