# NVIDIA 論文提出 VERA 架構，協同演進 Agent Harness 與模型

NVIDIA 一篇研究論文介紹了 VERA 系統。該系統將基準軌跡轉化為 9,000 多個具備評分標準的可重啟沙盒，同時協同演進 Agent Harness 與模型權重。團隊開源了該環境語料庫，並表示 27B Agent 在 AutoCoWorkBench 取得 71.6 分，超越 Claude Opus 4.8。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/10433a5ea5fa405a9d584306.html

Content language: zh-HK
Localization state: translated

來源：elvis · 發布於 7/10/2026 23:30:48

VERA 將基準軌跡轉換為超過 9,000 個具備評分標準的可重啟沙盒，僅保留能夠執行且可依可觀察證據評估的環境。訓練期間，該架構同步協同演進 Agent Harness 與模型權重。Harness 的修改只有在通過自我測試且在開發集上取得至少 5 分提升時才會保留；若模型 Checkpoint 的表現下跌超過 20%，則會被捨棄。

根據[研究論文](https://arxiv.org/abs/2610.05923)，9B 協同演進 Agent 在 AutoCoWorkBench 和 AutoMedBench 上的表現，分別比最強的單軸基準高出 10.3 分與 13.0 分。在 27B 規模下，該 Agent 在 AutoCoWorkBench 取得 71.6 分，超越 Claude Opus 4.8。NVIDIA 現已開源該環境語料庫。

Tags: NVIDIA, AI Agent, 基準測試, 開源

[查看主帖原文](https://x.com/omarsar0/status/2107849444897243141)
