Did Codex Reset
GitHub

QQ·微信群

VeriHarness 將基礎模型變成用於長週期智能體任務的驗證器

elvis

Google 論文 VeriHarness 將同一個基礎模型變成承擔兩項工作的智能體驗證器。一項透過檢查工作區證據,解決抽樣智能體 rollout 之間存在分歧的主張。另一項質疑所有 rollout 都同意的主張,並尋找它們共同遺漏的要求。論文稱,一致可能掩蓋共同錯誤,而分歧往往指向正確選項。

在五個長週期基準上,論文報告了所測試基線中的最佳選擇分數。透過有證據支持的修訂,它在 Gemini 3.5 Flash 上較單次 rollout 增加 6.2 分,在 Claude Opus 4.8 上增加 6.4 分。作者亦發布約 26,000 次 rollout。論文發布於 arXiv。