VeriHarness 將基礎模型變成用於長週期智能體任務的驗證器
Google 論文 VeriHarness 將同一個基礎模型變成承擔兩項工作的智能體驗證器。一項透過檢查工作區證據,解決抽樣智能體 rollout 之間存在分歧的主張。另一項質疑所有 rollout 都同意的主張,並尋找它們共同遺漏的要求。論文稱,一致可能掩蓋共同錯誤,而分歧往往指向正確選項。
在五個長週期基準上,論文報告了所測試基線中的最佳選擇分數。透過有證據支持的修訂,它在 Gemini 3.5 Flash 上較單次 rollout 增加 6.2 分,在 Claude Opus 4.8 上增加 6.4 分。作者亦發布約 26,000 次 rollout。論文發布於 arXiv。