VeriHarness 將基礎模型變成用於長週期智能體任務的驗證器
Google 論文 VeriHarness 使用同一個基礎模型,檢查有爭議與全體一致的智能體主張。透過有證據支持的修訂,它報告稱,相較單次 rollout,使用 Gemini 3.5 Flash 提升 6.2 分,使用 Claude Opus 4.8 提升 6.4 分。
Google 論文 VeriHarness 使用同一個基礎模型,檢查有爭議與全體一致的智能體主張。透過有證據支持的修訂,它報告稱,相較單次 rollout,使用 Gemini 3.5 Flash 提升 6.2 分,使用 Claude Opus 4.8 提升 6.4 分。