Harness-Zero 在移除專用 harness 後,將宏觀任務成功率提升至 44.3%
Google 與合作者的論文研究,能否把 agent harness 蒸餾進模型。Harness-Zero 只在訓練階段保留優化後的 harness。由於優化 harness 與部署 harness 使用不同的動作空間,一個由優化 harness 引導的 harnessing agent 會在學生的回應執行前,於部署動作空間中加以修正,而這些修正後的運行會成為訓練示範。
移除專用 harness 後,宏觀任務成功率由 23.3% 升至 44.3%,高於基礎模型掛上 harness 時達到的 41.7%。在知識工作、工具使用與科學領域共 28 項由 harness 誘發的行為中,平均有 82.3% 被恢復。對使用同一套演化 harness 的前沿模型而言,agent-as-harness 形式亦勝過 code-as-harness 形式。論文為 arXiv:2609.24974。