Harness-Zero 在去掉专用 harness 后将宏观任务成功率提高到 44.3%
Google 与合作者的一篇论文研究 agent harness 能否被蒸馏进模型。Harness-Zero 只在训练中保留优化后的 harness。由于优化后的 harness 与部署用 harness 使用不同的动作空间,一个由优化后的 harness 引导的 harnessing agent 会在学生的响应运行前,于部署动作空间中加以纠正,这些纠正后的运行成为训练示范。
去掉专用 harness 后,宏观任务成功率从 23.3% 升至 44.3%,高于基座模型挂上该 harness 时达到的 41.7%。在知识工作、工具使用和科学领域中由 harness 诱导的 28 项行为里,平均有 82.3% 被恢复。对使用同一套演化 harness 的前沿模型,agent-as-harness 形式也优于 code-as-harness 形式。论文为 arXiv:2609.24974。