# Harness-Aware Distillation 將小型模型 Agent 在 ALFWorld 的成功率提升至 63.4%

一篇研究論文提出 Harness-Aware Distillation 訓練框架，透過對比教師模型的決策，訓練小型語言模型 Agent 利用 harness 資訊。最終訓練出的學生模型在未見過的 ALFWorld 任務上達到 63.4% 成功率，表現超越其 8B 教師模型。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/69ad27f580d24dbfb8438d77.html

Content language: zh-HK
Localization state: translated

來源：elvis · 發布於 7/10/2026 00:57:17

據一篇 [arXiv 論文](https://arxiv.org/abs/2610.02858) 指出，研究人員針對配合執行 harness 運作的小型語言模型 Agent，推出了名為 Harness-Aware Distillation 的框架。該方法分別在提供與不提供 harness 資訊的情況下查詢同一個教師模型，藉此訓練學生模型優先選擇在有 harness 數據時採用的動作。過濾機制會在毋須任務獎勵或成功標籤的情況下，剔除首選動作與 harness 記錄相牴觸的候選數據對。

研究人員發現，單純在 on-policy distillation 中加入 harness 數據，雖令學生模型在 ALFWorld 的 harness 使用率由 65.7% 升至 73.1%，但任務成功率仍停留在 43.1% 至 43.5%。採用 Harness-Aware Distillation 後，學生模型在未見過的 ALFWorld 任務上錄得 63.4% 成功率，超越最佳基準（47.0%）及其 8B 教師模型。受訓後的學生模型亦能擺脫 59.7% 的停滯狀態，相比之下各項基準則徘徊於未訓練學生基準的 46.8% 附近。

Tags: 模型蒸餾, AI Agent, ALFWorld, LLM 研究

[查看主帖原文](https://x.com/omarsar0/status/2107507684270600394)
