Did Codex Reset
GitHub

QQ·微信群

ActiveSaddler 在優化智能體運行框架時調整場景

DAIR.AI

ActiveSaddler 將反覆出現的失敗歸為失敗模式,並把每個模式視為非平穩老虎機中的一個臂。它會追蹤運行框架還能從每個模式中學到多少,並在重訪已知弱點和尋找新弱點之間分配預算。

DAIR.AI 表示,當前的運行框架優化器改變的是運行框架的更新方式,但訓練場景保持固定,因此回饋仍來自那些隨運行框架改進而不再有資訊量的任務。ActiveSaddler 也會調整這些場景。在相同優化器下,與固定場景順序相比,測試 Pass@1 在 GAIA2 上提高 4.4 分,在 Terminal-Bench 2.0 上提高 7.5 分。論文是 ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization。