ActiveSaddler、エージェントハーネスを最適化しながらシナリオを適応させる
ActiveSaddler は繰り返し起こる失敗を失敗パターンにまとめ、各パターンを非定常バンディットのアームとして扱う。ハーネスが各パターンからどれだけ学べるかを追跡し、既知の弱点の再訪と新しい弱点の発見の間で予算を配分する。
DAIR.AI によると、現在のハーネス最適化器はハーネスの更新方法を変えるが、訓練シナリオは固定したままだ。そのため、ハーネスの改善につれて情報量がなくなるタスクからフィードバックが得られ続ける。ActiveSaddler はそれらのシナリオも適応させる。同じ最適化器で、固定シナリオ順と比べてテスト Pass@1 が GAIA2 では 4.4 ポイント、Terminal-Bench 2.0 では 7.5 ポイント向上する。論文は ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization。