NVIDIAのSkill2Env、公開Agent Skillsを7,971件のターミナルタスクにコンパイル
Codexのプランナーとクリエイターが各スキルを検証済みのターミナルワークフローに変え、そのスキル自身の品質基準から取ったルーブリックを使う。結果のみの強化学習でQwen3.8-27BはTerminal-Bench 2.1の成績を49.4%から54.1%に上げた。ルーブリックを加えると50.1%にとどまったが、軌跡の比較ではより多く選ばれた。
Codexのプランナーとクリエイターが各スキルを検証済みのターミナルワークフローに変え、そのスキル自身の品質基準から取ったルーブリックを使う。結果のみの強化学習でQwen3.8-27BはTerminal-Bench 2.1の成績を49.4%から54.1%に上げた。ルーブリックを加えると50.1%にとどまったが、軌跡の比較ではより多く選ばれた。