Did Codex Reset
GitHub

#reinforcement-learning

すべてのAIニュースを見る

Adithya S K、検証可能なRLタスク5,000件超を収めたSmolDataEnvsを公開

SmolDataEnvsは、コードとデータサイエンスで小規模モデルをヒルクライミングするための、検証可能な強化学習環境タスク5,000件超からなるオープンソースのセットです。公開内容には環境、評価、学習が含まれます。

最もきれいな公開ターミナルエージェント向けRLコレクションでも、Salesforce AI Researchの監査を通過したのは35.8%

Salesforce AI Researchは、そのコレクションのクリーン率を35.8%、ほか2件を10.1%と3.3%とした。報酬の誤りは両方向で見つかった。著者らによると、欠陥のある環境を除外するRIVERは、TMaxの環境の30%未満しか使わずに、Terminal-Bench-LiteでのRLの向上幅を106%、Terminal-Bench v2.1で30%増やした。

NVIDIAのSkill2Env、公開Agent Skillsを7,971件のターミナルタスクにコンパイル

Codexのプランナーとクリエイターが各スキルを検証済みのターミナルワークフローに変え、そのスキル自身の品質基準から取ったルーブリックを使う。結果のみの強化学習でQwen3.8-27BはTerminal-Bench 2.1の成績を49.4%から54.1%に上げた。ルーブリックを加えると50.1%にとどまったが、軌跡の比較ではより多く選ばれた。