Adithya S K 發布 SmolDataEnvs,收錄逾 5,000 項可驗證的強化學習任務
SmolDataEnvs 是一套開源任務集,收錄逾 5,000 項可驗證的強化學習環境任務,用於在程式與數據科學領域對小型模型進行爬山式優化。今次發布包括環境、評估與訓練內容。
SmolDataEnvs 是一套開源任務集,收錄逾 5,000 項可驗證的強化學習環境任務,用於在程式與數據科學領域對小型模型進行爬山式優化。今次發布包括環境、評估與訓練內容。
Salesforce AI Research 在發現雙向獎勵錯誤後,將該資料集的乾淨比例定為 35.8%,另外兩個分別為 10.1% 和 3.3%。作者表示,用於過濾有缺陷環境的 RIVER,在使用少於 TMax 30% 環境的情況下,把 Terminal-Bench-Lite 上的 RL 增益提高 106%,把 Terminal-Bench v2.1 上的增益提高 30%。
Codex 規劃器與建立器把每項技能轉成經過測試的終端機工作流程,評分標準取自該技能本身的質素準則。只看結果的強化學習把 Qwen3.8-27B 在 Terminal-Bench 2.1 的表現由 49.4% 提升至 54.1%;加入評分標準後則達 50.1%,但在軌跡比較中勝出更多。