Surya 正在直播 RL 訓練過程
Surya 表示,其強化學習訓練過程正在 brusharena.art/live 直播。這次直播的靈感來自 LuoFuli。
Surya 表示,其強化學習訓練過程正在 brusharena.art/live 直播。這次直播的靈感來自 LuoFuli。
OpenAI 發布了一個頁面,說明如何看待前沿強化學習訓練運行的安全保障,相關 URL 涉及前沿 AI 訓練的安全論證。
Amazon AGI 的一篇論文提出 AutoGym。它可從少量領域種子或過往模型軌跡出發,同時寫出智能體任務、可執行環境和驗證器。
DAIR.AI 介紹 Salesforce AI Research 的一種方法:找出多輪工具調用中動作會改變後續獎勵的那一次,並只更新該次調用。在 BFCL v4 的 missing-function 任務上,訓練所選輪次大約增加 14 分。
SmolDataEnvs 是一套開源任務集,收錄逾 5,000 項可驗證的強化學習環境任務,用於在程式與數據科學領域對小型模型進行爬山式優化。今次發布包括環境、評估與訓練內容。
Salesforce AI Research 在發現雙向獎勵錯誤後,將該資料集的乾淨比例定為 35.8%,另外兩個分別為 10.1% 和 3.3%。作者表示,用於過濾有缺陷環境的 RIVER,在使用少於 TMax 30% 環境的情況下,把 Terminal-Bench-Lite 上的 RL 增益提高 106%,把 Terminal-Bench v2.1 上的增益提高 30%。