Prime Intellect 推出 Prime Inference PPrime Intellect1小時4分鐘前 Prime Intellect 推出 Prime Inference。該公司表示,該服務已為強化學習及專屬客戶部署處理了數萬億 token。 #prime-intellect#prime-inference#推理#強化學習
CMU 論文訓練 4B 提案模型編輯智能體 harness,唔改求解器呢篇 harness 學習論文用強化學習,令提案模型根據任務、當前 harness 同執行報告修改 harness 代碼。訓練後嘅 4B 提案模型喺 Reasoning Gym 單步修訂上超越其 35B 教師模型,而 HotpotQA 上嘅訓練可轉移到 MuSiQue 同 2WikiMultihopQA。
Amazon AGI 論文提出面向智能體強化學習環境的 AutoGymAmazon AGI 的一篇論文提出 AutoGym。它可從少量領域種子或過往模型軌跡出發,同時寫出智能體任務、可執行環境和驗證器。
Critical-State RL 只訓練會改變結果的那一次工具調用DAIR.AI 介紹 Salesforce AI Research 的一種方法:找出多輪工具調用中動作會改變後續獎勵的那一次,並只更新該次調用。在 BFCL v4 的 missing-function 任務上,訓練所選輪次大約增加 14 分。