Prime IntellectがPrime Inferenceを発表 PPrime Intellect1時間4分前 Prime IntellectがPrime Inferenceを発表した。同社によると、強化学習や顧客の専用デプロイ向けにすでに数兆トークンを処理したという。 #prime-intellect#prime-inference#推論#強化学習
Hugging Face Hub、強化学習環境のホスティングに対応強化学習環境をHugging Face Hub上で直接ホストできるようになり、既存のデータセット基盤を活用して、フレームワークをまたいだ保存、バージョン管理、アクセス制限、プレビューが可能になった。
CMUの論文、ソルバーを変えずにエージェントのハーネスを編集する4B提案モデルを訓練このハーネス学習論文は強化学習を用いて、提案モデルがタスク、現在のハーネス、実行レポートからハーネスコードを修正する。訓練された4B提案モデルはReasoning Gymの単一ステップ改訂で35B教師モデルを上回り、HotpotQAでの訓練はMuSiQueと2WikiMultihopQAに転移する。
Amazon AGIの論文がエージェント向け強化学習環境のAutoGymを提案Amazon AGIの論文はAutoGymを提案している。AutoGymは、小さなドメインシードまたは過去のモデル軌跡から、エージェントのタスク、実行可能な環境、検証器をまとめて作成する。
Critical-State RLは結果を変えるツール呼び出しだけを学習するDAIR.AIは、後の報酬を変える行動にあたるマルチターンのツール呼び出しを切り分け、その呼び出しだけを更新するSalesforce AI Researchの手法を説明している。BFCL v4のmissing-functionタスクでは、選んだターンを学習すると約14ポイント上がる。