SuryaがRLの学習実行を配信
Suryaは、自身の強化学習の学習実行をbrusharena.art/liveで配信していると述べている。この配信はLuoFuliに着想を得たものだ。
Suryaは、自身の強化学習の学習実行をbrusharena.art/liveで配信していると述べている。この配信はLuoFuliに着想を得たものだ。
OpenAIは、フロンティア強化学習の訓練実行をどのように安全確保するかについての考え方を記したページを公開した。URLはフロンティアAI訓練のセーフティケースに関するもの。
Amazon AGIの論文はAutoGymを提案している。AutoGymは、小さなドメインシードまたは過去のモデル軌跡から、エージェントのタスク、実行可能な環境、検証器をまとめて作成する。
DAIR.AIは、後の報酬を変える行動にあたるマルチターンのツール呼び出しを切り分け、その呼び出しだけを更新するSalesforce AI Researchの手法を説明している。BFCL v4のmissing-functionタスクでは、選んだターンを学習すると約14ポイント上がる。
SmolDataEnvsは、コードとデータサイエンスで小規模モデルをヒルクライミングするための、検証可能な強化学習環境タスク5,000件超からなるオープンソースのセットです。公開内容には環境、評価、学習が含まれます。
Salesforce AI Researchは、そのコレクションのクリーン率を35.8%、ほか2件を10.1%と3.3%とした。報酬の誤りは両方向で見つかった。著者らによると、欠陥のある環境を除外するRIVERは、TMaxの環境の30%未満しか使わずに、Terminal-Bench-LiteでのRLの向上幅を106%、Terminal-Bench v2.1で30%増やした。