Prime Intellect 推出 Prime Inference PPrime Intellect1小时5分钟前 Prime Intellect 推出 Prime Inference。该公司表示,该服务已为强化学习及客户专属部署处理了数万亿 token。 #prime-intellect#prime-inference#推理#强化学习
CMU 论文训练 4B 提议模型编辑智能体 harness,不改动求解器这篇 harness 学习论文用强化学习让提议模型根据任务、当前 harness 和执行报告修改 harness 代码。训练后的 4B 提议模型在 Reasoning Gym 的单步修订上超过其 35B 教师模型,且 HotpotQA 上的训练可迁移到 MuSiQue 和 2WikiMultihopQA。
Amazon AGI 论文提出面向智能体强化学习环境的 AutoGymAmazon AGI 的一篇论文提出 AutoGym。它可从少量领域种子或过往模型轨迹出发,同时写出智能体任务、可执行环境和验证器。
Critical-State RL 只训练会改变结果的那一次工具调用DAIR.AI 介绍了 Salesforce AI Research 的一种方法:找出多轮工具调用中动作会改变后续奖励的那一次,并只更新这一次调用。在 BFCL v4 的 missing-function 任务上,训练所选轮次大约增加 14 分。