Surya 正在直播 RL 训练过程
Surya 表示,其强化学习训练过程正在 brusharena.art/live 直播。这次直播的灵感来自 LuoFuli。
Surya 表示,其强化学习训练过程正在 brusharena.art/live 直播。这次直播的灵感来自 LuoFuli。
OpenAI 发布了一个页面,说明如何看待前沿强化学习训练运行的安全保障,相关 URL 涉及前沿 AI 训练的安全论证。
Amazon AGI 的一篇论文提出 AutoGym。它可从少量领域种子或过往模型轨迹出发,同时写出智能体任务、可执行环境和验证器。
DAIR.AI 介绍了 Salesforce AI Research 的一种方法:找出多轮工具调用中动作会改变后续奖励的那一次,并只更新这一次调用。在 BFCL v4 的 missing-function 任务上,训练所选轮次大约增加 14 分。
SmolDataEnvs 是一套开源的可验证强化学习环境任务,数量超过 5000 个,用于在代码与数据科学领域对小模型做爬山式优化。此次发布包含环境、评测和训练。
Salesforce AI Research 将该集合的干净比例定为 35.8%,另外两个分别为 10.1% 和 3.3%,并发现两个方向的奖励错误。作者称,用于过滤缺陷环境的 RIVER 在使用不到 TMax 30% 环境的情况下,使 Terminal-Bench-Lite 上的 RL 增益提高 106%,Terminal-Bench v2.1 上提高 30%。