PrimeScientist 较 AutoResearch 奖励高 10.3%,研究尝试少 50.6%
DAIR.AI 介绍了 PrimeScientist。它用自适应 MCTS 策略决定研究智能体把预算花在何处。在相同预算下的 12 项 AI 研究任务中,报告显示其奖励比 AutoResearch 高 10.3%,研究尝试少 50.6%。
DAIR.AI 介绍了 PrimeScientist。它用自适应 MCTS 策略决定研究智能体把预算花在何处。在相同预算下的 12 项 AI 研究任务中,报告显示其奖励比 AutoResearch 高 10.3%,研究尝试少 50.6%。
他将这一结果归功于 SliceAttention 内核和 BatchedMuon,目前使用 Transolver,并称完整训练从 26 小时降至 22 小时,误差和质量没有显著变化。