Did Codex Reset
GitHub

QQ·微信群

elvis:StepFun Step 5 Preview 在两项真实编码任务上与 GLM 5.3 表现相当

elvis

elvis(@omarsar0)称,他提前测试了 StepFun 新推出的 Step 5 Preview 模型作为编码智能体。他将其描述为与 GLM 5.3、Kimi K3 等相当,价格具有竞争力,并称他在一个极简测试框架中将其与 GLM 5.3 进行了对比测试。他还称其处于“成本与能力的帕累托前沿”。该帖感谢 StepFun 团队在此事上的合作。

他报告称,向两个模型布置了同一仓库同一提交上的两项真实任务:一个是数值过滤器对小数和负数静默返回零行的 bug,然后是一个需要新增路由、权限门控并重构后台任务监督器的功能。据他所说,两个模型都正确完成了这两项任务,所有留出测试均通过且无回归,两者都没有收到后续提示或重试。Step 5 Preview 两次都完成工作、检查后并声明自己已完成,而 GLM 5.3 写出正确代码后继续运行,直到步数限制结束该次运行。在该 bug 上,他称 Step 5 Preview 写出了更短的补丁,与真实 Datasette 维护者提交中的做法一致,并且在未被要求的情况下自行添加了测试。

在另一项长上下文测试中,他称生成了约 368K tokens 的虚假事故工单,并隐藏了五条共同解释一次故障的线索;当被询问根本原因时,Step 5 Preview 在约 90 秒内找到了全部五条线索并正确将其关联。基于此,他表示会在明确的完成信号比速度更重要的无人值守智能体运行、不熟悉代码库中的 bug 修复以及长上下文工作中选用它。