elvis: StepFun Step 5 Previewが2つの実際のコーディングタスクでGLM 5.3と並んだ
elvis(@omarsar0)は、StepFunの新しいStep 5 Previewモデルをコーディングエージェントとして早期テストしたと述べている。彼はこれをGLM 5.3、Kimi K3などと同等で、競争力のある価格だと説明し、最小限のハーネスでGLM 5.3と対比してテストしたとしている。また、「コスト対能力のパレートフロンティア上」にあるとも評している。投稿では、提携してくれたStepFunチームに感謝している。
彼は、同じリポジトリの同じコミットで両モデルに2つの実際のタスクを与えたと報告している。数値フィルタが小数や負の数に対して黙ってゼロ行を返すバグと、新しいルート、権限ゲーティング、バックグラウンドタスクスーパーバイザーのリファクタが必要な機能である。彼によると、両モデルは両方のタスクを正しくこなし、すべてのホールドアウトテストが回帰なしで合格し、どちらもフォローアッププロンプトや再試行を受けなかった。Step 5 Previewは作業を終えて確認し、両方の回で完了を宣言した一方、GLM 5.3は正しいコードを書いた後、ステップ制限で実行が終わるまで続けた。バグについては、Step 5 Previewがより短いパッチを書き、実際のDatasetteメンテナのコミットのアプローチと一致し、頼まれずに独自のテストを追加したという。
別の長文脈テストでは、約368Kトークンの偽のインシデントチケットを生成し、障害を説明する5つの手がかりを隠したという。根本原因を尋ねると、Step 5 Previewは約90秒ですべての5つの手がかりを見つけ、正しく結びつけた。これに基づき、彼は速度より明確な完了シグナルが重要な無人エージェント実行、馴染みのないコードベースでのバグ修正、長文脈作業でこれを選ぶだろうと述べている。