elvis: StepFun Step 5 Preview가 실제 코딩 작업 2건에서 GLM 5.3과 맞먹었다
elvis(@omarsar0)는 StepFun의 새로운 Step 5 Preview 모델을 코딩 에이전트로 조기 테스트했다고 말한다. 그는 이 모델이 GLM 5.3, Kimi K3 등과 견줄 만하고 가격도 경쟁력이 있다고 설명하며, 최소한의 하네스에서 GLM 5.3과 비교 테스트했다고 말한다. 또한 이를 “비용 대비 성능의 파레토 프론티어”에 있다고 평가한다. 해당 게시물은 파트너십을 맺어 준 StepFun 팀에 감사를 표한다.
그는 두 모델에 동일한 저장소의 동일 커밋에서 실제 작업 2건을 줬다고 보고한다. 하나는 숫자 필터가 소수와 음수에 대해 조용히 0행을 반환하는 버그였고, 다른 하나는 새 라우트, 권한 게이팅, 백그라운드 작업 슈퍼바이저 리팩터가 필요한 기능이었다. 그에 따르면 두 모델 모두 두 작업을 맞혔고, 모든 홀드아웃 테스트가 회귀 없이 통과했으며, 어느 쪽도 후속 프롬프트나 재시도를 받지 않았다. Step 5 Preview는 작업을 마치고 결과를 확인한 뒤 두 번 모두 완료를 선언한 반면, GLM 5.3은 올바른 코드를 작성한 뒤 스텝 한도에 도달해 실행이 끝날 때까지 계속 진행했다. 버그 작업에서 그는 Step 5 Preview가 실제 Datasette 메인테이너 커밋의 접근 방식과 일치하는 더 짧은 패치를 작성했고, 요청받지 않았는데도 자체 테스트를 추가했다고 말한다.
별도의 롱컨텍스트 테스트에서 그는 가짜 장애 티켓 약 368K tokens를 생성하고 장애를 함께 설명하는 단서 5개를 숨겼다고 말한다. 근본 원인을 묻자 Step 5 Preview는 약 90초 만에 단서 5개를 모두 찾아 올바르게 연결했다. 이를 바탕으로 그는 속도보다 명확한 완료 신호가 더 중요한 무인 에이전트 실행, 익숙하지 않은 코드베이스의 버그 수정, 롱컨텍스트 작업에 이 모델을 쓰겠다고 말한다.