StepFun, AA-WER Index에서 WER 1.7%의 StepAudio 3 ASR 공개
Artificial Analysis는 StepFun이 StepAudio 3 ASR를 공개했다고 밝혔다. 이 음성-텍스트 모델은 StepFun API를 통해 비스트리밍 전사에 사용할 수 있다. StepFun 모델 가운데 Artificial Analysis의 비스트리밍 음성-텍스트 리더보드 정상에 오른 것은 이번이 처음이다. AA-WER Index의 단어 오류율은 1.7%로, Alibaba의 Fun-Realtime-ASR-preview 1.7%와 사실상 동률이다. Artificial Analysis가 기록한 StepAudio 2.5 ASR의 WER은 4.7%였다.
Artificial Analysis의 홀드아웃 음성 에이전트 데이터셋 AA-AgentTalk에서 StepAudio 3 ASR의 WER은 1.4%다. 장문 Earnings22 통화에서는 2.8%로, Fun-Realtime-ASR-preview의 1.8%에 못 미친다.
Artificial Analysis가 측정한 전사 속도는 실시간의 88배로, MAI-Transcribe-2의 374배, Smallest AI Pulse Pro의 285배, Grok Voice Transcribe 2.0의 154배보다 느리다. ElevenLabs Scribe v2의 84배, Gemini 3.5 Transcribe의 91배와 대체로 비슷한 수준이고, Fun-Realtime-ASR-preview의 20배보다는 앞선다. StepAudio 3 ASR 요금은 시간당 0.40달러, 즉 1,000분당 6.67달러다. Artificial Analysis는 이를 정확도가 가장 높은 다섯 모델 가운데 가장 비싼 모델이라고 했다. MAI-Transcribe-2와 Grok Voice Transcribe 2.0은 1,000분당 1.67달러, ElevenLabs Scribe v2는 1,000분당 3.67달러다.