Did Codex Reset
GitHub

StepFunがStepAudio 3 ASRを公開、AA-WER IndexのWERは1.7%

Artificial Analysis

Artificial Analysisによると、StepFunは音声認識モデルStepAudio 3 ASRを公開した。StepFun API経由で非ストリーミングの文字起こしに利用できる。Artificial Analysisの非ストリーミング音声認識リーダーボードで首位に達した初のStepFunモデルで、AA-WER Indexの単語誤り率は1.7%、AlibabaのFun-Realtime-ASR-previewの1.7%と実質同率だ。Artificial Analysisが記録したStepAudio 2.5 ASRのWERは4.7%だった。

Artificial Analysisがホールドアウトした音声エージェント用データセットAA-AgentTalkでは、StepAudio 3 ASRのWERは1.4%。長尺のEarnings22通話では2.8%で、1.8%のFun-Realtime-ASR-previewに及ばない。

Artificial Analysisが測定した文字起こし速度は実時間の88倍で、MAI-Transcribe-2の374倍、Smallest AI Pulse Proの285倍、Grok Voice Transcribe 2.0の154倍を下回る。ElevenLabs Scribe v2の84倍、Gemini 3.5 Transcribeの91倍とほぼ同水準で、Fun-Realtime-ASR-previewの20倍を上回る。StepAudio 3 ASRの料金は1時間あたり0.40ドル、1,000分あたり6.67ドル。Artificial Analysisは、精度上位5モデルの中で最も高いとしている。MAI-Transcribe-2とGrok Voice Transcribe 2.0は1,000分あたり1.67ドル、ElevenLabs Scribe v2は1,000分あたり3.67ドルだ。