StepFun 發布 StepAudio 3 ASR,AA-WER Index 詞錯率為 1.7%
Artificial Analysis 表示,StepFun 已發布語音轉文字模型 StepAudio 3 ASR,可透過 StepFun API 作非串流轉錄。這是首個登上 Artificial Analysis 非串流語音轉文字排行榜榜首的 StepFun 模型,在 AA-WER Index 的詞錯率為 1.7%,與阿里巴巴 Fun-Realtime-ASR-preview 的 1.7% 實質並列。Artificial Analysis 錄得 StepAudio 2.5 ASR 的詞錯率為 4.7%。
在 Artificial Analysis 留出測試的語音代理數據集 AA-AgentTalk 上,StepAudio 3 ASR 的詞錯率為 1.4%。在長篇 Earnings22 通話上為 2.8%,落後於 Fun-Realtime-ASR-preview 的 1.8%。
Artificial Analysis 測得其轉錄速度為即時的 88 倍,落後於 MAI-Transcribe-2 的 374 倍、Smallest AI Pulse Pro 的 285 倍及 Grok Voice Transcribe 2.0 的 154 倍。這大致與 ElevenLabs Scribe v2 的 84 倍及 Gemini 3.5 Transcribe 的 91 倍相若,並領先 Fun-Realtime-ASR-preview 的 20 倍。StepAudio 3 ASR 費用為每小時 0.40 美元,即每 1,000 分鐘 6.67 美元。Artificial Analysis 稱其為五個最準確模型中最貴的一款;MAI-Transcribe-2 與 Grok Voice Transcribe 2.0 為每 1,000 分鐘 1.67 美元,ElevenLabs Scribe v2 為每 1,000 分鐘 3.67 美元。