StepFun 发布 StepAudio 3 ASR,AA-WER Index 词错误率为 1.7%
Artificial Analysis 称,StepFun 已发布语音转文字模型 StepAudio 3 ASR,可通过 StepFun API 进行非流式转写。这是首个登上 Artificial Analysis 非流式语音转文字排行榜榜首的 StepFun 模型,在 AA-WER Index 上的词错误率为 1.7%,与阿里巴巴 Fun-Realtime-ASR-preview 的 1.7% 基本持平。Artificial Analysis 记录的 StepAudio 2.5 ASR 词错误率为 4.7%。
在 Artificial Analysis 的留出语音智能体数据集 AA-AgentTalk 上,StepAudio 3 ASR 的词错误率为 1.4%。在长音频 Earnings22 电话会议中为 2.8%,落后于 Fun-Realtime-ASR-preview 的 1.8%。
Artificial Analysis 测得其转写速度为实时的 88 倍,落后于 MAI-Transcribe-2 的 374 倍、Smallest AI Pulse Pro 的 285 倍和 Grok Voice Transcribe 2.0 的 154 倍。这一速度与 ElevenLabs Scribe v2 的 84 倍、Gemini 3.5 Transcribe 的 91 倍大致相当,并领先于 Fun-Realtime-ASR-preview 的 20 倍。StepAudio 3 ASR 价格为每小时 0.40 美元,即每 1,000 分钟 6.67 美元。Artificial Analysis 称,它是准确率最高的五个模型中最贵的;MAI-Transcribe-2 和 Grok Voice Transcribe 2.0 为每 1,000 分钟 1.67 美元,ElevenLabs Scribe v2 为每 1,000 分钟 3.67 美元。