AssemblyAI Universal 3.5 Pro、15モデルのテストで単語誤り率1.93%
Tarush Agarwalは、同一の音声とパイプラインで15モデルを比較した音声テキスト変換ベンチマークを報告した。Pipecat FLEURSの読み上げ音声1,000件で、AssemblyAI Universal 3.5 Proの単語誤り率は1.93%、最初のテキストまでの中央値は489ミリ秒で、いずれもこのテストで最良の結果だった。
Tarush Agarwalは、同一の音声とパイプラインで15モデルを比較した音声テキスト変換ベンチマークを報告した。Pipecat FLEURSの読み上げ音声1,000件で、AssemblyAI Universal 3.5 Proの単語誤り率は1.93%、最初のテキストまでの中央値は489ミリ秒で、いずれもこのテストで最良の結果だった。
Artificial Analysisは、StepAudio 3 ASRの文字起こし速度係数を実時間の88倍と報告している。3つのより速いシステムより遅く、ElevenLabs Scribe v2およびGemini 3.5 Transcribeに近く、Fun-Realtime-ASR-previewより速い。
Artificial Analysisによると、StepFunのStepAudio 3 ASRはStepFun API経由で非ストリーミングの文字起こしに利用でき、AA-WER IndexのWERは1.7%でAlibabaのFun-Realtime-ASR-previewと同率、StepAudio 2.5 ASRの4.7%から低下した。文字起こし速度は実時間の88倍、料金は1時間あたり0.40ドル。