AssemblyAI、Universal 3.6 Pro Realtime の提供開始を発表
AssemblyAI は、Universal 3.6 Pro Realtime が公開されたと述べている。同社によると、2件の独立した評価では、すべてのストリーミング音声モデルが同じ音声と同じテストハーネスで実行され、Universal 3.6 Pro Realtime が両方で首位だった。
trydaily の Pipecat オープン音声認識ベンチマークについて、AssemblyAI は同モデルがパレートフロンティア上にあると述べている。covaldev のライブリーダーボードでは、実際の音声エージェント音声において、どのストリーミングモデルよりも単語誤り率が低いと同社は述べている。
AssemblyAI によると、「No」「Nah」「Nuh-uh」などの短い返答は、静かな通話だけでなく、騒がしい部屋や電話回線でも 98.5% の割合で正しく聞き取られる。テレビ、同僚、近くの席からの背景音声は文字起こしに入らないという。同社はさらに、1つのエンドポイントから自動検出で 32 言語に対応し、発話の途中で言語を切り替える発信者も含むと述べている。また、エンティティを考慮したエンドポイント判定を使い、発信者が話し終えた時点でターンを終え、電話番号を伝えている間はターンを開いたままにする。AssemblyAI は、実際の音声エージェントと電話の会話、数万時間で学習したと述べている。