Did Codex Reset
GitHub

QwenがQwen-Audio-3.1を発表し、TTS、Realtime、ASRの価格を引き下げ

Qwen

Qwenは、音声の理解、生成、対話、制作を担う5モデルとしてQwen-Audio-3.1を発表した。ASR、TTS、Realtimeを更新し、ASR-NextとTTS-Nextを加えた。Qwenによると、ラインアップ全体で価格が下がり、TTSは約70%、Realtimeは約85%、ASRは最大95%の値下げとなる。

Qwenによると、更新後のASRは多言語と方言の認識が強化され、フィラーや繰り返しを除く整形を備え、より整理され論理的な文字起こしを出す。ASR-Nextは話者ラベル、タイムスタンプ、整列済み文字起こし付きの複数話者文字起こしに対応し、感情、環境音、機械音を認識して、キャプション付け、事象の位置特定、音声での質問応答と推論に使えるとしている。TTSは多言語と方言の合成、言語をまたぐ声の変換、感情・速度・スタイルの指示による制御に対応する。TTS-Nextは言語モデルと拡散モデルを組み合わせ、音声、効果音、背景音を一度に生成し、オーディオブック、ポッドキャスト、ゲーム、広告に使う。Realtimeは同時に話し聞き、任意の時点で割り込みを受け、気分の落ち込みを検知すると速度を落としてより共感的に応答すると説明されている。

Qwen-Audio-3.1-ASRとQwen-Audio-3.1-Realtimeがqwencloud.comに掲載されている。Qwenによると、さらにAPIが近日公開される。