Did Codex Reset
GitHub

QQ·微信群

Qwen 推出 Qwen-Audio-3.1,並下調 TTS、Realtime 與 ASR 價格

Qwen

Qwen 推出 Qwen-Audio-3.1,共五個模型,涵蓋音訊理解、生成、互動與創作。ASR、TTS 與 Realtime 已升級,系列並新增 ASR-Next 與 TTS-Next。Qwen 表示全線價格下調:TTS 約減 70%,Realtime 約減 85%,ASR 最高減 95%。

Qwen 表示,升級後的 ASR 在多語言及方言識別上更強,並加入潤飾,去除填充詞與重複內容,讓逐字稿更乾淨、邏輯更清晰。ASR-Next 支援多說話人轉寫,附說話人標籤、時間戳及對齊逐字稿,並被描述為可識別情緒、環境聲與機械聲,用於字幕、事件定位、音訊問答與推理。TTS 涵蓋多語言及方言合成、跨語言聲線遷移,以及按指令控制情緒、語速與風格。TTS-Next 採用語言模型與擴散模型結合的設定,一次生成人聲、音效與背景音,用於有聲書、podcast、遊戲與廣告。Realtime 被描述為可同時說話與聆聽、隨時容許打斷,並在偵測到低落情緒時放慢節奏、以更具同理心的方式回應。

Qwen-Audio-3.1-ASR 與 Qwen-Audio-3.1-Realtime 已列於 qwencloud.com。Qwen 表示更多 API 即將推出。