Did Codex Reset
GitHub

QQ·微信群

Qwen 推出 Qwen-Audio-3.1,并下调 TTS、Realtime 与 ASR 价格

Qwen

Qwen 推出 Qwen-Audio-3.1,包含五个模型,覆盖音频理解、生成、交互和创作。ASR、TTS 和 Realtime 获得升级,产品线新增 ASR-Next 和 TTS-Next。Qwen 称全线价格下调:TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。

Qwen 称,升级后的 ASR 在多语言和方言识别上更强,并带有润色功能,可去掉填充词和重复内容,使转写更干净、逻辑更清楚。ASR-Next 支持带说话人标签、时间戳和对齐转写的多说话人转写,并被表述为能识别情绪、环境声和机器声,可用于字幕、事件定位、音频问答和推理。TTS 覆盖多语言和方言合成、跨语言音色迁移,以及基于指令控制情绪、语速和风格。TTS-Next 采用语言模型与扩散模型结合的方案,一次生成人声、音效和背景音频,面向有声书、播客、游戏和广告。Realtime 被描述为可以同时说和听,允许随时打断,并在检测到情绪低落时放慢语速、给出更有共情的回应。

Qwen-Audio-3.1-ASR 和 Qwen-Audio-3.1-Realtime 已在 qwencloud.com 列出。Qwen 称更多 API 即将推出。