Qwen, Qwen-Audio-3.1을 공개하고 TTS·Realtime·ASR 가격을 인하
Qwen은 오디오 이해, 생성, 상호작용, 창작을 다루는 다섯 개 모델로 Qwen-Audio-3.1을 공개했다. ASR, TTS, Realtime는 업그레이드됐고, 라인업에 ASR-Next와 TTS-Next가 추가됐다. Qwen은 라인업 전반의 가격이 낮아졌다고 밝혔으며, TTS는 약 70%, Realtime는 약 85%, ASR은 최대 95% 인하됐다.
Qwen은 업그레이드된 ASR이 다국어와 방언 인식에서 더 강해졌고, 필러와 반복을 제거해 더 깔끔하고 논리적인 전사본을 만드는 다듬기 기능을 포함한다고 밝혔다. ASR-Next는 화자 라벨, 타임스탬프, 정렬된 전사본을 갖춘 다중 화자 전사를 지원하며, 캡션, 이벤트 위치 특정, 오디오 질의응답, 추론을 위해 감정, 주변 소리, 기계음을 인식하는 것으로 소개됐다. TTS는 다국어·방언 합성, 교차 언어 음성 변환, 감정·속도·스타일의 지시 기반 제어를 다룬다. TTS-Next는 언어 모델과 디퓨전을 결합한 구성으로 음성, 효과음, 배경 오디오를 한 번에 생성하며, 오디오북, 팟캐스트, 게임, 광고에 쓰인다. Realtime는 말하기와 듣기를 동시에 하고, 어느 지점에서든 끼어들 수 있으며, 낮은 기분을 감지하면 속도를 늦추고 더 공감하는 응답을 하는 것으로 설명됐다.
Qwen-Audio-3.1-ASR와 Qwen-Audio-3.1-Realtime이 qwencloud.com에 등록돼 있다. Qwen은 더 많은 API가 곧 나온다고 밝혔다.