Google AI 推出 Gemini 3.8 Flash TTS 及 Gemini 3.8 Flash-Lite TTS
Google AI 推出 Gemini 3.8 Flash TTS 及 Gemini 3.8 Flash-Lite TTS,並稱之為迄今最具表現力的音訊模型。兩款模型可在逾 100 種語言中建立自訂聲音,或使用逾 2,000 個現成聲音。它們可引導來回對話、逐句調整表達,並加入笑聲或表示正在聆聽的「mhm」等提示。Google AI 表示,模型可生成數小時穩定、無故障的音訊。
Gemini 3.8 Flash TTS 用於由零開始設計聲音角色,並提供逐句控制,面向遊戲、有聲書及 podcast 等高保真製作。Gemini 3.8 Flash-Lite TTS 則可自動調整語氣與節奏,適用於近乎即時的語音代理,以及講求成本效益的大批量配音和批量音訊。