Gemini 3.8 Flash TTSがArtificial Analysisの発音ロバスト性ベンチマークで首位
Artificial Analysisによると、GoogleはGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。いずれもプリセット音声と音声複製に対応するGoogle DeepMindのテキスト読み上げモデルだ。Gemini 3.1 Flash TTSは公開時点でPronunciation Robustness Benchmarkの首位だった。Artificial Analysisは現在、Gemini 3.8 Flash TTSを首位とし、Provider Voice ArenaではGemini 3.1 Flash TTSを64 Eloポイント上回ると位置づけている。
Provider Voice Arenaでは、Gemini 3.8 Flash TTSがElo 1,263で2位に初登場し、1,272のSonic 3.6に次ぎ、1,260のQwen-Audio-3.0-TTS-Plusを上回った。Gemini 3.8 Flash-Lite TTSはElo 1,236で6位に初登場し、Simba 3.2の1ポイント下だった。いずれもElo 1,199のGemini 3.1 Flash TTSより上位だ。発音ロバスト性では、Gemini 3.8 Flash TTSが89.5%で、88.2%のGemini 3.1 Flash TTS、87.6%のSpaceXAI TTS、87.4%のGemini 3.8 Flash-Lite TTSを上回った。Artificial Analysisによると、これによりGoogleの3モデルが上位4位以内に入る。
9つの多言語Controlled Voice Arenaでは、Gemini 3.8 Flash-Lite TTSが日本語で1位、アラビア語で2位、ドイツ語で3位に初登場し、Gemini 3.8 Flash TTSは日本語とポルトガル語で2位だった。Artificial Analysisの測定では、Gemini 3.8 Flash TTSは毎秒44.1文字でリアルタイムの約2.7倍、Gemini 3.8 Flash-Lite TTSは毎秒40.2文字でリアルタイムの約2.4倍だった。価格は、100万文字あたりGemini 3.8 Flash TTSが32.98ドル、Gemini 3.8 Flash-Lite TTSが22.07ドルで、Gemini 3.1 Flash TTSの18.31ドル、Eleven v3の100ドルと比較している。