跳到正文
原文
Google DeepMind·· 2026-04-16精选AI 评分75

Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

Gemini 3.1 Flash TTS: the next generation of expressive AI speech

AI 导读

Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多说话人对话与 70 多种语言。该模型引入了音频标签功能,允许用户在输入文本中嵌入自然语言指令来精确控制语音风格、语速与停顿,在 Artificial Analysis TTS 榜单上取得了 1211 的 Elo 分数。

推荐理由

模型引入自然语言音频标签来实现句中语气与语速控制,为开发者精细调节多角色拟真对话提供了直接参考。

来源:Google DeepMind · deepmind.google