Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型
Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多说话人对话与 70 多种语言。该模型引入了音频标签功能,允许用户在输入文本中嵌入自然语言指令来精确控制语音风格、语速与停顿,在 Artificial Analysis TTS 榜单上取得了 1211 的 Elo 分数。
推荐理由:模型引入自然语言音频标签来实现句中语气与语速控制,为开发者精细调节多角色拟真对话提供了直接参考。