Google DeepMind·· 2026-04-16精选AI 评分75
Gemini 3.1 Flash TTS 发布,引入细粒度音频标签实现自然语言控制
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
AI 导读
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,引入细粒度音频标签(audio tags)支持自然语言控制语音风格、节奏和表达。该模型支持 70 多种语言,在 Artificial Analysis 基准测试中表现优异,已面向开发者、企业和 Workspace 用户开放预览,所有生成音频均嵌入 SynthID 水印。
推荐理由
引入细粒度音频标签实现自然语言控制,兼顾高音质与低成本,为开发者提供精准表达控制。
来源:Google DeepMind · deepmind.google