
Google正式推出两款全新的Gemini文本转语音(TTS)模型——Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。这两款模型即日起已在Gemini API和Google AI Studio上线,成为本月早些时候发布的Gemini 3.8家族新成员。Google表示,此次更新旨在将语音生成从静态预设升级为动态创意工作室。
提示词定制与精细控制
Flash TTS专为游戏、有声书和播客等创意场景设计,支持通过自然语言提示词从头创建声音。用户可详细描述角色的身份、口音及特征,系统支持超过100种语言和方言。Google展示的示例包括“墨尔本高能量DJ”和“日本龙”。此外,用户还可从包含2000多种现成声音的库中选择,涵盖墨西哥西班牙语、魁北克法语等地区变体,并支持保存自定义声音以便复用。未来还将推出声音重混功能,允许调整音色、音高、语速和口音。
Flash-Lite TTS则定位为更具成本效益的大规模解决方案,主要面向配音和语音代理领域。两款模型均支持通过舞台指示逐行指导台词演绎,能够处理长达数小时的音频,并可在单个脚本中生成双人场景。脚本中还可嵌入笑声、叹息或“嗯”等简短插话提示,以增强表现力。
30秒声音克隆与安全机制
Flash TTS支持仅用30秒音频样本重建声音。为确保安全,Google强制要求用户提供声源所有者的口头同意录音,系统会在生成前验证参考说话人匹配度。所有由Gemini音频模型生成的片段均带有SynthID水印,克隆声音还附带C2PA内容凭证,以保障内容来源的可追溯性。
基准测试领先与生态集成
Google数据显示,Flash TTS在Hume AI的语音设计基准测试中以71.4分位居第一,Flash TTS和Flash-Lite TTS在整体质量指数中分列前两名。在Voice Arena的盲测偏好测试中,这两款模型在日语、印地语和墨西哥西班牙语等语种中同样表现领先。
尽管面临ElevenLabs、Murf AI以及Adobe Firefly等竞争对手,Google已宣布Figma、HeyGen、Wondercraft、Linguana、99.co和Ollang等公司正在集成新模型。后续,Flash TTS将登陆Gemini Notebook,Flash-Lite TTS将接入Google Vids,企业用户通过Gemini Enterprise访问的功能也将于近期推出。