Google 今日正式发布两款全新的文本转语音(TTS)模型——Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,旨在将语音生成从静态预设升级为动态创意工作室。此举意在帮助创作者、开发者及企业构建更具表现力的音频体验,并优化 Gemini Notebook 和 Google Vids 等产品的用户体验。

双模型定位:创意深度与规模效率并重

此次发布的两款核心模型各有侧重:

  • Gemini 3.8 Flash TTS:专为深度创意指导和角色设计打造。支持通过自然语言提示从零创建声音,适用于游戏、有声书、播客及互动媒体。用户可对表演提示、节奏、方言转换及背景回应进行精细控制。
  • Gemini 3.8 Flash-Lite TTS:面向大规模、高成本效益场景优化。适用于批量配音、音频内容创作及语音代理,提供对语调、节奏和情感细微差别的高效控制。

这两款模型进一步丰富了 Gemini Audio 家族,与此前发布的 3.5 Live Translate、3.5 Transcribe、3.8 Live 等系列模型形成互补。

从声音设计到逐行表演控制

Gemini 3.8 Flash TTS 提供了完整的“声乐工作室”功能,支持将30个原始声音扩展为无限声音库:

  • 生成式声音设计:通过自然语言提示自定义角色、口音及声音特征,覆盖100多种语言和方言。
  • 庞大声音库:提供2,000多个生产就绪声音,涵盖墨西哥西班牙语、魁北克法语等广泛语言变体。
  • 声音复制与安全:仅需30秒音频样本即可重建声音档案。系统内置同意验证、SynthID 水印和 C2PA 凭证,确保声音所有者权利得到保护。
  • 声音混音(即将推出):支持微调音色、音调、语速和口音,并通过提示词调整特定特征。

在表演控制方面,两款模型均支持逐行指导。用户可编写舞台指示或通过自然脚本引导演绎,实现从冷静客服到低声耳语等多种情绪。模型能在长达数小时的音频中保持高质量语音和角色一致性,最小化说话人漂移。此外,支持原生双角色场景编排,可无缝指导多轮对话,并允许插入非语言线索(如笑声、叹息)以增强真实感。

性能表现与全球多语言支持

在 Hume AI 的 Voice Design Benchmark 中,Gemini 3.8 Flash TTS 以71.4分位居整体第一,口音建模得分60.8分同样领先。在整体质量指数(Overall Quality Index)中,Flash 和 Flash-Lite 分别占据第一和第二位,较 Gemini 3.1 Flash TTS 在长篇幅内容和双角色控制上有显著改进。

Voice Arena 的盲测显示,这两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等关键语言中均获人类偏好前列评价,支持构建高质量的全球多语言语音体验。

安全机制与部署渠道

Google 在声音创建中建立了严格的安全保障。声音复制功能强制要求提供声音所有者的口头同意录音,并通过匹配验证确保授权。所有由 Gemini Audio 生成的音频均嵌入 SynthID 不可见水印,以便检测 AI 生成内容,防止 misinformation。

即日起,开发者可通过 Google AI Studio 体验新功能,利用类似工作区的界面提示声音身份、复制声音或编辑双角色剧本。通过 Gemini API,Agora、LiveKit、Vercel 等平台可轻松部署高性能语音界面。Google 正与 Figma、HeyGen、Linguana 等公司合作,加速模型集成。

可用性现状:

  • Gemini 3.8 Flash TTS:开发者可通过 Gemini API 和 Google AI Studio 使用;企业用户即将通过 Gemini Enterprise API 接入;普通用户可在 Gemini Notebook 中使用。
  • Gemini 3.8 Flash-Lite TTS:开发者可通过 Gemini API 和 Google AI Studio 使用;企业用户即将通过 Gemini Enterprise API 接入;普通用户可在 Google Vids 中使用。