谷歌正式推出Gemini 3.8 Flash Text-To-Speech (TTS) 和 Flash-Lite TTS模型,旨在突破AI语音合成的表现力瓶颈。相较于传统朗读,新模型能更精准地演绎口音、节奏、情感停顿乃至叹息等细微特征,赋予AI音频更强的“表演”能力。

精细化控制与声音复刻

此次更新的核心在于用户对生成内容的控制权大幅提升。Gemini 3.8 Flash TTS支持通过自然语言描述创建原创声音,覆盖超过100种语言和方言,并提供2,000多种现成的生产级声音选项。

备受关注的声音复刻功能允许用户在获得授权的前提下,仅需提供30秒音频样本即可重现一致的声音形象。模型能够逐行执行关于语调、语速、方言切换、耳语、笑声及对话提示的指令,甚至能从单一脚本中编排双人对白,确保数小时音频中的声音一致性。这将显著改善播客、有声书、配音及语音代理等场景的听感,减少机械生硬感。

基准测试与竞品对比

基准测试数据显示,Gemini 3.8 Flash TTS在Hume AI的Voice Design Benchmark中总体排名第一,口音得分高达60.8分;Flash和Flash-Lite模型则在Hume整体质量指数中包揽前两名。在Voice Arena的多语言测试中,二者表现也位居前列。不过,竞争对手ElevenLabs在单项声音质量和拟人化变化类别中仍保持较高分数。

落地应用与安全合规

目前,Flash TTS已在Gemini Notebook中上线,Flash-Lite TTS则集成至刚刚开放最新Omni视频生成器的Google Vids中。开发者可通过Google AI Studio和Gemini API访问这两款模型。

在安全方面,谷歌设置了严格护栏:系统强制验证同意权限,添加SynthID水印和C2PA凭证。此外,在英国、欧洲经济区(EEA)、印度、德克萨斯州和伊利诺伊州等地区,AI Studio中禁止使用声音复刻功能。

【星途科讯 图文丨略略 首发于ZAKER科技,转载请注明出处】