2026-09-23 · 来源:{'name': '华尔街见闻全球·中继', 'url': 'https://wallstreetcn.com/articles/3782399'}

两款新TTS模型支持从零设计声音、30秒样本克隆与双人对话,已向开发者开放。
谷歌周三推出两款新的文本转语音(TTS)模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS。前者侧重声音表现力,面向有声书、播客、游戏角色与互动媒体等创意场景;后者为大规模、低成本语音生成而优化,覆盖内容配音、音频制作与实时语音代理。语言支持上,Flash TTS达130种,Flash-Lite TTS为101种,二者均可按文字指令调整声音、语速、情绪与对话方式。
声音定制是Flash TTS的核心看点:用户能以自然语言提示词从零设计声音,设定角色、口音与声音特征;也可用约30秒音频样本复制声音,前提是获得声音所有者同意并通过相应验证机制,生成音频将嵌入不可感知的SynthID水印以标识AI内容。在Hume AI的Voice Design Benchmark中,该模型取得71.4分,位居声音设计综合指标第一;两款模型在Hume AI Overall Quality Index中分列第一与第二。谷歌还提供超过2000种即用音色,涵盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。
在"表演"层面,两款模型均支持对每一句台词单独控制,用户可通过脚本指令调节语气、节奏、情绪与停顿;模型支持双人对话,并能在同一脚本中保持不同角色的声音区分,还可生成笑声、叹气等非语言声音以及"嗯""是的"等应答,使输出更接近真实交流。
分发渠道方面,两款模型已通过Gemini API与Google AI Studio向开发者提供,Flash TTS还可用于Gemini Notebook,Flash-Lite TTS已接入Google Vids,面向企业的Gemini Enterprise API支持将于后续推出。谷歌此番更新的定位也很清晰:并非单纯提升语音自然度,而是增强用户对AI声音"设计"与"表演"的控制,让语音生成从固定音色选择,扩展到可定制的角色、场景与多角色对话。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅