字号 ·· | 护眼
thenextweb

谷歌新的Gemini TTS模型可以从30秒的音频中克隆声音

“今天,我们为Gemini系列引入两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。”谷歌在公告中写道。

谷歌于周三发布了Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。两款模型从今天起在Gemini API和Google AI Studio中逐步上线。它们加入了谷歌本月早些时候推出的Gemini 3.8系列。

据谷歌介绍,Flash TTS专为游戏、有声书和播客等创意工作打造。Flash-Lite TTS则是更便宜、适合大批量处理的选项,面向配音和语音代理。

通过提示词设计语音 借助Flash TTS,用户可以用自然语言描述角色的身份、口音和特征,从零开始创建新语音,支持100多种语言和方言。谷歌给出的示例包括一位来自墨尔本的高能量DJ和一条日本龙。

用户还可以从超过2000种现成语音的库中挑选,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。自定义语音可以保存下来,在不同项目中重复使用。一项语音混音功能即将推出,可调整音色、音高、节奏和口音。

两款模型都允许用户通过舞台指示逐行指导语音表达。它们支持从单一脚本生成双人对白场景,以及长达数小时的长篇音频。脚本中可以包含笑声、叹息以及“嗯哼”之类的简短插话等提示。

30秒克隆语音 Flash TTS还可以根据30秒的音频样本复刻语音。谷歌表示,用户必须提供语音所有者口头同意的录音,系统会在创建语音前检查该录音是否与参考说话人匹配。

据该公司称,谷歌Gemini Audio模型生成的每一段音频都带有SynthID水印。复刻的语音还带有C2PA内容凭证。

基准测试与合作伙伴方面,谷歌表示Flash TTS在Hume AI的语音设计基准测试中以71.4分排名第一。谷歌称,Flash TTS和Flash-Lite TTS还在Hume AI的整体质量指数中分列第一和第二位。据谷歌介绍,在Voice Arena的盲测偏好测试中,这些模型在日语、印地语和墨西哥西班牙语等语言中均取得了最高排名。

市场上已有ElevenLabs和印度的Murf AI等专业公司,Adobe也在8月将语音生成功能加入了Firefly。谷歌点名Figma、HeyGen、Wondercraft、Linguana、99.co和Ollang为整合这些新模型的公司。

Flash TTS也将登陆Gemini Notebook,Flash-Lite TTS则将进入Google Vids。企业很快可通过Gemini Enterprise获取访问权限。