每小时最低0.54美元,谷歌开始“PS”声音

文学城原文

继加码实时语音交互与语音转写后,谷歌又将产品线延伸至声音生成领域。

美国当地时间9月23日,谷歌正式发布Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音(Text-to-Speech)模型。谷歌将其定义为具备高表现力的音频生成模型,旨在推动语音生成从静态的预设音色,向具备深度控制能力的声音设计方向演进。

目前,两款模型已在Gemini API与Google AI Studio中上线,并接入Gemini Notebook与Google Vids,企业级API接入也已同步开启。

此次发布的署名团队中出现了艾伦·考恩(Alan Cowen)的身影。

考恩此前为主打“情感人工智能(Empathic AI)”的科技初创公司Hume AI的创始人,今年加入谷歌DeepMind担任研究科学总监,此次他与集团产品经理利兰·雷基斯(Leland Rechis)共同负责该语音项目的研发与发布。

在ElevenLabs等语音公司持续拓展商业化市场的背景下,谷歌此次发布提升了语音模型的控制能力,也试图借助API和既有产品生态,将语音生成能力推向更多应用场景。

01 从“选声音”到“设计声音”

相比此前主要通过文本提示和音频标签控制声音风格与节奏的TTS模型,Gemini 3.8系列把控制重点放到了声音身份设计和逐行演绎上。

本次推出的两款模型分工各有侧重:旗舰版Gemini 3.8 Flash TTS主要面向深度创意与角色设计,覆盖游戏、沉浸式有声书及播客等场景;轻量版 Gemini 3.8 Flash-Lite TTS则面向高并发与批量处理需求,主打长视频配音、音频内容创作与客服语音智能体。

在能力层面,Flash TTS展现了以下几项变化:

·首先是自然语言生成声音(Generative Voice Design)。无需预先录音,用户可以通过自然语言描述角色特征、年龄、口音及音色(例如:“一个凌晨 2点疲惫不堪、说英语带有浓重德语口音的柏林人”),由模型生成对应的音色。

·其次是声音复刻(Voice Replication)。根据官方说明,模型支持基于约 30 秒的参考音频进行声音复刻,提取声线特征。

与此同时,模型支持逐行剧本控制与非语言表达。用户可以在文本脚本中添加舞台指导(Stage Directions),并插入 (笑声)、(叹息)、(喘息)以及|mhm|等回应词,用于模拟人类交谈中的停顿与语气起伏。

最后是双人对话与长音频声线一致性。用户可以基于一份脚本生成双人交替对话,并控制双方的语气与节奏;针对长音频生成,谷歌也对声线一致性进行了优化,以减少连续生成过程中的音色漂移。

Gemini 3.8 Flash TTS 将上传的剧本转化为由不同角色声线

02 跑分高,但真实体验仍有边界

从谷歌公布的测试结果来看,Gemini 3.8 Flash TTS在多项语音生成评测中获得了较高成绩。

在Hume AI的Voice Design Benchmark测试中,Flash TTS获得71.4分的综合成绩,并在口音建模维度获得60.8分;在Hume AI综合质量指数(Overall Quality Index)中,Flash TTS与Flash-Lite TTS分列前两位。

此外,在Voice Arena的双盲偏好测试中,两款模型在日语、现代标准阿拉伯语、墨西哥西班牙语、印地语等多个语种的评估中获得了较高的胜率。

然而,基准测试成绩并不完全代表实际生产中的体验。

科技媒体Unfiltered AI及其关联产业分析平台在测评中指出,虽然新模型在特定复杂口音和动态情绪控制上表现突出,但在部分高频段音频中仍能观察到微小的合成杂音;在极端长文本的连续渲染后期,少数样例也出现了轻微的声线漂移。

同时,谷歌发布的模型卡片(Model Card)也显示,新模型仍可能出现生成式音频模型常见的偏离文本或发音异常等问题,在高负载情况下也可能出现响应延迟或超时。

03 谷歌开始打价格牌

除了模型控制力的提升,价格也是谷歌此次关注的重点之一。

在定价策略上,2026年底前,开发者可享受以下API调用价格:Flash TTS的文本输入价格为0.50美元/百万Token,音频输出价格为9.00美元/百万Token;Flash-Lite TTS的文本输入价格同为0.50美元/百万Token,音频输出价格则降至6.00美元/百万Token。

根据谷歌给出的Token与音频时长折算方式(1秒生成音频约等于25个音频Token),连续生成1小时音频对应的纯输出API费用,Flash TTS约为0.81美元,Flash-Lite TTS约为0.54美元(折合人民币约3.8元)。

即便按照2027年恢复后的标准价格换算(Flash TTS恢复至18美元/百万Token,Flash-Lite TTS恢复至12美元/百万Token),1小时音频的对应输出费用也处于相对较低的水平。

不过上述费用仅指音频输出Token的理论折算,不包含抽卡等额外开销。

04 谷歌“PS”声音的逻辑

对于开发者与企业端,可以通过Gemini API、Google AI Studio进行调用与部署;对于终端应用与办公端,Flash TTS被集成至Gemini Notebook(笔记与知识库分析工具),Flash-Lite TTS则直接内置于Google Vids(AI视频创作工具)。

如此一来,TTS的竞争就不再局限于模型参数和单点音质,而会延伸到API、办公应用以及整个AI产品生态。

不过,随着声音复刻所需的样本时长缩短至30秒左右,如何建立更加完善的授权机制、责任认定与版权仲裁体系,是全行业需要长期面对的课题。

谷歌在发布中也设置了防护措施。

在知情同意机制上,谷歌要求进行声音复刻前,被复刻者必须先录制一段口头授权声明,系统会将授权录音与参考音频进行声纹比对,确认一致后方可生成。

在数字水印与追溯方面,所有由Gemini Audio生成的音频均织入了肉眼与肉耳不可察觉的SynthID音频水印,并附带C2PA数字凭证,以提供生成内容的追溯信息。

此外,谷歌目前对声音复刻功能的可用地区设置了限制,在美国的伊利诺伊州和得克萨斯州、欧洲经济区(EEA)、英国、瑞士及印度等地区暂不开放。

来源:文学城 · 查看原文
Scroll for more