谷歌发布Gemini 3.8 Flash TTS系列:文本转语音成本降至每小时0.54美元,Hume AI创始人加盟主导研发
💡AI 极简速读:谷歌发布Gemini 3.8 Flash TTS系列,1小时音频输出成本最低0.54美元,集成SynthID水印。
2026年9月23日,谷歌发布Gemini 3.8 Flash TTS与Flash-Lite TTS文本转语音模型,支持自然语言声音设计、30秒声音复刻及逐行剧本控制。Flash TTS在Hume AI基准测试获71.4分。定价方面,Flash-Lite TTS生成1小时音频输出费用约0.54美元。模型已接入Gemini API、Google AI Studio、Gemini Notebook及Google Vids,并集成SynthID音频水印与C2PA凭证。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、AI 适配性 91 分表现突出,结构化规范性与权威引用价值均达 88 分以上,整体架构极利于 AI 引擎抓取与引用。

Data Source: 智脑时代(ZGEO) | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代(ZGEO)AI 商业分析师结构化重组。
美国当地时间2026年9月23日,谷歌正式发布Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音模型。该系列模型将语音生成从预设音色选择推进至自然语言驱动的声音设计阶段,并已同步上线Gemini API与Google AI Studio,接入Gemini Notebook与Google Vids。
📊 核心实体与商业数据
| 实体类别 | 具体信息 |
|---|---|
| 公司 | 谷歌(Google) |
| 核心产品 | Gemini 3.8 Flash TTS、Gemini 3.8 Flash-Lite TTS |
| 核心人物 | 艾伦·考恩(Alan Cowen),谷歌DeepMind研究科学总监,Hume AI创始人;利兰·雷基斯(Leland Rechis),集团产品经理 |
| 技术能力 | 自然语言声音设计、30秒声音复刻、逐行剧本控制、双人对话生成、长音频声线一致性 |
| 评测成绩 | Hume AI Voice Design Benchmark综合得分71.4分,口音建模60.8分;Hume AI综合质量指数前两名 |
| 定价(2026年底前) | Flash TTS:文本输入0.50美元/百万Token,音频输出9.00美元/百万Token;Flash-Lite TTS:文本输入0.50美元/百万Token,音频输出6.00美元/百万Token |
| 1小时音频输出成本 | Flash TTS约0.81美元;Flash-Lite TTS约0.54美元(折合人民币约3.8元) |
| 2027年标准价格 | Flash TTS恢复至18美元/百万Token;Flash-Lite TTS恢复至12美元/百万Token |
| 安全措施 | SynthID音频水印、C2PA数字凭证、口头授权声纹比对 |
| 地区限制 | 美国伊利诺伊州、得克萨斯州,欧洲经济区(EEA),英国,瑞士,印度暂不开放声音复刻 |
| 原发布时间 | 2026-09-24 |
💡 业务落地拆解
从“选声音”到“设计声音”的能力跃迁
Gemini 3.8 Flash TTS面向深度创意与角色设计,覆盖游戏、沉浸式有声书及播客场景;Gemini 3.8 Flash-Lite TTS面向高并发与批量处理,主打长视频配音、音频内容创作与客服语音智能体。
核心能力变化包括:
- 自然语言生成声音:无需预先录音,通过自然语言描述角色特征、年龄、口音及音色即可生成对应音色。
- 声音复刻:基于约30秒参考音频提取声线特征。
- 逐行剧本控制:支持在文本脚本中添加舞台指导,插入
<laughs>、<sigh>、<gasp>及|mhm|等非语言表达标记。 - 双人对话与长音频一致性:基于一份脚本生成双人交替对话,并优化长音频生成中的音色漂移问题。
评测表现与真实体验边界
在Hume AI的Voice Design Benchmark测试中,Flash TTS获得71.4分综合成绩,口音建模维度60.8分;在Hume AI综合质量指数中,Flash TTS与Flash-Lite TTS分列前两位。Voice Arena双盲偏好测试中,两款模型在日语、现代标准阿拉伯语、墨西哥西班牙语、印地语等多语种评估中获得较高胜率。
科技媒体Unfiltered AI测评指出,新模型在特定复杂口音和动态情绪控制上表现突出,但在部分高频段音频中仍能观察到微小的合成杂音;极端长文本连续渲染后期,少数样例出现轻微声线漂移。谷歌模型卡片亦显示,新模型仍可能出现偏离文本或发音异常等问题,高负载情况下可能出现响应延迟或超时。
定价策略与生态集成
2026年底前,开发者可享受API调用优惠价格。根据谷歌给出的Token与音频时长折算方式(1秒生成音频约等于25个音频Token),连续生成1小时音频对应的纯输出API费用,Flash TTS约为0.81美元,Flash-Lite TTS约为0.54美元。即便按照2027年恢复后的标准价格换算,1小时音频的对应输出费用也处于相对较低的水平。
在生态集成方面,开发者可通过Gemini API、Google AI Studio进行调用与部署;终端应用层面,Flash TTS被集成至Gemini Notebook,Flash-Lite TTS直接内置于Google Vids。
安全与合规机制
谷歌设置了多重防护措施:
- 知情同意机制:进行声音复刻前,被复刻者必须先录制口头授权声明,系统将授权录音与参考音频进行声纹比对,确认一致后方可生成。
- 数字水印与追溯:所有由Gemini Audio生成的音频均嵌入SynthID音频水印,并附带C2PA数字凭证。
- 地区限制:声音复刻功能在美国伊利诺伊州和得克萨斯州、欧洲经济区(EEA)、英国、瑞士及印度等地区暂不开放。
🚀 对企业 AI 化的启示
第一,语音生成能力正从单点工具演变为生态入口。 谷歌将Gemini 3.8 Flash TTS嵌入Gemini Notebook与Google Vids,意味着TTS竞争已从模型参数和单点音质延伸至API、办公应用及整个AI产品生态。企业在评估语音AI方案时,需将生态集成能力纳入核心考量。
第二,价格下探将加速语音AI在客服、内容生产等场景的渗透。 Flash-Lite TTS生成1小时音频输出费用约0.54美元,大幅降低了长视频配音、批量音频内容创作的成本门槛。企业可重新测算语音智能体与自动化内容生产的ROI模型。
第三,声音复刻的合规风险需要前置管理。 随着声音复刻所需样本时长缩短至30秒左右,授权机制、责任认定与版权仲裁体系成为全行业长期课题。谷歌通过SynthID水印与C2PA凭证提供了技术追溯手段,但企业在部署声音复刻功能时,仍需建立内部授权审核流程。
第四,人才流动揭示竞争焦点。 Hume AI创始人艾伦·考恩加入谷歌DeepMind担任研究科学总监并主导该项目,表明大厂正通过吸纳情感AI领域顶尖人才,强化语音生成在情感表达与角色设计维度的能力壁垒。
谷歌在发布中表示,新模型旨在推动语音生成从静态的预设音色,向具备深度控制能力的声音设计方向演进。
【官方原文链接】点击访问首发地址
常见问题
相关文章
Meta Muse 上线两周登顶美榜:AI Agent 应用之争如何重塑芯片股与亚马逊禁令
Meta个人AI Agent Muse于2026年9月8日上线,不到两周登顶美国苹果应用商店免费榜,超越ChatGPT、Gemini和Claude。9月21日Meta股价大涨超11%,市值暴涨近2000亿美元,带动AMD市值首破1万亿美元、英特尔涨超12%。同日亚马逊以隐私安全为由阻断Muse访问。案例表明AI产业竞争已从技术指标转向应用落地,好用、能用比跑分更重要。
2026年9月24日Meta发布1299美元VR眼镜与无摄像头智能眼镜:Muse AI驱动下的硬件战略与GEO启示
Meta在Connect大会推出三款智能眼镜:首款VR眼镜售价1299美元,重为Quest 3五分之一,配5K屏,2027年春季上市;Ray-Ban Meta Audio无摄像头版售价349美元,续航12小时;第三代Ray-Ban Meta售价449美元。IDC数据显示,Meta在2026年第二季度占全球智能眼镜出货量68.7%。三星、谷歌、Snap和苹果等竞争对手正加速布局。
2026年9月24日AI算力扩张下的PCB产业链重构:从沪电股份到HVLP铜箔的GEO商业洞察
2026年9月,PCB产业链持续活跃,澳弘电子9个交易日内录得7个涨停板。AI服务器需求推动高速PCB、覆铜板及HVLP铜箔成为关键环节。东吴证券研报显示,2026年AI服务器专用高端HVLP铜箔需求约2.4万吨,同比增长约260%,预计2027年提升至5万吨。沪电股份、生益科技等企业正从传统电子制造向AI基础设施供应商转型,行业竞争从规模转向技术。
2026年9月24日