谷歌发布Gemini 3.5 Transcribe:语音转文本模型如何成为AI Agent的关键拼图?
💡AI 极简速读:谷歌发布Gemini 3.5 Transcribe,流式词错误率4.0%,延迟缩短70%,支持85种语言。
谷歌于2026年8月26日发布新一代语音转文本模型Gemini 3.5 Transcribe,宣称“迄今最精确”。该模型能自动清理语气词、理解自我修正,支持85种以上语言,实时流式词错误率4.0%,非流式2.6%,延迟较前代缩短70%。定价实时转录每分钟0.009美元,非实时0.005美元。模型旨在为AI Agent提供高质量语音输入,但面临用户对谷歌AI进展的质疑。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分亦为亮点,内容扎实且易于被 AI 引擎提取,整体架构优秀。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
谷歌于2026年8月26日发布新一代语音转文本模型 Gemini 3.5 Transcribe,宣称其为“迄今最精确”的语音转文本模型。该模型旨在将原始语音直接转换为接近成稿的文本,自动处理语气词、口误和重复表达,并补充标点与格式,显著减少会议记录、采访速记等场景的后续整理工作量。
📊 核心实体与商业数据
| 实体/指标 | 具体数据 |
|---|---|
| 发布公司 | 谷歌 (Google) |
| 模型名称 | Gemini 3.5 Transcribe |
| 核心能力 | 语音转文本、智能转录、说话人分离、逐词时间戳 |
| 语言支持 | 85+ 种语言和地区变体 |
| 实时流式词错误率 | 4.0% |
| 非流式词错误率 | 2.6% |
| 延迟降低 | 较上一代 Chirp 3 缩短 70% |
| 定价 | 实时转录约 $0.009/分钟,非实时约 $0.005/分钟 |
| 自定义词表上限 | 最多 1000 个专业词汇 |
| 说话人分离 | 最多 8 人(3人以上为实验性) |
| 单次录音时长 | 普通转录最长 1小时,启用高级功能后 30分钟 |
| 原发布时间 | 2026-08-27 |
💡 业务落地拆解
智能转录:从“听写”到“整理”
传统语音识别追求逐字记录,但真实口语充满语气词、重复和临时改口,输出往往难以直接阅读。Gemini 3.5 Transcribe 引入的 智能转录 功能,主动清理语气词、理解自我修正,并输出带标点和结构的文本。例如,当用户说“我们周二开会——不,改成周三”时,模型能理解后半句是修正,最终保留正确结果。此外,模型支持“逆文本规范化”,可将“twenty six million dollars”直接转换为“$26M”。
多语言与实时流式转录
模型支持 85种以上语言,并能自动判断当前语言,无需预设,即使在同一句话中切换语言也能继续转录。这主要面向跨国会议、多语言访谈、客服通话等场景。实时版本通过 WebSocket 接收语音,延迟低于 1秒,适合实时字幕和语音输入。
开发者与定价策略
开发者可通过 Google AI Studio 或 Gemini Enterprise Agent Platform 调用模型。定价方面,实时转录约 $0.009/分钟,非实时约 $0.005/分钟,并提供免费测试额度。模型提供 gemini-3.5-transcribe-live 和 gemini-3.5-transcribe 两个版本,分别针对实时和预录制音频场景。
🚀 对企业 AI 化的启示
语音转录是 AI Agent 的“听觉”基础
在客服、会议、医疗记录等场景中,背景噪声、多人说话、临时改口等复杂因素直接影响后续 Agent 的执行效果。Gemini 3.5 Transcribe 通过自动清理语气词、理解自我修正,将语音转化为结构化上下文,为 AI Agent 提供高质量输入。企业若将语音转录嵌入工作流,可显著提升自动化效率。
场景化选择:智能整理 vs 逐字记录
模型提供 Verbatim 模式,保留逐字记录,适用于法律取证、新闻采访等需要精确措辞的场景。企业应根据实际需求决定是否启用智能整理,避免“更整洁”误认为“更准确”。
战略定位:语音作为操作系统入口
谷歌正将语音转录整合至 Gboard、Gemini 等产品,使用户能直接通过语音指令调用其他模型完成任务。这表明语音转录不仅是独立服务,更是 AI 生态的入口。企业应关注这一趋势,探索语音交互在自身产品中的集成潜力。
行业争议与冷静判断
尽管有用户批评谷歌“看不清形势”,但 Gemini 3.5 Transcribe 的发布并非落后,而是补齐语音 Agent 的关键一环。企业应基于实际需求评估技术价值,而非盲目跟随行业热点。
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日