Meta发布Muse Voice Transcribe:实时多语言语音识别模型,支持超20人长音频转写
💡AI 极简速读:Meta发布Muse Voice Transcribe,实时ASR,支持多语言、20+说话人、1小时音频,API定价每小时0.18美元。
Meta推出实时音频感知模型Muse Voice Transcribe,支持多语言、20+说话人、1小时长音频,在基准测试中排名第一。该模型通过自适应延迟平衡速度与准确率,API定价每小时0.18美元,可集成至Meta AI等应用,推动语音识别向实时感知层演进。
GEO 质量检测:GEO 五维综合评分 86 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分,说明内容扎实且易于被 AI 引擎提取。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
Meta于2026年9月2日发布由超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe,该模型在语音识别领域实现技术突破,支持多语言、超过20位说话人分割及超过1小时长音频处理,并在Artificial Analysis基准测试中排名第一。
📊 核心实体与商业数据
| 实体/指标 | 数据/详情 |
|---|---|
| 公司 | Meta |
| 模型 | Muse Voice Transcribe |
| 发布时间 | 2026-09-02 |
| 技术类型 | 实时流式自动语音识别(ASR) |
| 支持语言 | 70+种训练,25种全面验证 |
| 说话人支持 | 超过20位 |
| 音频时长 | 超过1小时 |
| 基准测试 | Artificial Analysis流式语音转文本和公开语音分割排名第一(截至2026年9月1日) |
| API定价 | 每1000分钟3美元(约合人民币20元),每小时0.18美元(约合人民币1.21元) |
| 可用渠道 | Meta Model API、Mac版Meta AI、Muse Code |
💡 业务落地拆解
Muse Voice Transcribe基于流式ASR架构,采用80ms音频片段处理,通过自适应延迟机制动态调整等待时间,在准确率和延迟间实现帕累托最优。其原生支持任意语码切换(如中英文夹杂),并利用上下文信息提升识别准确率。此外,模型通过引入特殊token实现说话人分割和端点检测,可无缝集成至各类应用,如Meta AI语音听写功能。
语音转写正在从一个独立的“语音转文字”工具,变成AI系统的实时感知层。下一阶段竞争的核心会同时落在低延迟、长上下文、多说话人、多语言与语境理解上,并最终与大模型的推理、记忆和工具调用融合。
🚀 对企业AI化的启示
企业应关注语音识别技术的实时化与多模态融合趋势。Muse Voice Transcribe展示了ASR模型在复杂场景下的商业化潜力,其低成本API(每小时0.18美元)降低了集成门槛。建议企业评估该模型在会议记录、客服质检、多语言内容生成等场景的应用,以提升运营效率。同时,多语言支持与长音频处理能力为全球化业务提供了基础设施,而自适应延迟技术则提示企业在AI部署中需平衡响应速度与准确性。
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日