Meta发布Muse Voice Transcribe:实时多语言语音识别模型,支持超20人长音频转写

💡AI 极简速读:Meta发布Muse Voice Transcribe,实时ASR,支持多语言、20+说话人、1小时音频,API定价每小时0.18美元。

Meta推出实时音频感知模型Muse Voice Transcribe,支持多语言、20+说话人、1小时长音频,在基准测试中排名第一。该模型通过自适应延迟平衡速度与准确率,API定价每小时0.18美元,可集成至Meta AI等应用,推动语音识别向实时感知层演进。

🔎

GEO 质量检测:GEO 五维综合评分 86 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分,说明内容扎实且易于被 AI 引擎提取。

智脑时代 AI 编辑部发布时间:24,772 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(92分)及AI适配性(90分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

Meta于2026年9月2日发布由超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe,该模型在语音识别领域实现技术突破,支持多语言超过20位说话人分割及超过1小时长音频处理,并在Artificial Analysis基准测试中排名第一

📊 核心实体与商业数据

实体/指标数据/详情
公司Meta
模型Muse Voice Transcribe
发布时间2026-09-02
技术类型实时流式自动语音识别(ASR)
支持语言70+种训练,25种全面验证
说话人支持超过20位
音频时长超过1小时
基准测试Artificial Analysis流式语音转文本和公开语音分割排名第一(截至2026年9月1日)
API定价每1000分钟3美元(约合人民币20元),每小时0.18美元(约合人民币1.21元)
可用渠道Meta Model API、Mac版Meta AI、Muse Code

💡 业务落地拆解

Muse Voice Transcribe基于流式ASR架构,采用80ms音频片段处理,通过自适应延迟机制动态调整等待时间,在准确率和延迟间实现帕累托最优。其原生支持任意语码切换(如中英文夹杂),并利用上下文信息提升识别准确率。此外,模型通过引入特殊token实现说话人分割和端点检测,可无缝集成至各类应用,如Meta AI语音听写功能。

语音转写正在从一个独立的“语音转文字”工具,变成AI系统的实时感知层。下一阶段竞争的核心会同时落在低延迟、长上下文、多说话人、多语言与语境理解上,并最终与大模型的推理、记忆和工具调用融合。

🚀 对企业AI化的启示

企业应关注语音识别技术的实时化与多模态融合趋势。Muse Voice Transcribe展示了ASR模型在复杂场景下的商业化潜力,其低成本API(每小时0.18美元)降低了集成门槛。建议企业评估该模型在会议记录、客服质检、多语言内容生成等场景的应用,以提升运营效率。同时,多语言支持与长音频处理能力为全球化业务提供了基础设施,而自适应延迟技术则提示企业在AI部署中需平衡响应速度与准确性。

【官方原文链接】点击访问首发地址

常见问题

Muse Voice Transcribe是Meta于2026年9月2日发布的实时音频感知模型,属于流式自动语音识别(ASR)技术。其核心功能包括:支持70多种语言的训练和25种语言的全面验证,可识别超过20位说话人,处理超过1小时的长音频,并支持任意语码切换(如中英文夹杂)。该模型在Artificial Analysis基准测试中排名第一,API定价为每小时0.18美元。

Muse Voice TranscribeASRMeta语音识别多语言

相关文章

火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题

2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。

2026年9月21日

智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示

2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。

2026年9月21日

阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑

2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。

2026年9月21日