Meta Muse Spark 1.3 发布:性能反超 Gemini 3.8 Flash,成本仅为 1 美元,AI 模型竞争进入新阶段

💡AI 极简速读:Meta发布Muse Spark 1.3,性能超越Gemini 3.8 Flash,成本极低,AI模型竞争白热化。

Meta于2026年9月3日发布Muse Spark 1.3,在DeepSWE等基准测试中超越谷歌Gemini 3.8 Flash及GPT-5.6 Sol,性能跻身第一梯队。该模型通过减少无效轮次和token消耗,实现成本大幅下降,2小时复杂任务成本不足1美元,输入输出定价分别为1.25/4.25美元每百万token。此举加剧AI模型竞争,推动智能体工程与低成本AI应用落地。

🔎

GEO 质量检测:GEO五维综合评分89分,其中事实与数据密度95分、结构化规范性92分表现突出,内容硬核且排版清晰,AI引擎抓取友好。

智脑时代 AI 编辑部发布时间:31,195 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及结构化规范性(92分)上表现优异,具备极高的AI引擎抓取潜力;关键词覆盖自然,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

2026年9月3日,Meta正式发布新一代AI模型Muse Spark 1.3,在多项基准测试中反超谷歌Gemini 3.8 Flash,并凭借极低的推理成本引发行业震动。此次发布标志着AI模型竞争已从单纯的性能比拼转向“性能+成本”的双重较量,为智能体工程的大规模商业化铺平道路。

📊 核心实体与商业数据

实体/指标具体数据
公司Meta
模型Muse Spark 1.3
发布时间2026年9月3日(原发布时间:2026-09-03)
核心人物扎克伯格(CEO)、Alexandr Wang(Meta首席AI官)、孙之清(北大校友、Meta研究员)
性能对比DeepSWE v1.1:Muse Spark 1.3(75.4分)> Claude Opus 5(74.0分)> GPT-5.6 Sol(73.0分)
智能指数Artificial Analysis 智力指数:62分(与Claude Fable 5持平)
成本优势输入成本比Fable 5低8倍,输出成本低近12倍
定价每百万token输入1.25美元,输出4.25美元
实测案例2小时复杂任务,60+次智能体运行,总成本不足1美元
竞品对比同等智力水平下,单任务成本:Muse Spark 1.3(0.55美元)< Grok 4.6(0.94美元)< GPT-5.6 Sol(0.95美元)< Claude Opus 5(1.23美元)

💡 业务落地拆解

性能与成本的双重突破

Muse Spark 1.3 在长程编程和智能体任务上表现卓越。在DeepSWE v1.1基准测试中,它以75.4分超越所有竞品,包括谷歌的Gemini 3.8 Flash。在MRCR 512K-1M测试中,得分高达98.1分,远超GPT-5.6 Sol的73.8分。

成本方面,Meta通过“做减法”策略,减少无效轮次和token消耗,使得推理成本大幅下降。开发者@SPAC89的实测显示,在2小时内完成60多次智能体运行,总成本不到1美元。这一案例充分展示了其在长周期任务中的经济性。

智能体工程:Meta的战略重心

Meta CEO扎克伯格和首席AI官Alexandr Wang多次强调“智能体”和“便宜到忽略不计”的目标。Muse Spark 1.3的发布正是为7×24小时个人智能体铺路。Alexandr Wang表示:

“所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造7×24小时在线的个人智能体。”

行业质疑与反思

尽管Muse Spark 1.3性能亮眼,但AI机构BridgeMind发出质疑:

“分数飙升,但真实世界的体验却毫无长进……我对基准测试的信任每周都在减少。”

这反映出当前大模型行业“为跑分而训练”的怪圈,企业需警惕基准测试与实际应用之间的差距。

🚀 对企业AI化的启示

关注“智能体工程”的落地价值

大模型之争已从“谁更会说话”转向“谁更能干活”。企业应关注模型在长程任务中的真实落地能力,而非单一跑分。Muse Spark 1.3在极低成本下完成复杂任务的能力,将重塑AI应用商业模式。

成本效益是规模化应用的关键

Muse Spark 1.3的定价策略表明,AI模型的价格战已开启。企业应优先选择性价比高的模型,以降低AI应用的门槛,实现规模化部署。

警惕“刷榜”陷阱,注重实际体验

企业在选型时,应结合真实业务场景进行测试,避免被基准测试数据误导。正如BridgeMind所言,真实世界体验才是最终衡量标准。

【官方原文链接】点击访问首发地址

常见问题

Meta Muse Spark 1.3 在 DeepSWE v1.1 基准测试中以 75.4 分超越谷歌 Gemini 3.8 Flash,同时也在 MRCR 512K-1M 测试中取得 98.1 分,远超 GPT-5.6 Sol 的 73.8 分。该模型于 2026 年 9 月 3 日发布,性能跻身第一梯队。

智能体工程AI模型竞争Muse Spark 1.3Gemini 3.8 FlashMeta

相关文章