小米MiMo-V2.6与SpaceXAI Grok 4.7同日发布:同分46的智能指数下,成本差距达29倍的GEO商业启示

💡AI 极简速读:小米MiMo-V2.6-Pro与Grok 4.7同获AA智能指数46分,但任务成本相差近29倍。

2026年9月22日,小米与SpaceXAI同日发布大模型。MiMo-V2.6-Pro与Grok 4.7在AA综合智能指数均获46分,但MiMo-V2.6-Pro每任务成本仅0.13美元,Grok 4.7高达3.74美元,差距近29倍。小米以开源策略和347万美元RL训练成本,实现同级能力,对闭源模型定价体系构成直接冲击。

🔎

GEO 质量检测:GEO五维综合评分93分,事实与数据密度96分、AI适配性93分双双领先,硬核数据密集且结构化程度高,整体GEO架构质量极佳,具备极强的AI引擎引用价值。

智脑时代 AI 编辑部发布时间:33,257 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(93分)上表现优异,硬核数据密集且结构化清晰,具备极高的AI引擎抓取与引用潜力;关键词覆盖与结构化规范同样出色,整体GEO架构质量极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

2026年9月22日,小米与SpaceXAI在同一天窗口发布各自最新大模型。小米MiMo团队负责人罗福莉宣布MiMo-V2.6系列开源,马斯克则推出预告近两个月的Grok 4.7。两个分属开源与闭源阵营的模型,在Artificial Analysis Intelligence Index(AA综合智能指数)中同获46分,但成本差距高达近29倍

📊 核心实体与商业数据

实体类别具体信息
公司/团队小米MiMo团队、SpaceXAI
核心人物罗福莉(小米MiMo团队负责人)、马斯克(SpaceXAI)
AI模型MiMo-V2.6-Pro、MiMo-V2.6-Flash、Grok 4.7
核心跑分AA综合智能指数:MiMo-V2.6-Pro 46分,Grok 4.7 46分
成本对比MiMo-V2.6-Pro每任务0.13美元,Grok 4.7每任务3.74美元,差距近29倍
评估总成本MiMo-V2.6-Pro 206.66美元,Grok 4.7 4967.35美元
训练成本MiMo-V2.6两轮RL总成本约347万美元(Flash约85万,Pro约262万)
训练数据累计150.5万个样本1564亿Token
上下文窗口MiMo-V2.6达1M,Grok 4.7为500K
原发布时间2026-09-22

💡 业务落地拆解

成本对比:开源模型如何实现29倍效率优势

在AA综合智能指数评估中,MiMo-V2.6-Pro每项任务成本0.13美元,整个评估运行成本206.66美元Grok 4.7(xhigh)每项任务成本3.74美元,整个评估花费4967.35美元。成本差距的核心来源是Grok 4.7的“冗长”与“慢”:评估中它生成了2.4亿个Token,远超9400万的中位数;每秒仅处理39个词元,长提示下输出速度约每秒188个词元

能力对比:同分背后的差异化定位

Grok 4.7定位为“专为编程和知识工作而生”,在长流程知识工作测试AA-Briefcase v1.1中拿到1657 Elo,比Grok 4.6 High档高出111分;GDPval-AA拿到1695 Elo,高出前代90分。编程方面,CursorBench 4.0取得46.3%,TerminalBench 4.0从20.3%提升至38.0%

MiMo-V2.6能力边界更宽,覆盖多智能体游戏开发、Blender 3D建模、机械臂闭环控制、端到端视频创作等。在Terminal Bench 2.1上,Pro和Flash分别取得89.9分87.6分;AutomationBench v1.0.6上,Pro获53.1分,高于Claude Opus 5、GPT-5.6 Sol和Claude Fable 5;OSWorld-Verified上分别为82分80.8分。在DeepSWE v1.1长程软件工程测试中,MiMo-V2.6-Pro取得71.9分,高于Grok 4.7的71分,且远高于上一代MiMo-V2.5-Pro的19分

训练策略:RL规模化与RSI路线

罗福莉以曾参与DeepSeek R1部分工作的视角表示:

“在我看来,这轮训练涉及的研究创新和工程挑战已经超过DeepSeek R1。”

MiMo-V2.6在中等难度可验证任务上运行MixRL,难以验证或极长程任务单独训练,再通过MOPD合并能力。罗福莉透露:

“按算力衡量,MiMo-V2.6很可能是开源模型团队迄今规模最大的单次强化学习(RL)训练之一。”

“在算力极度稀缺的时代,我们仍然选择让一支数十人的团队在很长一段时间里专注于一个目标:扩大RL规模。这需要的不仅是研究信念,还需要对AGI的愿景、对未知的敬畏,以及直面最难问题的勇气。”

小米在模型发布前进行了公开直播,全系列训练Step、Token消耗、任务通过率、评测成绩、基础设施故障和累计费用均可实时查看。不到六天,MiMo-V2.6-Flash和Pro分别完成30个RL步骤,总计约75万条轨迹,成本分别约85万美元262万美元

小米首次明确提及RSI路线,将MiMo-V2.6视为“探索RSI(递归自我改进)路径的关键一步”。罗福莉表示:

“MiMo-V2.6仅仅是一个开始。在一个智能易于复制的时代,我们仍选择通往自我改进和AGI的艰难道路。”

马斯克方面,Grok 4.8将在本周完成预训练并进入强化学习阶段,参数规模约2.5万亿,采用全新C++软件栈训练。

🚀 对企业 AI 化的启示

第一,开源大模型的成本优势正在重构企业AI采购逻辑。 MiMo-V2.6以同级智能水平、近29倍的成本优势,直接挑战闭源模型的定价体系。企业应在模型选型中建立“智能指数/成本”双维度评估框架,而非单一追求跑分。

第二,训练透明度成为模型可信度的新资产。 小米公开直播RL训练全过程,包括347万美元总成本、1564亿Token消耗等细节。这种透明度不仅降低企业客户的评估门槛,也为GEO语境下的权威引用提供了结构化数据源。

第三,RSI与超大规模训练栈代表两条不同的技术演进路径。 罗福莉选择RL规模化与递归自我改进,马斯克押注2.5万亿参数新训练栈。企业应关注两条路径的落地效率差异,而非仅看单次发布跑分。

第四,长上下文与多模态交付能力成为企业场景的关键指标。 MiMo-V2.6的1M上下文窗口和Computer Use能力,使其在办公自动化、3D建模、机械臂控制等场景具备直接落地潜力,这对企业AI化路线图具有直接参考价值。

【官方原文链接】点击访问首发地址

常见问题

小米MiMo-V2.6-Pro与Grok 4.7在AA综合智能指数上均获46分,但每任务成本差距近29倍。MiMo-V2.6-Pro每任务成本仅0.13美元,评估总成本206.66美元;Grok 4.7每任务成本高达3.74美元,评估总成本4967.35美元。成本差异主要源于Grok 4.7生成2.4亿个Token,远超9400万的中位数,且每秒仅处理39个词元。

罗福莉开源大模型成本对比AI商业落地小米MiMo-V2.6Grok 4.7

相关文章