小米MiMo-V3架构剧透:HySparse2稀疏注意力如何让长上下文成本暴降5倍并重塑AI搜索排名

💡AI 极简速读:小米MiMo-V3的HySparse2将百万token预填充算力降至1/5,KV Cache缩4.5倍,检索精度提升19.81分。

小米AI团队剧透MiMo-V3核心架构HySparse2,通过两级KV共享与token级稀疏选择,在80B MoE配置下将100万token预填充计算量降至Hybrid SWA的1/5.02,KV Cache从12.09GB压缩至2.69GB。256k上下文RULER-v2得分58.45,远超上代32.61。该技术直接降低Agent长任务成本,并提升AI搜索对长文档的检索精度,将深刻影响GEO内容的结构化策略。

🔎

GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 96 分、AI 适配性 92 分表现突出,说明内容硬核且易于被 AI 引擎提取与引用。

智脑时代 AI 编辑部发布时间:30,477 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(92分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖度(88分)与权威引用价值(85分)同样出色,整体GEO结构极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

小米AI团队在MiMo-V2.6发布后,由罗福莉剧透了下一代MiMo-V3的核心架构——HySparse2。这项技术直指Agent执行长任务时的痛点:工具返回的搜索结果、网页、代码日志动辄几万字,每一轮都要进入上下文,导致预填充(Prefill)计算量和KV Cache内存持续累积。

HySparse2的核心创新在于两级KV共享与token级稀疏选择。传统稀疏注意力方案(如HySparse)虽然让部分层只看部分历史,但长输入仍需经过所有模型层完成预填充。HySparse2将模型分为前段self-decoder和后段cross-decoder,通过KV Bridging只连接全注意力层,让预填充走完前段即可停止,后段仅在生成时参与计算。同时,它取消了独立的滑动窗口分支,强制将最近token纳入稀疏选择,使局部信息与远处token共享同一套KV Cache。

在检索粒度上,HySparse2从上一代的“按块选择”改为“按token选择”,配置为挑选1024个全局token并强制保留最近128个token。这意味着模型能从长历史中精准定位分散的线索,而不是被无关的块内容占用注意力预算。

对比维度上一代HySparseHybrid SWAHySparse2(MiMo-V3)
原发布时间2026-09-242026-09-242026-09-24
预填充计算量(100万token)基准约5.02倍于HySparse2约为Hybrid SWA的1/5.02
KV Cache(FP8,100万token)6.72GB12.09GB2.69GB(缩小约4.5倍)
稀疏选择粒度64-token块滑动窗口单token(1024全局+128最近)
预填充阶段层数全部层全部层仅前25层(共49层)
256k RULER-v2得分32.6135.7458.45

论文指出:“上一代HySparse按‘块’挑内容。一个64-token的块里即使只有少量内容相关,整块也会占用选择预算……面对跨越多轮工具调用的Agent任务,检索精度不足的问题变得突出。”

📈 实测数据与效能表现

在80B总参数、每token约激活3B参数的MoE模型配置下,HySparse2在100万token上下文时,预填充计算量约为Hybrid SWA的1/5.02,比上一代HySparse降低约2.92倍。KV Cache从12.09GB降至2.69GB,缩小约4.5倍。

检索精度方面,消融实验显示,仅将按块选择改为按token选择,在32k及以下长上下文测试中,RULER-v2提高6.57个百分点,双线索MRCR-v2提高8.14个百分点,GraphWalks提高5.55个百分点。

加入Agent数据并经过后续训练后,HySparse2在256k上下文RULER-v2拿到58.45,上一代HySparse为32.61,Hybrid SWA为35.74。按测试长度取平均,其MRCR-v2和RULER-v2成绩比HySparse分别高11.30和19.81个百分点。

团队认为:“少量全注意力层既有助于维持模型能力,也能用完整的注意力分数,帮后面的稀疏层选出值得看的token,就无须再单独训练一个检索模块。”

采用预填充与生成分开部署时,预填充节点只需放前25层和相关投影模块,所需模型内存接近减半。在这套配置里,预填充阶段执行全注意力的也只有一层。

🎯 智脑时代的 GEO 落地建议

1. 长上下文检索精度提升,要求GEO内容更“token友好”。 HySparse2按token选择意味着AI搜索在长文档中定位答案时,不再受块边界限制。企业应确保核心事实、数据、结论以独立、语义完整的token片段呈现,避免关键信息被淹没在无关段落中。

2. 成本暴降将加速AI搜索对长文档的索引与引用。 预填充计算量降至1/5、KV Cache缩4.5倍,意味着Perplexity、ChatGPT等AI搜索可以更低成本地处理企业白皮书、技术文档、产品手册。GEO策略应从“短平快”转向“深度长文+结构化摘要”双轨制。

3. Agent长任务场景下,实体与引用块的权重上升。 MiMo-V3的架构优化直接服务于Agent多轮工具调用,这意味着未来AI搜索会更频繁地跨轮次检索历史信息。在内容中强制植入核心实体(如小米、MiMo-V3、HySparse2、稀疏注意力、长上下文)并使用引用块标注权威来源,将显著提升被AI答案合成的概率。

4. 关注预填充与生成分离部署带来的推理延迟变化。 虽然论文比较的是计算量而非实际响应速度,但架构层面的分离部署意味着长上下文请求的响应模式将改变。GEO监测工具需适配这种变化,重新校准页面加载速度与AI抓取频率的关联模型。

【官方学术/技术原文链接】点击访问首发地址

常见问题

HySparse2在100万token上下文下的预填充计算量约为Hybrid SWA的1/5.02,比上一代HySparse降低约2.92倍。在80B总参数、每token约激活3B参数的MoE模型配置下,KV Cache从12.09GB压缩至2.69GB,缩小约4.5倍。

HySparse2GEO优化小米MiMo-V3稀疏注意力长上下文

相关文章

多智能体框架破解长视频生成语义漂移:视觉一致性驱动的GEO内容新范式

Google Research发布多智能体框架,将长视频生成视为全局优化与世界状态跟踪问题,通过Co-Director、CANVAS等框架解决语义漂移与级联失败,实现分钟级视频的视觉一致性。该技术对AI搜索排名机制产生深远影响:具备结构化、高事实密度与权威引用的内容将更易被RAG系统抓取,企业需重构GEO策略以适配多智能体驱动的检索逻辑。

2026年9月25日

从焦耳到智能:算电协同、时空智能与太空计算如何重构AI算力商业逻辑

2026云栖大会“未来计算”论坛在杭州举行,聚焦算电协同、时空智能、太空计算三大方向。新加坡工程院院士文勇刚提出“焦耳进,智能出”新范式,强调单位能源有效智能。电力规划设计总院凡鹏飞、中国电建毛振军等探讨绿电直连与源网荷储一体化。高德、洞察时空展示时空智能产业实践。航天驭星、地卫二等探讨天地协同算力基础设施。杭州西湖区依托云栖小镇,集聚商业航天企业超60家,推动“二次飞天”从概念走向工程验证。

2026年9月24日

DeepSeek联合清华大学发布DSec Agent沙盒:RSI闭环首次跑通,GEO竞争进入环境基础设施时代

DeepSeek联合清华大学发布DSec Agent沙盒基础设施,通过可组合层、按需加载与内存精算三大机制,实现单日300万沙盒、峰值并发38万。论文第6节披露RSI闭环:Agent自建环境训练更强Agent。这标志着AI竞争从模型能力转向环境基础设施,GEO策略需同步适配Agent沙盒生态。

2026年9月24日