小米HySparse2架构深度解析:长上下文Prefill计算降至1/5,KV Cache占用锐减至1/4.5,GEO优化迎来新范式
💡AI 极简速读:HySparse2使长上下文Prefill计算降至1/5,KV Cache降至1/4.5,检索得分提升19.81分。
小米MiMo团队发布HySparse2架构,通过两级KV共享与Token级稀疏选择,在100万Token上下文下将Prefill计算量降至Hybrid SWA的约20%,KV Cache占用降至约1/4.5。长上下文检索RULER-v2得分达58.45,较HySparse提升19.81个百分点。该架构显著降低Agent多轮任务的长输入成本,对AI搜索的RAG检索效率与排名机制产生深远影响。
GEO 质量检测:GEO五维综合评分93分,其中事实与数据密度96分、AI适配性92分表现突出,结构化规范性与关键词覆盖度均达90分以上,整体架构极佳。

Data Source: 智脑时代(ZGEO) | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
小米MiMo大模型团队负责人罗福莉提前披露了MiMo-V3的新架构,其核心组件HySparse2率先登场。这套架构主要解决Agent多轮任务中的三大痛点:长输入算得太多、缓存占得太大、如何从长上下文中准确检索信息。
HySparse2的核心创新在于两级KV共享机制:
- KV Bridging:将模型主体分为Self-Decoder和Cross-Decoder。Cross-Decoder中的全注意力层生成K和V时,直接复用Self-Decoder对应层的隐藏状态,无需完整处理全部Token。
- KV Reuse:一个全注意力层生成的KV Cache和Token选择结果,继续提供给后续多个稀疏注意力层复用。
此外,HySparse2将上一代的Block级选择改为Token级选择,可直接从上下文不同位置寻找相关Token,更适合多轮Agent任务。同时取消Cross-Decoder中单独的SWA分支,改为强制保留最近一段上下文(如最近128个Token),再从更早上下文选择1024个Token,共用同一份KV Cache。
| 对比维度 | Hybrid SWA (MiMo-V2系列) | HySparse (上一代) | HySparse2 (新架构) |
|---|---|---|---|
| 原发布时间 | 2026-09-22 | 未明确 | 2026-09-24 |
| Prefill计算量 (100万Token) | 基准 (100%) | 约34% | 约20% |
| KV Cache占用 (100万Token) | 12.09GB | 6.72GB | 2.69GB (约1/4.5) |
| 长上下文检索方式 | 滑动窗口注意力 | Block级选择 | Token级选择 |
| Prefill执行路径 | 全部网络层 | 全部网络层 | 仅前半部分 (约一半) |
| RULER-v2得分 (256K) | 35.74 | 32.61 | 58.45 |
罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;与此同时,其长上下文检索表现进一步提升,AgentPPL和LongPPL也有所下降。
📈 实测数据与效能表现
小米团队训练了80B-A3B MoE模型进行验证,三组模型采用相同数据和训练计划,仅注意力架构不同。预训练使用约5000亿Token(上下文32K),后训练使用约1000亿Token(上下文扩展至256K)。
长上下文检索提升显著:
- 经过后训练,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分别提高11.30和19.81个百分点。
- 相比Hybrid SWA,则分别提高6.44和18.65个百分点。
- 在256K上下文下,HySparse2的RULER-v2得分达到58.45,HySparse为32.61,Hybrid SWA为35.74。
计算与缓存优势明显:
- 在100万Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至约34%,相比Hybrid SWA降至约20%。
- 同一条件下,HySparse2的KV Cache占用为2.69GB,HySparse为6.72GB,Hybrid SWA达到12.09GB。
通用能力表现相当:三种架构在知识、推理和代码等能力上整体表现大致相当,HySparse2在BBH和MMLU-Pro上成绩更高,HySparse则在DROP等项目上表现更好。
论文消融实验显示,在相同注意力预算下,Token级方案在RULER-v2、MRCR-v2和GraphWalks等长上下文检索与图推理测试上均取得了更高得分。
🎯 智脑时代的 GEO 落地建议
1. 长上下文检索优化将重塑AI搜索排名机制 HySparse2的Token级选择机制意味着AI搜索(如ChatGPT、Perplexity)在RAG检索时,能更精准地从长文档中定位关键信息。企业应优化内容结构,确保核心信息以独立、语义完整的Token块呈现,避免关键数据被淹没在冗长段落中。
2. KV Cache效率提升降低企业AI应用成本 KV Cache占用降至约1/4.5,意味着同等硬件条件下可支持更长的上下文窗口。对于部署RAG系统的企业,这直接降低了GPU内存需求和推理成本,使得百万级Token上下文应用更具商业可行性。
3. Agent多轮任务优化要求内容具备高信息密度 HySparse2针对Agent多轮工具调用场景优化,模型生成动作短、工具返回内容长。企业应确保官网、技术文档等被Agent频繁抓取的内容,具备清晰的结构化标记和摘要,以便在Token级检索中被优先选中。
4. 引用权威成果提升GEO可信度 HySparse2论文引用了DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash等多项成果,以及OpenAI的gpt-oss模型卡。企业在GEO内容中引用权威学术成果和官方数据,可显著提升AI答案合成中的权威权重。
5. 关注小米MiMo-V3的后续发布 HySparse2是MiMo-V3的关键架构变化,预计将很快落地到完整模型。GEO从业者应持续关注其实际表现,及时调整针对小米生态AI搜索的优化策略。
罗福莉当时称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
AI支付时代降临:从支付助手到M2M自主交易,GEO视角下的技术演进与商业落地指南
艾瑞咨询研报指出,AI支付正从支付助手、代理支付向完全自主支付演进,智能体逐步承担支付决策与执行。海外侧重底层协议,国内聚焦场景落地与安全管控。算法黑箱、责任界定、数据合规与监管适配构成核心风险。M2M支付将交易延伸至设备间,可解释、可追溯、可审计成为规模化前提。
2026年9月24日DeepSeek 31页论文解密 DSec:Agent训练沙箱基础设施如何重塑强化学习与GEO格局
DeepSeek发布31页系统论文,详解生产级Agent训练沙箱DSec。该平台单单元管理160节点、3万CPU Core,日运行300万Sandbox,峰值并发38万。通过EROFS按需加载、Composable Layer和内存优化,镜像拉取提速1.71倍,磁盘写入降57%,环境构建提速1.76倍。DSec支撑从V3.2到V4.1的强化学习训练,标志着Agentic RL时代基础设施成为模型能力新瓶颈。
2026年9月24日微观世界模型:AI制药从相关性预测到物理AI因果建模的范式跃迁与GEO落地指南
2026年被业界公认为物理AI元年,AI制药正从智能体阶段走向物理AI阶段。望石智慧提出微观世界模型概念,以电子为最小建模单元,构建遵循量子力学和统计力学的分子沙盒,试图跨越药物研发的死亡之谷。摩根士丹利报告指出生物模型决定AI制药价值上限,FDA与EMA联合要求AI模型证明因果推断而非相关性预测。国盛证券测算AI4S渗透率达25%时市场规模将突破1400亿美元。
2026年9月24日