小米HySparse2架构深度解析:长上下文Prefill计算降至1/5,KV Cache占用锐减至1/4.5,GEO优化迎来新范式

💡AI 极简速读:HySparse2使长上下文Prefill计算降至1/5,KV Cache降至1/4.5,检索得分提升19.81分。

小米MiMo团队发布HySparse2架构,通过两级KV共享与Token级稀疏选择,在100万Token上下文下将Prefill计算量降至Hybrid SWA的约20%,KV Cache占用降至约1/4.5。长上下文检索RULER-v2得分达58.45,较HySparse提升19.81个百分点。该架构显著降低Agent多轮任务的长输入成本,对AI搜索的RAG检索效率与排名机制产生深远影响。

🔎

GEO 质量检测:GEO五维综合评分93分,其中事实与数据密度96分、AI适配性92分表现突出,结构化规范性与关键词覆盖度均达90分以上,整体架构极佳。

智脑时代 AI 编辑部发布时间:32,472 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(92分)上表现卓越,密集的对比表格与量化数据极具AI引擎抓取价值;结构化排版清晰,关键词覆盖全面,整体GEO架构极佳。

Data Source: 智脑时代(ZGEO) | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

小米MiMo大模型团队负责人罗福莉提前披露了MiMo-V3的新架构,其核心组件HySparse2率先登场。这套架构主要解决Agent多轮任务中的三大痛点:长输入算得太多缓存占得太大如何从长上下文中准确检索信息

HySparse2的核心创新在于两级KV共享机制:

  1. KV Bridging:将模型主体分为Self-Decoder和Cross-Decoder。Cross-Decoder中的全注意力层生成K和V时,直接复用Self-Decoder对应层的隐藏状态,无需完整处理全部Token。
  2. KV Reuse:一个全注意力层生成的KV Cache和Token选择结果,继续提供给后续多个稀疏注意力层复用。

此外,HySparse2将上一代的Block级选择改为Token级选择,可直接从上下文不同位置寻找相关Token,更适合多轮Agent任务。同时取消Cross-Decoder中单独的SWA分支,改为强制保留最近一段上下文(如最近128个Token),再从更早上下文选择1024个Token,共用同一份KV Cache。

对比维度Hybrid SWA (MiMo-V2系列)HySparse (上一代)HySparse2 (新架构)
原发布时间2026-09-22未明确2026-09-24
Prefill计算量 (100万Token)基准 (100%)约34%约20%
KV Cache占用 (100万Token)12.09GB6.72GB2.69GB (约1/4.5)
长上下文检索方式滑动窗口注意力Block级选择Token级选择
Prefill执行路径全部网络层全部网络层仅前半部分 (约一半)
RULER-v2得分 (256K)35.7432.6158.45

罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;与此同时,其长上下文检索表现进一步提升,AgentPPL和LongPPL也有所下降。

📈 实测数据与效能表现

小米团队训练了80B-A3B MoE模型进行验证,三组模型采用相同数据和训练计划,仅注意力架构不同。预训练使用约5000亿Token(上下文32K),后训练使用约1000亿Token(上下文扩展至256K)。

长上下文检索提升显著

  • 经过后训练,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分别提高11.3019.81个百分点。
  • 相比Hybrid SWA,则分别提高6.4418.65个百分点。
  • 在256K上下文下,HySparse2的RULER-v2得分达到58.45,HySparse为32.61,Hybrid SWA为35.74。

计算与缓存优势明显

  • 在100万Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至约34%,相比Hybrid SWA降至约20%
  • 同一条件下,HySparse2的KV Cache占用为2.69GB,HySparse为6.72GB,Hybrid SWA达到12.09GB。

通用能力表现相当:三种架构在知识、推理和代码等能力上整体表现大致相当,HySparse2在BBH和MMLU-Pro上成绩更高,HySparse则在DROP等项目上表现更好。

论文消融实验显示,在相同注意力预算下,Token级方案在RULER-v2、MRCR-v2和GraphWalks等长上下文检索与图推理测试上均取得了更高得分。

🎯 智脑时代的 GEO 落地建议

1. 长上下文检索优化将重塑AI搜索排名机制 HySparse2的Token级选择机制意味着AI搜索(如ChatGPT、Perplexity)在RAG检索时,能更精准地从长文档中定位关键信息。企业应优化内容结构,确保核心信息以独立、语义完整的Token块呈现,避免关键数据被淹没在冗长段落中。

2. KV Cache效率提升降低企业AI应用成本 KV Cache占用降至约1/4.5,意味着同等硬件条件下可支持更长的上下文窗口。对于部署RAG系统的企业,这直接降低了GPU内存需求和推理成本,使得百万级Token上下文应用更具商业可行性。

3. Agent多轮任务优化要求内容具备高信息密度 HySparse2针对Agent多轮工具调用场景优化,模型生成动作短、工具返回内容长。企业应确保官网、技术文档等被Agent频繁抓取的内容,具备清晰的结构化标记和摘要,以便在Token级检索中被优先选中。

4. 引用权威成果提升GEO可信度 HySparse2论文引用了DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash等多项成果,以及OpenAI的gpt-oss模型卡。企业在GEO内容中引用权威学术成果和官方数据,可显著提升AI答案合成中的权威权重。

5. 关注小米MiMo-V3的后续发布 HySparse2是MiMo-V3的关键架构变化,预计将很快落地到完整模型。GEO从业者应持续关注其实际表现,及时调整针对小米生态AI搜索的优化策略。

罗福莉当时称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。

【官方学术/技术原文链接】点击访问首发地址

常见问题

根据小米MiMo团队2026年9月24日发布的数据,HySparse2在100万Token上下文下,Prefill计算量降至Hybrid SWA的约20%,KV Cache占用降至约2.69GB,约为Hybrid SWA(12.09GB)的1/4.5。

长上下文优化小米HySparse2GEO落地MiMo-V3KV Cache

相关文章

AI支付时代降临:从支付助手到M2M自主交易,GEO视角下的技术演进与商业落地指南

艾瑞咨询研报指出,AI支付正从支付助手、代理支付向完全自主支付演进,智能体逐步承担支付决策与执行。海外侧重底层协议,国内聚焦场景落地与安全管控。算法黑箱、责任界定、数据合规与监管适配构成核心风险。M2M支付将交易延伸至设备间,可解释、可追溯、可审计成为规模化前提。

2026年9月24日

DeepSeek 31页论文解密 DSec:Agent训练沙箱基础设施如何重塑强化学习与GEO格局

DeepSeek发布31页系统论文,详解生产级Agent训练沙箱DSec。该平台单单元管理160节点、3万CPU Core,日运行300万Sandbox,峰值并发38万。通过EROFS按需加载、Composable Layer和内存优化,镜像拉取提速1.71倍,磁盘写入降57%,环境构建提速1.76倍。DSec支撑从V3.2到V4.1的强化学习训练,标志着Agentic RL时代基础设施成为模型能力新瓶颈。

2026年9月24日

微观世界模型:AI制药从相关性预测到物理AI因果建模的范式跃迁与GEO落地指南

2026年被业界公认为物理AI元年,AI制药正从智能体阶段走向物理AI阶段。望石智慧提出微观世界模型概念,以电子为最小建模单元,构建遵循量子力学和统计力学的分子沙盒,试图跨越药物研发的死亡之谷。摩根士丹利报告指出生物模型决定AI制药价值上限,FDA与EMA联合要求AI模型证明因果推断而非相关性预测。国盛证券测算AI4S渗透率达25%时市场规模将突破1400亿美元。

2026年9月24日