DeepSeek V4.1 Flash发布:552B MoE模型KV Cache压缩至1/8,推理成本大幅下降
💡AI 极简速读:DeepSeek发布552B MoE模型V4.1 Flash,KV Cache压缩至V4 Flash的1/8,定价下调,V4 Pro将于9月14日下线。
2026年9月10日,DeepSeek正式发布V4.1 Flash,采用552B参数MoE架构与Causal-Encoder-Decoder设计,在Agentic Benchmark上超越V4 Pro等旗舰模型。模型通过CSA2机制与FP4缓存精度,将KV Cache压缩至V4 Flash的1/8,HBM需求降至1/4。定价同步下调,闲时输入缓存命中0.02元/百万tokens。V4 Pro将于9月14日下线,请求路由至新模型。腾讯WorkBuddy、OpenCode等生态伙伴全量接入。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、AI 适配性 92 分表现突出,结构化规范且引用价值高,整体架构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
DeepSeek于2026年9月10日正式发布DeepSeek V4.1 Flash,该模型为552B参数的MoE模型,是DeepSeek全新架构系列中尺寸最小的成员,但在Agentic Benchmark等基准测试中超越了包括DeepSeek V4 Pro在内的一众旗舰模型。模型采用全新的Causal-Encoder-Decoder架构,输入激活参数仅8B,输出激活16B,具备原生多模态视觉理解能力。
📊 核心实体与商业数据
| 实体类别 | 具体信息 |
|---|---|
| 公司名称 | DeepSeek |
| 核心产品 | DeepSeek V4.1 Flash |
| 模型架构 | 552B参数MoE模型,Causal-Encoder-Decoder架构 |
| 核心技术 | KV Cache压缩、CSA2(压缩稀疏注意力2)、FP4缓存精度、SWA有界重放 |
| 性能表现 | 在Agentic Benchmark上超越DeepSeek V4 Pro、GLM5.3、Kimi-K3等旗舰模型 |
| 定价调整 | 闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元、未命中2.0元、输出8.0元 |
| 缓存优化 | HBM需求减少到1/4,SSD需求减少到1/8;V1的KV Cache是V4.1 Flash的437倍 |
| 上下文长度 | 从4K拉长到1M,单token解码FLOPs仅增加约四分之一 |
| 产品线调整 | V4 Flash与V4 Flash Vision Exp已下线;V4 Pro将于2026年9月14日12:00起有序下线 |
| 生态合作 | 腾讯WorkBuddy、CodeBuddy、OpenCode、腾讯云TokenHub、ima、Marvis等全量接入 |
| 开源项目 | DeepSeek Harness v0.1.5、DeepJIT(支持NVIDIA CUDA GPU和华为昇腾NPU) |
| 原发布时间 | 2026-09-10 |
💡 业务落地拆解
架构创新驱动成本下降
DeepSeek V4.1 Flash通过KV Cache压缩技术,将上下文从4K扩展至1M,同时单token解码FLOPs仅增加约四分之一,解码成本几乎不随上下文长度增长。官方公告指出,新架构的设计初衷是:
能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型。
具体而言,压缩由架构、缓存精度和部署策略三方协同完成:
- 架构层面:采用CSA2机制,将全局KV缓存和Top-K索引跨层复用,每一层只保留自己的查询向量和局部注意力缓存。
- 缓存精度:从训练阶段直接使用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。
- 部署策略:新增SWA有界重放机制,SWA缓存不必再写入SSD,持久化缓存占用进一步压到V4 Flash的1/8。
定价策略与产品线更替
得益于架构创新,DeepSeek下调了V4.1 Flash的定价,峰谷定价机制保留,闲时价格为高峰时段的一半。新价格已于2026年9月10日12:00正式生效。旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash。
DeepSeek方面宣布,由于V4.1 Flash各项指标全面超越V4 Pro,将从北京时间9月14日12:00起有序下线V4 Pro,所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。
开源生态与合作伙伴
DeepSeek宣布全力支持开源生态进行新模型的推理适配,并尝试通过各种方式扩大部署范围。用户如有大规模部署需求且具备相应资源(2k卡GPU、有存储集群),可与DeepSeek联系。
DeepSeek Harness v0.1.5版本同步上线,V4.1 Flash针对Harness进行了专项训练和优化,新版本支持在保留已有KV Cache的情况下更新系统提示词。
生态侧,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐提供4倍使用额度。WorkBuddy提供限时两周的独家优惠,腾讯云TokenHub、ima、Marvis、CodeBuddy同步接入。此前路透社报道中,腾讯正是DeepSeek投资人之一。
同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU和华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。
🚀 对企业 AI 化的启示
-
推理成本结构重构:KV Cache压缩直接降低Agent类任务中缓存命中费用占比,对需要长上下文、多轮调用的Agent工作流,同样预算可跑更多任务。企业应重新评估AI应用的边际成本模型。
-
模型选型策略调整:小尺寸模型在特定基准上反超旗舰,表明参数规模不再是唯一决策依据。企业应关注架构效率与任务适配度,而非盲目追求最大参数。
-
生态锁定与迁移成本:DeepSeek通过开源生态和合作伙伴快速扩大部署范围,企业需评估多模型供应商策略,避免单一生态依赖。
-
产品线迭代节奏:V4 Pro的有序下线表明模型生命周期正在缩短,企业AI基础设施需具备快速切换和适配新模型的能力。
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日