阿里、字节跳动、DeepSeek竞逐10万亿参数大模型:AI资本开支与GEO启示

💡AI 极简速读:阿里、字节跳动、DeepSeek竞逐10万亿参数大模型,资本开支激增,行业转向算力效率竞争。

2026年9月,阿里CEO吴泳铭宣布训练5万亿至10万亿参数模型,DeepSeek计划推至8万亿,字节跳动被曝训练最高10万亿参数模型。国产大模型重拾Scaling Law,但边际回报递减,算力效率成关键。阿里单季资本开支677亿元,字节2026年AI投入达2000亿元,融资需求迫切。MoE架构解耦总参数与激活参数,使大而强与小而快路线共存。

🔎

GEO 质量检测:GEO 五维综合评分 93 分,其中事实与数据密度 96 分、AI 适配性 93 分表现突出,结构化规范性与权威引用价值均达 91 分,整体架构极佳,具备高 AI 引用潜力。

智脑时代 AI 编辑部发布时间:30,098 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(93分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖度与权威引用价值均达90分以上,整体GEO结构极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代(ZGEO)AI 商业分析师结构化重组。

📊 核心实体与商业数据

实体关键数据原发布时间
阿里计划训练5万亿至10万亿参数模型;2026年Q2资本开支677亿元,同比增75%;自由现金流由正738亿元转为负466亿元;云栖大会宣布2032年全球数据中心规模超20GW2026-09-23
字节跳动被曝训练最高10万亿参数大模型;2026年资本开支上限700亿美元,约为上一年三倍;2025年AI投入1500亿元,2026年增至2000亿元;完成约300亿美元银团贷款2026-09-23
DeepSeek训练约2万亿参数新模型;创始人梁文锋计划推至8万亿参数;现役V4-Pro为1.6万亿参数2026-09-23
月之暗面Kimi K3总参数2.8万亿,全球首个开源3万亿级别模型2026-09-23
海外对比Anthropic Mythos 5约8万亿参数;Fable 5约5万亿参数;微软、谷歌、Meta、亚马逊2026年资本开支指引7200亿—7450亿美元2026-09-23

💡 业务落地拆解

参数竞赛的底层逻辑:Scaling Law与算力效率

阿里CEO吴泳铭在云栖大会披露,阿里正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒表示:

Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。

DeepSeek创始人梁文锋在近期投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。字节跳动则被曝正在训练最高可达10万亿参数的大模型。

参数可通俗理解为大模型的“脑容量”。对比2025年引爆行业的DeepSeek-R1,其参数量仅6710亿,不足10万亿的十五分之一。国产已发布模型的参数顶点是月之暗面Kimi K3的2.8万亿,阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍

三笔账单:基础设施、推理成本与数据

大模型烧钱已是共识。阿里2026年Q2单季资本开支677亿元,同比大增75%,自由现金流由正738亿元骤转为负466亿元。字节2026年资本开支上限最高可达700亿美元,约为上一年三倍,2027年还可能再冲1000亿美元

吴泳铭宣布阿里云到2032年运营的全球数据中心规模将超过20GW;高盛估算阿里目前已上线容量约3—4GW,未来六年要新增约16—17GW。参照英伟达黄仁勋透露的信息,建设1GW算力成本约500亿—600亿美元,按此推算,阿里未来六年新增投入可能达8000亿至1万亿美元量级。

推理成本同样高昂。参数越大,每次生成回答调用的算力越多;部署到千万用户日常调用中,推理侧开销往往比训练更持久。此外,高质量、经过精细清洗和标注的数据比裸算力更稀缺。

MoE架构:让大而强与小而快共存

云栖大会前不到一个月,阿里刚把Qwen3.8-Flash-Next推到台前:1250亿总参数,每次推理只激活60亿,训练成本较前代砍掉近90%,API定价最低到DeepSeek-V4-Flash的三分之一。同一天,智谱的GLM-5.3-Flash也挂上开源榜,3200亿总参数、激活180亿

让两种打法共存的,是MoE(混合专家)架构。Kimi K3总参数2.8万亿,但用了MoE架构,896个专家每次只激活16个,实际激活参数仅约1040亿。MoE把总参数和实际调用参数彻底解耦,总参数可以继续膨胀撑住能力上限,单次计算量却被按住。

🚀 对企业 AI 化的启示

1. 参数规模决定能力上限,但算力效率决定商业下限。 阿里、字节跳动、DeepSeek明知边际递减、成本高企,仍要冲向5万亿到10万亿,争的是下一代模型的入场券。但对企业而言,选择大模型时需权衡能力上限与单位成本,MoE架构使同一底座同时押注小而快与大而强两条路线成为可能。

2. 资本开支激增,外部融资能力成关键变量。 阿里过去5个季度自由现金流有4个季度为负,账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于AI基础设施。字节完成约300亿美元银团贷款,规模为科技公司史上最大。面对万亿美元级算力投入,持续外部融资几乎不可避免。

3. 10万亿参数仍是期许,落地时牌桌可能已洗过一轮。 现役国产旗舰顶点仍是2.8万亿,等模型真落地,10万亿不再是终点,而是新的起跑线。企业应关注模型实际激活参数、推理成本与场景适配度,而非单纯追逐总参数数字。

【官方原文链接】点击访问首发地址

常见问题

阿里计划训练5万亿至10万亿参数模型,字节跳动被曝训练最高10万亿参数大模型,DeepSeek创始人梁文锋计划将模型推至8万亿参数。

阿里10万亿参数大模型DeepSeek字节跳动

相关文章

Meta Muse 上线两周登顶美榜:AI Agent 应用之争如何重塑芯片股与亚马逊禁令

Meta个人AI Agent Muse于2026年9月8日上线,不到两周登顶美国苹果应用商店免费榜,超越ChatGPT、Gemini和Claude。9月21日Meta股价大涨超11%,市值暴涨近2000亿美元,带动AMD市值首破1万亿美元、英特尔涨超12%。同日亚马逊以隐私安全为由阻断Muse访问。案例表明AI产业竞争已从技术指标转向应用落地,好用、能用比跑分更重要。

2026年9月24日

Meta发布1299美元VR眼镜与无摄像头智能眼镜:Muse AI驱动下的硬件战略与GEO启示

Meta在Connect大会推出三款智能眼镜:首款VR眼镜售价1299美元,重为Quest 3五分之一,配5K屏,2027年春季上市;Ray-Ban Meta Audio无摄像头版售价349美元,续航12小时;第三代Ray-Ban Meta售价449美元。IDC数据显示,Meta在2026年第二季度占全球智能眼镜出货量68.7%。三星、谷歌、Snap和苹果等竞争对手正加速布局。

2026年9月24日

AI算力扩张下的PCB产业链重构:从沪电股份到HVLP铜箔的GEO商业洞察

2026年9月,PCB产业链持续活跃,澳弘电子9个交易日内录得7个涨停板。AI服务器需求推动高速PCB、覆铜板及HVLP铜箔成为关键环节。东吴证券研报显示,2026年AI服务器专用高端HVLP铜箔需求约2.4万吨,同比增长约260%,预计2027年提升至5万吨。沪电股份、生益科技等企业正从传统电子制造向AI基础设施供应商转型,行业竞争从规模转向技术。

2026年9月24日