世界模型与VLA之争:具身智能的资本热潮与商业落地挑战
💡AI 极简速读:世界模型投资2025年达69亿美元,但技术路线未收敛,商业化面临ROI考验。
2026年,具身智能领域围绕世界模型与VLA的技术路线之争持续升温,世界模型相关投资从2024年的14亿美元激增至2025年的69亿美元,但行业尚未形成统一标准。光象科技、World Labs等公司加速布局,但商业化落地仍面临数据成本高、投资回收期短等挑战。本文分析技术分歧、资本动态及对企业AI化的启示。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分,内容扎实且易于 AI 提取,整体结构优秀。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
进入2026年,机器人行业的焦点正从本体转向“大脑”,世界模型迅速升温。然而,关于机器人行动架构的技术路线之争(VLA vs 世界模型)仍未收敛,资本已提前下注,但商业化落地仍面临现实考验。
📊 核心实体与商业数据
| 实体/数据 | 详情 |
|---|---|
| 光象科技 | 发布第一代物理原生世界模型Phi-WM 1.0 ActEffect,联合清华大学李升波教授课题组 |
| World Labs | 2026年2月完成10亿美元新融资,聚焦空间智能和世界模型 |
| AMI Labs | 2026年3月完成10.3亿美元融资,核心方向为真实世界建模、推理和规划 |
| 投资增长 | 世界模型相关投资从2024年14亿美元增至2025年69亿美元,增长近5倍 |
| 市场规模 | 2025年中国工业具身智能机器人市场规模约57.4亿元(IDC数据) |
| 投资回收预期 | 超过**80%**的制造企业希望项目两年内实现投资回收 |
| 原发布时间 | 2026-08-28 |
💡 业务落地拆解
技术路线分歧:VLA vs 世界模型
具身智能的“大脑”讨论主要围绕VLA(视觉-语言-动作模型)和世界模型两类思路。VLA通过机器人示范数据学习动作生成,而世界模型(如Sora、World Labs的空间智能模型、JEPA)通过海量数据学习世界统计表征,预测未来变化。
光象实验室首席科学家吕尧指出,VLA路线已触碰天花板,语言模型与动作专家头之间存在模态鸿沟,仅靠超大规模数据训练难以实现通用策略。而世界模型概念仍缺乏统一定义,李飞飞与World Labs团队将其分为渲染器、模拟器和规划器三类,VLA被归入规划器,表明两者并非互斥。
数据与成本挑战
尽管世界模型被视为降低数据需求的途径,但吕尧认为纯视频预测型世界模型未必能减少数据需求,反而可能需更多数据。他提出,反事实试错数据可能是真实成功示范的10倍甚至100倍,但真机后训练数据量约十几到几十小时,最多不超过100小时。光象科技通过将试错放入仿真环境,降低昂贵真机数据需求。
商业化ROI之争
IDC数据显示,80%以上制造企业要求项目两年内回本,技术路线之争最终演变为ROI之争。工业客户更关注快速部署、稳定运行和回本周期,而非具体技术路线。
🚀 对企业AI化的启示
- 技术选型需以业务价值为导向:企业应关注AI解决方案能否在预期时间内创造实际ROI,而非盲目追逐热门技术概念。
- 数据策略决定落地成本:世界模型可能减少部分真机数据需求,但需评估仿真数据获取成本与模型训练投入。
- 关注生态合作与标准化:行业缺乏统一标准,企业应积极参与或关注标准制定,降低集成风险。
- 资本热潮下的理性决策:世界模型投资激增,但行业可能经历洗牌,企业需构建核心技术护城河与真实交付能力。
吕尧判断:“(具身智能)行业很可能像当年的自动驾驶一样,经历一次大洗牌,资本市场最终会回归理性,缺乏核心技术护城河与真实交付能力的企业将率先出局。”
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日