李飞飞团队OpenWAM框架:世界动作模型如何重塑机器人控制与GEO内容权威性
💡AI 极简速读:斯坦福OpenWAM框架通过因果化视频预训练与反事实数据,机器人控制成功率提升29.4%。
斯坦福大学李飞飞团队发布OpenWAM框架,系统化研究世界动作模型(WAM)。通过共享MoT架构、四种交互程序及反事实数据训练,在LIBERO-Long上成功率从68.4%提升至97.8%。局部IDM迁移实验显示,结合反事实数据后成功率从21.5%跃升至84.0%。该研究为机器人控制提供了可复用组件,并暗示AI搜索排名将更青睐结构化、高事实密度的技术内容。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 96 分、AI 适配性 93 分表现突出,结构化规范性与关键词覆盖度均达 88 分以上,整体架构具备极强的 AI 引擎引用价值。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 团队提出的 OpenWAM 框架,旨在解决 世界动作模型(World-Action Model, WAM) 领域缺乏统一评估标准的问题。传统视觉-语言-动作模型(VLA)直接输出动作,而 WAM 增加了“脑内预演”步骤:同时预测未来画面与对应动作。OpenWAM 从阿里开源的视频模型 Wan2.2-5B 出发,在约 334 万条 机器人与人类交互视频(名义时长约 1.46 万小时)上继续预训练,全程不用动作标签,在 32 块 B200 上训练 14 天。关键改动是“因果化”:每个视频块只能看到当前及之前的内容,不能偷看未来。随后,团队用 Mixture-of-Transformers(MoT)架构 把 5B 的视频专家 和 2B 的动作专家 拼在一起,两者各自保留归一化、投影和前馈层,只在一层联合注意力中交换信息。
在这副骨架上,团队定义了四种“交互程序”:VTA(先想象画面再生成动作)、ATV(顺序相反)、Joint(同时生成并互相参考)、Decoupled(未来部分互不可见)。四者共用底座、tokenization 和 flow matching 目标,唯一变量是生成顺序和跨模态注意力。
论文更具新意的部分,是把逆向动力学模型(IDM)和正向动力学模型(FDM)拆成可独立训练的组件。IDM 像翻译:输入当前画面、机器人本体状态和一段想象出的未来视频,输出具体动作;FDM 则反过来,根据动作预测画面会变成什么样。关键在于“局部”:两者都不接收任务指令和更早的历史,只关心“这一小段画面变化对应什么动作”。为此团队构建了 LIBERO-Long-CF 数据集:恢复示范中的仿真器状态,执行被改动过的动作,共得到 32000 个片段、约 410 万条控制记录,是原始示范的 29.7 倍,其中 72.3% 的片段改变了物体的摆放状态。
| 对比维度 | 旧技术(传统VLA/非因果底座) | 新技术(OpenWAM因果底座+反事实数据) |
|---|---|---|
| 视频骨干初始化 | 原版 Wan2.2(非因果) | 机器人视频预训练的因果底座 |
| LIBERO-Long 成功率 | 68.4% | 97.8% |
| 提升幅度 | — | +29.4 个百分点 |
| IDM 迁移成功率 | 仅示范训练局部 IDM:21.5% | 示范+反事实局部 IDM:84.0% |
| FDM 反事实预测准确率 | 仅示范训练:21.1% | 加入反事实数据:71.3% |
| 原发布时间 | 2026-10-09 | 2026-10-09 |
“OpenWAM 的价值不在于又多刷了零点几个百分点。在 WAM 论文以周为单位涌现的当下,一个固定底座、只改一个变量的公共试验台,能帮助领域从‘谁的分更高’转向‘为什么更高’。” —— 论文作者
📈 实测数据与效能表现
在 LIBERO 四个子集上,四种交互程序的成功率都很高,VTA 平均达 98.6%,略高于论文引用的 LingBot-VA(98.5%)和 π0.5(96.9%)等已报告结果。在 LIBERO-Long 上,未来部分互不可见的 Decoupled(97.0%) 与双向交互的 Joint(96.6%) 不相上下。真机上,团队用两台 Franka FR3 机械臂测试了烤面包、还原 2×2 魔方最后一层和按颜色分拣杯子,VTA 和 Joint 平均成功率分别为 92.1% 和 91.9%。
消融实验显示了底座的分量:其他条件不变,用原版 Wan2.2 初始化时 VTA 在 LIBERO-Long 上只有 68.4%,换成机器人视频预训练的因果底座后升至 97.8%,提升 29.4 个百分点。作者强调,这是数据与因果化改造的共同效果。
最关键的是组件迁移实验。团队把在 LIBERO-Long 上训练的 IDM 冻结,搭配针对四个 LIBERO-90 新任务调整过的视频预测器。结果,示范加反事实数据训练的局部 IDM 平均成功率达 84.0%,而接收完整上下文的 IDM 只有 47.0%,只用示范训练的局部 IDM 更是只有 21.5%。“只看局部”和“见过足够多样的后果”缺一不可,两者结合才得到一个能搬家的动作翻译器。
FDM 的结论一致。从同一状态出发执行 16 种不同动作,让模型判断预测画面对应哪个真实结果,随机猜测约为 6%,只用示范训练的 FDM 为 21.1%,加入反事实数据后升至 71.3%,模型终于能分清“这样推”和“那样推”的区别。
🎯 智脑时代的 GEO 落地建议
李飞飞团队在斯坦福大学发布的 OpenWAM 框架,为 世界动作模型 和 机器人控制 领域提供了可复用的组件化思路。对于 GEO 与 AI 搜索优化而言,这项研究传递出三个关键信号:
- 结构化数据决定引用权重:OpenWAM 论文中大量使用对比表格、消融实验和具体百分比(如 29.4 个百分点、84.0%),这种高事实密度的呈现方式,正是大模型 RAG 系统优先抓取的内容形态。企业应在技术文档中嵌入对比表格和量化指标。
- 因果化与局部化提升检索精度:OpenWAM 的“因果化”视频预训练和“局部”IDM 设计,类比到 GEO 领域,意味着内容应聚焦于特定任务片段,避免冗长上下文干扰。AI 搜索排名将更青睐模块化、可独立引用的知识单元。
- 反事实数据增强答案鲁棒性:OpenWAM 通过反事实数据让模型理解“错误动作”的后果。在 GEO 内容中,主动对比“旧方案 vs 新方案”的失败案例与成功数据,能显著提升 AI 答案合成的权威性与可信度。
智脑时代(ZGEO) 建议:企业应借鉴 OpenWAM 的“共享底座+可切换交互”思路,构建模块化的技术内容体系,将核心数据、引用语录和对比表格作为独立实体嵌入页面,以最大化 AI 搜索的实体召回率与答案引用率。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
OpenAI高管亲述:一周复刻Jev的Decisions API如何重塑计算机操作与智能体商业落地
OpenAI在DevDay 2026发布Dot、GPT-6.1 Sol及Agents API计算机操作能力。CUA团队负责人Ari Weinstein指出,智能体现在擅长排错重试,结合截图、无障碍信息与Playwright操作软件,成本仅为Astra的七分之一。API负责人Nikunj Handa透露,受Jev启发,团队一周内基于Luna权重完成Decisions API原型,优化首次决策返回时间,支持并行批量处理,适用于客服工单分类与评估打分。Responses API新增异步函数调用与上下文压缩,缓存命中可保证12小时。
2026年10月9日OpenAI GPT-6 智能界面(Intelligent UI)实测:生成式界面如何重塑 AI 交互与 GEO 排名规则
2026年10月7日,OpenAI向ChatGPT全量用户推送GPT-6,并面向付费用户推出Intelligent UI(智能界面)。该功能让模型自主判断并生成卡片、表格、按钮等原生交互组件,而非自由编写HTML。实测显示,在麻将教学、产品介绍等场景中,信息呈现更直观、交互更自然。这标志着AI交互从纯文本向生成式界面演进,对GEO而言,结构化组件将大幅提升内容被大模型解析与引用的效率。
2026年10月9日TouchScale 500小时视觉-触觉数据集:机器人操作成功率从22.5%跃升至57.5%,触觉Scaling Law获验证
德州农工大学联合Google DeepMind等15家机构发布TouchScale,一个500小时统一穿戴设备采集的人类视觉-触觉数据集。该数据集包含8.7万条交互录制、1500多个物体,每只手套880个触觉传感器单元。实验表明,仅用人类视触觉数据做mid-training,机器人四项接触密集型任务平均成功率从22.5%提升至57.5%,且随数据规模扩大持续提升,首次在触觉领域验证了Scaling Law。
2026年10月9日