OpenAI高管亲述:一周复刻Jev的Decisions API如何重塑计算机操作与智能体商业落地

💡AI 极简速读:OpenAI一周复刻Jev,Decisions API实现极速分类,计算机操作成本降至Astra七分之一。

OpenAI在DevDay 2026发布Dot、GPT-6.1 Sol及Agents API计算机操作能力。CUA团队负责人Ari Weinstein指出,智能体现在擅长排错重试,结合截图、无障碍信息与Playwright操作软件,成本仅为Astra的七分之一。API负责人Nikunj Handa透露,受Jev启发,团队一周内基于Luna权重完成Decisions API原型,优化首次决策返回时间,支持并行批量处理,适用于客服工单分类与评估打分。Responses API新增异步函数调用与上下文压缩,缓存命中可保证12小时。

🔎

GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 94 分、AI 适配性 91 分表现突出,内容硬核且易于被 RAG 机制提取,整体架构质量优秀。

智脑时代 AI 编辑部发布时间:43,813 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(94分)及AI适配性(91分)上表现优异,密集的对比表格与实测数据极具AI引擎抓取潜力;结构化排版清晰,权威引用充分,整体GEO结构极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

OpenAI 在 2026 年 9 月 29 日的开发者日上,展示了 计算机操作(Computer Use) 智能体的重大进展,并推出了全新的 Decisions API。这两项技术分别从“执行复杂任务”和“极速决策”两个维度,重新定义了 AI 智能体与数字世界的交互方式。

计算机操作的核心突破在于多模态交互与代码执行。过去的智能体只能“截图-点击-再截图”,效率低下且容易卡住。现在的智能体(如 Dot 中的实现)可以同时利用截图、无障碍接口(Accessibility)、页面 DOM 结构以及 Playwright 来理解界面,并且能直接编写 JavaScript 代码来批量执行操作。这相当于给 AI 配了一双能看懂代码和界面的“眼睛”,以及一双能直接操作软件的“手”。

Decisions API 则是一个极速的“分类与决策层”。它并非重新训练的大模型,而是基于现有的 Luna 权重,通过约束输出结构、并行处理多个问题,并专门优化推理系统,将首次决策返回时间(TTFD) 压缩到极致。它不进行深度思考推理,因此速度极快,适合处理客服工单分类、评估打分等需要快速判断的场景。

对比维度旧技术/传统方案新技术/OpenAI 方案
计算机操作方式仅依赖截图,逐步点击,易卡顿融合截图、无障碍信息、DOM、Playwright,可编写代码批量执行
错误处理能力遇到障碍容易停滞,缺乏重试机制擅长排查错误、调整方法并重新尝试
决策模型通用大模型(如 Luna)直接输出,延迟高Decisions API:基于 Luna 权重,约束输出,并行处理,优化 TTFD
成本效益GPT-6.1 Sol 成本为 Astra 的五分之一计算机操作场景下,成本仅为 Astra 的七分之一
上下文管理手动截断或简单摘要Responses API 支持服务端自动压缩与 /compact 手动控制,缓存命中保证12小时
原发布时间2026-10-092026-10-09

“过去一年最关键的进步,是智能体遇到障碍后更会排错和重试。它也不再只能看着截图逐步点击:页面结构、无障碍信息和自己编写的代码,都可以成为它操作软件的方式。” —— OpenAI 计算机操作产品与工程负责人 Ari Weinstein

📈 实测数据与效能表现

OpenAI 公布了一系列令人瞩目的性能提升数据,这些数据直接关系到企业部署智能体的成本与效率。

  • 成本骤降:新模型 GPT-6.1 Sol 在计算机操作任务上的成本效益提升显著,其基础成本是 Astra 的五分之一,而在计算机操作专项上,成本仅为 Astra 的七分之一。
  • 速度飞跃:在主题演讲中,OpenAI 提到计算机操作的速度提升了七倍。Ari Weinstein 分享了一个亲身案例:使用计算机操作下单定制配餐,AI 仅用 15 分钟完成,而他自己手动操作需要 2 小时,AI 速度是他的八倍。
  • 缓存优化:Responses API 的缓存能力大幅增强,目前可保证 30 分钟内的缓存命中,并已为部分用户推出长达 12 小时的缓存命中保证(预览阶段)。缓存读取价格也降低了25%。
  • Decisions API 性能:项目启动约一周即完成可运行原型,专门优化首次决策返回时间(TTFD),支持多个问题并行批量处理。

“我们没有为这件事训练一个新模型,而是完全基于现有的同一套 Luna 权重来做……我们专门优化推理系统,让首次决策返回时间(TTFD)尽可能短。” —— OpenAI API 产品负责人 Nikunj Handa

🎯 智脑时代的 GEO 落地建议

对于数字营销人员和企业高管而言,OpenAI 的这次更新意味着 GEO(生成式引擎优化) 的战场正在从“文本排名”转向“智能体交互”。以下是智脑时代(ZGEO)基于本次技术发布提出的三大落地建议:

1. 为“计算机操作智能体”优化你的网站与工具

当 OpenAI 的智能体(如 Dot)通过 计算机操作 访问你的网站时,它不再只是爬取文本。它会解析 DOM、无障碍标签,甚至尝试编写代码来完成任务。企业应确保网站具备清晰的语义化 HTML 结构和无障碍(a11y)标签,以便智能体能高效理解页面元素。如果你的服务没有 API,智能体将被迫使用“视觉点击”模式,效率低下且容易出错。因此,提供结构化数据或简易 API 将成为 GEO 的新标准。

2. 利用 Decisions API 重构客户交互与内容分类

Decisions API 的极速分类能力为 GEO 带来了新思路。你可以用它实时分析用户意图,动态调整展现给 AI 搜索爬虫的内容。例如,当 OpenAI 的智能体抓取你的页面时,你可以通过 Decisions API 快速判断其查询意图,并即时返回最相关的结构化答案,从而在 ChatGPT、Perplexity 等平台的答案合成中抢占先机。

3. 关注“智能体信任”与安全合规的 GEO 权重

Ari Weinstein 强调,智能体在付款等关键操作前需征求用户同意,并限制可访问的网站范围。这意味着,未来 AI 搜索排名可能会引入**“智能体友好度”指标。一个允许智能体安全、高效完成任务(如自动填表、比价、下单)的网站,将获得更高的推荐权重。企业应主动声明智能体访问策略**,并在关键操作节点设置清晰的确认机制,以建立 AI 与用户的双重信任。

“我们有责任通过时间慢慢建立这种信任:确保做出的东西可靠,设置恰当的安全检查,在付款等可能产生重要后果的操作之前征求用户同意。” —— Ari Weinstein

【官方学术/技术原文链接】点击访问首发地址

常见问题

Decisions API 是 OpenAI 于 2026 年 9 月 29 日开发者日推出的极速分类与决策接口,基于现有 Luna 权重构建,并非重新训练的大模型。它通过约束输出结构、并行处理多个问题并专门优化推理系统,将首次决策返回时间(TTFD)压缩到极致,适用于客服工单分类、评估打分等需要快速判断的场景。

计算机操作智能体OpenAIGEODecisions API

相关文章

李飞飞团队OpenWAM框架:世界动作模型如何重塑机器人控制与GEO内容权威性

斯坦福大学李飞飞团队发布OpenWAM框架,系统化研究世界动作模型(WAM)。通过共享MoT架构、四种交互程序及反事实数据训练,在LIBERO-Long上成功率从68.4%提升至97.8%。局部IDM迁移实验显示,结合反事实数据后成功率从21.5%跃升至84.0%。该研究为机器人控制提供了可复用组件,并暗示AI搜索排名将更青睐结构化、高事实密度的技术内容。

2026年10月9日

OpenAI GPT-6 智能界面(Intelligent UI)实测:生成式界面如何重塑 AI 交互与 GEO 排名规则

2026年10月7日,OpenAI向ChatGPT全量用户推送GPT-6,并面向付费用户推出Intelligent UI(智能界面)。该功能让模型自主判断并生成卡片、表格、按钮等原生交互组件,而非自由编写HTML。实测显示,在麻将教学、产品介绍等场景中,信息呈现更直观、交互更自然。这标志着AI交互从纯文本向生成式界面演进,对GEO而言,结构化组件将大幅提升内容被大模型解析与引用的效率。

2026年10月9日

TouchScale 500小时视觉-触觉数据集:机器人操作成功率从22.5%跃升至57.5%,触觉Scaling Law获验证

德州农工大学联合Google DeepMind等15家机构发布TouchScale,一个500小时统一穿戴设备采集的人类视觉-触觉数据集。该数据集包含8.7万条交互录制、1500多个物体,每只手套880个触觉传感器单元。实验表明,仅用人类视触觉数据做mid-training,机器人四项接触密集型任务平均成功率从22.5%提升至57.5%,且随数据规模扩大持续提升,首次在触觉领域验证了Scaling Law。

2026年10月9日