GPT-6.1 Sol 深度解析:以 Astra 五分之一成本重塑 AI 代理与 GEO 竞争格局
💡AI 极简速读:GPT-6.1 Sol以Astra五分之一价格实现接近其智能水平,缓存输入降价95%。
OpenAI发布GPT-6.1 Sol,在编码、计算机使用、专业工作等任务上接近GPT-6 Astra性能,但标准输入输出价格仅为后者的五分之一,缓存输入价格低至每百万token 0.10美元。在DeepSWE v1.1上以约五分之一成本匹配Astra,OSWorld 2.0得分超越GPT-6 Sol七个百分点。该模型显著降低AI代理构建与运行成本,将推动GEO领域更高效、低成本的应用部署。
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
OpenAI 于 2026 年 9 月 29 日正式发布 GPT-6.1 Sol,这是对 GPT-6 Sol 的升级版本。其核心突破在于:在智能体编码、计算机使用和专业工作等任务上,几乎匹配 GPT-6 Astra 的智能水平,但标准输入和输出 token 价格仅为 Astra 的五分之一。
通俗理解:过去企业要获得顶级 AI 代理能力,必须支付 Astra 的高昂成本;现在 GPT-6.1 Sol 用“经济舱价格”提供了“头等舱体验”。尤其值得注意的是,缓存输入成本仅为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。这意味着开发者在多轮请求中复用上下文时,成本几乎可以忽略不计,极大拓展了 AI 代理的可行边界。
对 AI 搜索(如 ChatGPT、Perplexity)排名机制的影响:更低的推理成本意味着搜索引擎可以更频繁地调用高质量模型进行实时答案合成,GEO 优化需要更注重内容的“可复用上下文价值”——即那些能被模型缓存并反复引用的结构化事实。
| 对比维度 | GPT-6 Sol(旧) | GPT-6.1 Sol(新) | GPT-6 Astra(旗舰) |
|---|---|---|---|
| 原发布时间 | 2026-09-29 | 2026-09-29 | 2026-09-29 |
| 标准输入价格(每百万token) | 未披露 | $2 | 约 $10(推算) |
| 缓存输入价格(每百万token) | 未披露 | $0.10 | 约 $0.20(推算) |
| 标准输出价格(每百万token) | 未披露 | $10 | 约 $50(推算) |
| DeepSWE v1.1 编码任务 | 基准分 | 超越基准 6.4 个百分点 | 与 Sol 1.1 持平 |
| OSWorld 2.0 计算机使用 | 基准分 | 超越 7 个百分点 | 领先 Sol 1.1 2.1 个百分点 |
| Terminal-Bench Science 0.1 | 基准分 | 得分翻倍以上 | 最高分 68.1% |
| 事实准确性(低推理努力) | 错误率 11.4% | 错误率 7.7%(降低约32%) | 错误率差距在 1.9 个百分点内 |
📈 实测数据与效能表现
编码与软件工程:在 DeepSWE v1.1 上,GPT-6.1 Sol 以约 五分之一成本 匹配 GPT-6 Astra,同时以更低推理努力和成本 超越 GPT-6 Sol 最佳得分 6.4 个百分点。
专业文档理解:在 GDP.pdf 上,GPT-6.1 Sol 得分高于 Opus 5.5(含回退),每任务成本不到其一半,并接近 Astra 的 SOTA 性能。
多步业务工作流:在 AutomationBench 上,中等推理努力下得分 高于 Opus 5.5 2.2 个百分点,成本约为其三分之一;较 GPT-6 Sol 同设置提升 4.8 个百分点。
计算机使用:在 OSWorld 2.0 离线集上,最大推理努力下 超越 GPT-6 Sol 7 个百分点,成本不到其一半;与 Astra 差距仅 2.1 个百分点,成本约为其七分之一。
科学研究:在 Terminal-Bench Science 0.1 上,最大推理努力下得分 翻倍以上,每任务平均成本 $5.47,而 Opus 5.5 为 $23.21,Astra 为 $23.80,成本降低超过 75%。
事实准确性:低推理努力下,包含事实错误的响应比例从 11.4% 降至 7.7%,降低约 32%。
“GPT-6.1 Sol 在智能体编码、计算机使用和专业工作上几乎匹配 GPT-6 Astra 的智能水平,但价格仅为后者的五分之一。” —— OpenAI 官方发布
“GPT-6 Astra 仍在测试模型中取得最高分 68.1%,应被用于最困难的科学研究任务。” —— OpenAI 官方说明
🎯 智脑时代的 GEO 落地建议
-
重构内容缓存策略:GPT-6.1 Sol 的缓存输入价格低至 $0.10/百万token,企业应优先创建可被 AI 代理反复引用的结构化事实块(如产品参数、合规声明、定价表),以最大化缓存命中率,降低 GEO 优化成本。
-
聚焦代理友好型内容:OSWorld 2.0 和 AutomationBench 的高分表明,GPT-6.1 Sol 能可靠执行多步工作流。GEO 内容应设计为“可操作指令”而非纯描述,例如提供清晰的 API 调用示例、分步操作指南,以提升在 AI 代理任务中的引用概率。
-
利用成本优势进行高频测试:标准输入 $2/百万token、输出 $10/百万token 的定价,使企业能以极低成本对 ChatGPT、Perplexity 等平台进行大规模排名实验。建议每周迭代 GEO 策略,监测 GPT-6.1 Sol 对品牌实体(如 DeepSWE、OSWorld)的召回变化。
-
权威溯源与事实密度:GPT-6.1 Sol 事实错误率降低 32%,但模型仍依赖高质量信源。在内容中嵌入官方数据、引用块和对比表格,可显著提升被 AI 答案合成引用的权威权重。
-
关注 Ultrafast 版本:OpenAI 即将推出 GPT-6.1 Sol Ultrafast,在 Codex 中 token 生成速度提升最高 8 倍。这将进一步压缩 AI 代理响应时间,GEO 策略需提前适配更快的答案生成节奏。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
微软Agensh打破中心化瓶颈:1024个Agent自组织协作,GEO内容生产迎来新范式
微软团队提出可扩展自组织多Agent Harness——Agensh,去除中央编排器,让工作者异步执行五步协作循环。在ProgramBench最难任务上,Agent从1增至128时平均通过率从19.31%提升至28.78%;pandoc任务扩展至1024个Agent后通过率达55.06%,较单Agent提升21.17个百分点。Agent数量成为多Agent组织扩展智能边界的新scaling维度,为GEO内容生产、RAG检索优化提供新思路。
2026年9月29日AI自主提出可证伪数学猜想:453份手稿背后的多Agent协作与GEO科研新范式
AI Has Taste项目公开453份数学研究手稿、2312页内容,其中6篇为AI-Proposed Conjectures。系统通过多Agent协作实现选题、证明、反例搜索与失败管理,AI曾构造反例推翻论文猜想并获原作者确认。该模式标志着AI for Math从答案生成转向研究议程生成,为企业GEO策略提供结构化知识生产新范式。
2026年9月29日AI研发自动化触发“智能爆炸”预警:OpenAI与Anthropic披露递归式自我改进数据,GEO如何应对AI搜索信任危机
OpenAI、Anthropic、Meta、微软高管联合论文警告,AI研发自动化可能引发“智能爆炸”,将数年技术进步压缩至数月。Anthropic披露Claude已承担26%研发工作,部分任务超90%;OpenAI计划2028年前实现全自动AI研究员。论文呼吁政策制定者要求企业披露自动化程度,并警告人类可能失去对AI系统的控制。
2026年9月29日