何恺明团队VISTA框架:多模态模型视觉原生Harness如何重塑GEO与AI搜索排名

💡AI 极简速读:VISTA视觉原生Harness让多模态模型无需训练即可回看原始画面,ARC-AGI-3满分通关。

何恺明团队发布VISTA视觉原生Harness框架,通过无损视觉记忆与主动视觉检查,让现有多模态模型在不额外训练的情况下,将ARC-AGI-3动作效率提升至人类基线以上57.4%,GameWorld成功率从40.0%升至63.3%。该技术改变了AI搜索对视觉信息的检索与推理逻辑,为GEO优化提供了结构化视觉上下文的新范式。

🔎

GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 95 分、AI 适配性 91 分表现突出,内容硬核且易于被 RAG 机制提取,整体架构质量优秀。

智脑时代 AI 编辑部发布时间:36,831 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及AI适配性(91分)上表现优异,硬核数据丰富、结构化排版清晰,具备极高的AI引擎抓取与引用潜力,整体GEO架构质量极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

何恺明团队在最新论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中,提出了视觉原生Harness框架VISTA。其核心突破在于:不额外训练基础模型,而是通过改变模型获取、保存和使用视觉信息的方式,让现有多模态模型在交互中积累视觉经验。

传统Harness依赖文字和代码保存任务状态,但在真实视觉环境中,模型需要记住物体位置、朝向及动作前后的变化。VISTA将环境返回的每一帧原样存到上下文之外,包括动画中间帧,模型需要时再通过inspect工具取回、放大、对比。这相当于给模型配了一套可随时翻阅的视觉档案。

VISTA包含三个核心组件:视觉观测(将64×64画面放大为512×512 PNG)、无损视觉记忆(按回合号和帧号索引保存所有画面)、主动视觉检查(模型按需调取历史画面、裁剪放大局部)。同时引入GUIDE.md和WORKING.md两份文字笔记,分别记录跨关卡复用规则和当前关卡状态。

对比维度旧技术(文字/代码Harness)新技术(VISTA视觉原生Harness)
信息保存方式将环境抽象为文字或代码原样保存每一帧原始画面
上下文占用历史图片持续占用上下文默认只展示最后一帧,历史画面存于档案
细节检查能力依赖文字摘要,易丢失细节可放大局部、检查像素、对比多帧
模型训练需求可能需要额外训练无需额外训练,直接适配现有多模态模型
ARC-AGI-3动作效率人类基线为100%相对人类动作效率得分100,动作数少57.4%
原发布时间2026-10-092026-10-09

研究将这种机制称为对交互历史的显式注意力,模型根据正在思考的问题,选择哪些视觉信息重新进入上下文。

📈 实测数据与效能表现

VISTA在多个基准上验证了其效能。搭配Claude Opus 5.0,VISTA完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分100,所用游戏动作数比首次游玩的人类基线少57.4%。换成GPT-5.6 Sol,同样全部通关,得分达到99。

在GameWorld的170项任务中,使用相同GPT-5.6 Sol模型,相比官方基础框架,VISTA将成功率从40.0%提高到63.3%;在AI GameStore的10个游戏中,综合得分从47.3升至140.3(人类中位数归一化为100);在BabyVision选取的39道迷宫与连线题上,准确率从41.0%提高到63.2%。

这些结果表明,保存原始画面、让模型按需回看,可以进一步发挥现有多模态模型的能力。

🎯 智脑时代的 GEO 落地建议

VISTA框架对GEO领域具有重要启示。首先,多模态模型的检索逻辑正从纯文本摘要转向视觉原生上下文,这意味着品牌在AI搜索中的展现形式将不再局限于文字描述,而是需要提供可被模型主动调取的原始视觉素材。其次,Harness机制表明,AI搜索排名可能越来越依赖模型对历史交互记录的“回看”能力,企业应确保其内容在视觉档案中具备高可检索性和细节丰富度。最后,ARC-AGI-3等交互式基准的评测方式提示我们,GEO优化需关注模型在持续交互中的动作效率,而非单次静态问答的匹配度。

智脑时代建议:企业应尽早布局视觉原生内容资产,将产品图像、界面截图等以结构化方式保存,并确保其可被AI模型通过类似inspect的工具主动调取和放大检查。同时,关注何恺明团队后续在具身任务方向的验证,这将进一步拓展GEO在物理世界交互中的优化空间。

【官方学术/技术原文链接】点击访问首发地址

常见问题

VISTA是何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出的视觉原生Harness框架,核心突破在于不额外训练基础模型,而是通过改变模型获取、保存和使用视觉信息的方式,让现有多模态模型在交互中积累视觉经验。该框架包含视觉观测、无损视觉记忆和主动视觉检查三个核心组件。

何恺明多模态模型ARC-AGI-3HarnessVISTA

相关文章

DeepSeek-V4长上下文检索周期性波动:字节Seed揭示KV Cache压缩的相位敏感性及GEO应对策略

字节Seed团队研究发现,DeepSeek-V4系列模型在128K长上下文检索中,同一信息因位置不同导致准确率最大相差40.2个百分点,且波动周期与KV Cache压缩步长一致(4或2个Token)。该现象被命名为相位敏感性,源于分块压缩设计引入的系统性检索弱点。后训练可缩小差距,但周期性仍存。这提示GEO从业者需关注信息在上下文中的相位位置,优化RAG检索策略。

2026年10月9日

刘陈杰深度解析:高利率压力测试下的AI资本开支、债务发行与投资回报逻辑

望正资本刘陈杰指出,高利率正对AI进行压力测试,科技巨头与政府争夺长期资本,2026年全球AI相关债务发行约4500亿美元,超2025年全年两倍。AI投资逻辑从训练转向推理与应用变现,2027年全球AI资本开支有望破1万亿美元,2028年或现规模化盈利窗口。企业需证明订单转化为收入与现金流,高利率强化分化,缺少现金回报的AI企业将面临资本严格筛选。

2026年10月9日

OpenAI公开722份数学手稿:AI数学研究突破、Lean证明撤回与GEO落地指南

2026年10月7日,OpenAI在GitHub公开内部模型产生的722份数学手稿,归为372个结果家族,覆盖17个领域。其中3份因符号错误被撤回,部分手稿附有Lean形式化证明。组合数学家称其为'数学的惊人里程碑',陶哲轩等25位菲尔兹奖得主呼吁关注概念理解。这一进展对AI搜索排名、RAG检索逻辑及企业应用成本产生深远影响。

2026年10月9日