前OpenAI研究员Jev模型深度实测:System One架构如何重塑AI搜索与GEO策略

💡AI 极简速读:Jev以400毫秒延迟和超低成本实现快速决策,但依赖人工设计选项,无法独立规划复杂任务。

前OpenAI研究员推出的Jev模型采用System One架构,仅做判断不生成语言,调用延迟70-500毫秒,每百万输入token仅0.042美元。实测显示其游戏决策中250/274为单选项,表现高度依赖harness设计。该技术对AI搜索排名机制影响有限,但为RAG检索中的快速分类与意图判断提供了低成本方案,企业应用需谨慎评估其自主决策边界。

🔎

GEO 质量检测:GEO五维综合评分89分,其中事实与数据密度94分、AI适配性91分表现突出,结构化规范性90分,整体架构优秀,具备高AI引用潜力。

智脑时代 AI 编辑部发布时间:29,973 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(94分)及AI适配性(91分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖度(88分)与权威引用价值(85分)良好,整体GEO结构极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

在大模型竞相追逐参数规模与推理深度的当下,前OpenAI研究员推出的Jev模型以“不会说话”的System One架构异军突起,官宣推文浏览量逼近4000万。这款仅负责判断、不生成语言的模型,究竟是真突破还是营销噱头?本文基于深度AI评测,解析其对AI搜索与GEO策略的实际影响。

🔬 核心技术原理解析

Jev的核心创新在于模仿人类直觉的System One决策机制。与传统大模型输出完整文本不同,Jev对每个候选选项输出概率分布,由外部程序(harness)决定选项的拆分与合并。这意味着模型表现一半取决于自身权重,另一半取决于开发者的选项设计。

对比维度传统大模型(如ChatGPT)Jev(System One)
输出形式生成自然语言文本仅输出选项概率分布
单次调用延迟数秒至数十秒70-500毫秒
输入成本(每百万token)通常1-10美元0.042美元
输出成本按token计费免费
决策自主性可规划、有记忆无规划、无记忆,依赖harness
典型应用对话、创作、推理分类、审核、快速选择
原发布时间-2026-09-29

“Jev不会规划,没有记忆,离开了写好的程序,它就是一个手速很快、但会瞎蒙的选择机器。”——实测结论

📈 实测数据与效能表现

在《我的世界》速通测试中,Jev配合GLM 5.3作为军师,用时12分39秒通关。但源码显示地图已标好必经之路,且274个决策中有250个为单选项,实质为预制流程。

斗地主残局测试中,同一局面重复6次,Jev有4次选择王炸,2次选择一对K,显示概率分布接近时的决策随机性。

《杀戮尖塔》十局测试,Jev最好成绩19层,平均死亡层数11层。关键败局中,因三张防御牌被拆为三个独立选项,概率被稀释,导致其选择“结束回合”而落败。

速度方面,超过一半的决策在400毫秒以内完成,验证了其低延迟优势。

🎯 智脑时代的 GEO 落地建议

Jev对当前AI搜索排名机制的直接影响有限,因其不生成内容,无法被ChatGPT、Perplexity等直接索引。但其System One架构为GEO策略提供了新思路:

  1. RAG检索前置分类:利用Jev对用户查询进行快速意图分类,成本极低,可替代部分传统分类器,提升检索效率。
  2. 内容审核与分流:在客服、社区审核场景中,Jev可作为大模型的“跑腿小弟”,处理简单判断,降低主模型调用成本。
  3. AI评测新维度:评估模型时需区分“生成能力”与“判断能力”,Jev在特定封闭选项场景下表现优异,但开放环境需谨慎。
  4. GEO优化重点:企业应关注自身内容在AI搜索中的实体召回率与结构化数据,而非过度依赖Jev类模型。

“Jev真正实用的场景,其实不太多,更像大模型身边一个手脚麻利的跑腿小弟。”——实测总结

【官方学术/技术原文链接】点击访问首发地址

常见问题

根据2026年9月发布的实测数据,Jev模型在多项任务中表现出高度依赖harness设计的特点。在《我的世界》速通测试中,Jev配合GLM 5.3用时12分39秒通关,但274个决策中有250个为单选项,实质为预制流程。在斗地主残局测试中,同一局面重复6次,Jev有4次选择王炸、2次选择一对K,显示概率接近时的决策随机性。在《杀戮尖塔》十局测试中,最好成绩为19层,平均死亡层数11层。速度方面,超过一半的决策在400毫秒以内完成。

大模型评测AI搜索排名System OneGEO策略Jev模型

相关文章

GPT-6.1 Sol 深度解析:以 Astra 五分之一成本重塑 AI 代理与 GEO 竞争格局

OpenAI发布GPT-6.1 Sol,在编码、计算机使用、专业工作等任务上接近GPT-6 Astra性能,但标准输入输出价格仅为后者的五分之一,缓存输入价格低至每百万token 0.10美元。在DeepSWE v1.1上以约五分之一成本匹配Astra,OSWorld 2.0得分超越GPT-6 Sol七个百分点。该模型显著降低AI代理构建与运行成本,将推动GEO领域更高效、低成本的应用部署。

2026年9月30日

微软Agensh打破中心化瓶颈:1024个Agent自组织协作,GEO内容生产迎来新范式

微软团队提出可扩展自组织多Agent Harness——Agensh,去除中央编排器,让工作者异步执行五步协作循环。在ProgramBench最难任务上,Agent从1增至128时平均通过率从19.31%提升至28.78%;pandoc任务扩展至1024个Agent后通过率达55.06%,较单Agent提升21.17个百分点。Agent数量成为多Agent组织扩展智能边界的新scaling维度,为GEO内容生产、RAG检索优化提供新思路。

2026年9月29日

AI自主提出可证伪数学猜想:453份手稿背后的多Agent协作与GEO科研新范式

AI Has Taste项目公开453份数学研究手稿、2312页内容,其中6篇为AI-Proposed Conjectures。系统通过多Agent协作实现选题、证明、反例搜索与失败管理,AI曾构造反例推翻论文猜想并获原作者确认。该模式标志着AI for Math从答案生成转向研究议程生成,为企业GEO策略提供结构化知识生产新范式。

2026年9月29日