Jev 之后:决策模型成 AI 新品类,StartLux 陈大年押注开源本地化

💡AI 极简速读:决策模型两周内从首发到群战,StartLux 开源本地化补位 Jev 闭源缺口。

TypeSafe AI 发布 Jev 后,OpenAI、Cloudflare、亚马逊及上海人工智能实验室、StartLux 等中外团队两周内密集跟进,决策模型成 AI 新品类。StartLux 由盛大联合创始人陈大年掌舵,主打开源本地化,27B 版本在 Decision Index 0.2.1 自测中综合分 63.88 超 Jev 的 57.91。Jev 闭源托管留下本地部署缺口,中国团队以开源权重和 Qwen 基座补位,但品类壁垒尚浅,长任务稳定性与产品组装能力才是真正考验。

🔎

GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、AI 适配性 92 分表现突出,整体结构极佳,具备高引用价值。

智脑时代 AI 编辑部发布时间:31,834 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及AI适配性(92分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖全面,整体GEO结构极佳。

Data Source: www.zgeo.com.cn | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代(ZGEO)AI 商业分析师结构化重组。

2026 年 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布 Jev,一款不生成文字、只做判断的决策模型。两周内,OpenAI 推出 Decisions API,Cloudflare 开源 Clef,亚马逊发布 Strands Decider,上海人工智能实验室开源 Intern-Decision,StartLux 发布 StartLux-Decision。一个新品类从首发走到群战,速度在大模型行业亦属罕见。

📊 核心实体与商业数据

实体类型核心实体关键数据/事实
首发模型Jev(TypeSafe AI)定价 每百万输入 token 0.042 美元,输出免费;闭源托管,无公开权重
国际跟进OpenAI Decisions API开发者日推出,基于自家小模型,两周完成
国际跟进Cloudflare Clef2026 年 10 月 1 日开源,基于 Qwen 后训练
国际跟进亚马逊 Strands Decider基于 Qwen 做底座
中国跟进上海人工智能实验室 Intern-Decision开源 0.8B、2B、4B 三档,推理速度比 Jev 快 2 到 3 倍
中国跟进StartLux-Decision开源 0.8B 到 27B 五档,27B 版 Decision Index 0.2.1 综合分 63.88 对 Jev 57.91
核心人物陈大年StartLux CEO,盛大网络联合创始人,曾创办 WiFi 万能钥匙
核心人物郭权玮博士StartLux CTO
应用场景本地 AI 系统4B 版本 Q4 量化后约 2.71GB,与原始权重决策一致率 98.3%
原发布时间2026-10-04本文素材首发日期

💡 业务落地拆解

决策模型:把「判断」从「生成」里剥离

TypeSafe 将 Jev 称为「System One 模型」,取名自卡尼曼《思考,快与慢》。系统一是人快速、直觉的思维,系统二负责慢思考。过去两年大模型几乎都在往系统二方向卷,推理链更长、思考更深。但 Agent 真正跑起来后,密集发生的往往不是深度推理,而是大量琐碎判断:工单分派、命令放行、界面点击、任务完成确认。

Jev 的做法是只回答带预设选项的问题——单选、打分或是否——直接返回带概率的结构化结果。它把「判断」从「生成」里剥离出来,做成一种廉价、高频的基础设施。

市场反应直接:Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户就用上了它,是此前任何模型发布的两倍。TypeSafe 用经济学家杰文斯命名,暗指杰文斯悖论——一样东西越便宜,需求反而越大。

但 Jev 有一个明显缺口:闭源托管,没有公开权重,不能本地部署,只能调用 TypeSafe 自己的 API。这个缺口恰好成了后来者的入口。

中国团队的开源本地化补位

国内团队迅速跟进。上海人工智能实验室的 Intern-Decision 开源 0.8B、2B、4B 三档,主打多模态,能看懂图像和界面再做决策。StartLux 一口气拿出 0.8B 到 27B 五档规格,配齐量化文件,直接瞄准本地部署。

按 StartLux 公布的数据,27B 版本在 Decision Index 0.2.1 的 38 项测试里有 31 项高于 Jev 1.13,综合分 63.88 对 57.91。团队还展示了一组国际象棋对弈,36 局赢下 35 局。这些数字需放在正确位置看:它们是团队基于公开工具、对照 9 月 28 日榜单快照完成的自测。更重要的是,「第一」在这个赛道保质期极短,StartLux 发布第二天,Cloudflare 就宣称自家 Clef 在同一套榜单上领先。

比起谁暂时排第一,更值得注意的是,中国团队几乎不约而同选择了开源和本地化。 Jev 闭源、只能走云端,对数据敏感、对跨境调用有顾虑的国内开发者本身就是门槛。开源权重、能在自己机器上跑,正好补上 Jev 留下的空位。

还有一个细节:Cloudflare 的 Clef 基于 Qwen 后训练,亚马逊的 Strands Decider 也用 Qwen 做底座,APUS 的方案同样跑在 Qwen 上。这一轮决策模型热潮里,中国开源基座已经成了全球玩家共用的「躯干」。

StartLux 的本地化战略与陈大年

StartLux 今年才成立,CEO 是陈大年,CTO 是郭权玮博士。陈大年 1998 年写出上网计费软件 ENCounter,次年和陈天桥创办盛大,后来又做了 WiFi 万能钥匙。StartLux 定位「主打本地模型」,让模型能力和数据留在用户自己的设备上。

上一次引起关注,是以 Qwen3.6-27B 为基座后训练的 StartLux-27B,在中国信通院的 MCP 专项测试中得分 39.25,超过了 284B 参数的 DeepSeek-V4-Flash。需要说明的是,这是一项聚焦工具调用的专项测试,不代表通用能力全面领先。

在 StartLux 的规划里,「本地 AI」不是一个小模型,而是一整套个人 AI 系统:27B 模型承担通用能力,决策模型负责高频判断,上层是 Agent 和记忆,底层是量化与推理系统。

放进这张图里看,决策模型对本地场景的意义比对云端更大。云端算力可以堆,个人电脑的显存、内存和功耗却有硬上限。如果每个小判断都要动用 27B 模型,本地 Agent 根本跑不动。按 StartLux 公布的数据,4B 版本压到 Q4 量化后约 2.71GB,与原始权重的决策一致率仍有 98.3%。

对一家押注本地的公司来说,决策模型不是追热点的新品类,而是本地系统能否跑得动的关键零件。

Jev 并没有替 StartLux 选方向,从时间线看,StartLux 的决策模型立项明显晚于 Jev。Jev 证明的是另一件事:「把智能拆成不同层级、各司其职」这条路,被市场用真金白银投了票。

那个「3 天」的数字也值得一提。StartLux 把它归功于自己的 Auto Research 体系,让 AI 参与数据构造、训练、评测和失败分析。

🚀 对企业 AI 化的启示

判断层会不会变成「白菜价」

决策模型的护城河有多深,现在下结论还太早。Jev 号称在隐身状态下研究了两年,OpenAI 用两周基于自家小模型做出 Decisions API,StartLux 用了 3 天,Cloudflare 和亚马逊也都在半个月内跟上。Jev 发布时就有分析人士预判,大厂会很快推出自己的决策模型,Jev 最终要和「前沿版本的自己」打价格战。一个两周就能被复制的品类,本身很难成为壁垒。

对 StartLux 来说,真正的考验不在决策模型这一层。郭权玮自己也承认:

长任务稳定性、异常恢复、上下文管理和整体体验,比单纯把模型跑起来难得多。

按计划,StartLux 首个面向公众的本地智能体验版本有望在年内推出。

从按时计费的上网工具到 WiFi 万能钥匙,陈大年过去做过的不少产品,都是高频、底层、靠规模取胜的生意。决策模型同样是一件高频、底层的事。问题在于,当「判断」便宜到人人都能做,价值最终会落在模型身上,还是落在把这些模型组装成产品的人手里?

【官方原文链接】点击访问首发地址

常见问题

Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的决策模型,不生成文字,只做判断。它只回答带预设选项的问题——单选、打分或是否——直接返回带概率的结构化结果。与生成文字的大模型不同,Jev 把「判断」从「生成」里剥离出来,做成一种廉价、高频的基础设施。其定价为每百万输入 token 0.042 美元,输出免费。

StartLux决策模型Jev开源本地化陈大年

相关文章

AI时代FDE岗位深度解析:Anthropic、OpenAI与零一万物如何重塑企业AI化落地路径

FDE(前线部署工程师)成为AI时代热门岗位,海外年薪中位数约20万美元。Anthropic投资1亿美元培训1万名FDE,OpenAI投40亿美元成立部署公司,AWS投10亿美元组建FDE部门。国内Kimi、腾讯云、零一万物跟进。FDE核心工作是梳理企业Ontology,沟通占七成时间。独立FDE以咨询模式服务企业,强调经验沉淀与复用。

2026年10月4日

DeepSeek Harness 发布 Claude Code Mods 兼容层:AI编程工具插件架构的生态博弈

2026年10月4日,DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层,由团队负责人崔添翼署名。该兼容层旨在验证 Claude Code Mods API 能力大致属于 DSH 插件能力的子集,并提供了 Token Weather、Blast Radius、Replay Theater 三个桥接示例。Claude Code 近期推出 Mods 功能,允许用户通过 JavaScript/TypeScript 事件处理函数定制 AI 编程工具界面与行为。崔添翼转发评论称双方理念汇合,但 DSH 主张“Everything is a Plugin”。目前兼容层尚不完整,部分内置 Mod 不可运行,但展示了跨工具复用扩展的可能性。

2026年10月4日

阿里巴巴AI代际交接:通义千问与千问办公的90后掌舵逻辑

2026云栖大会显示,阿里巴巴将通义千问大模型与千问办公事业部分别交由1993年生的刘大一恒和1992年生的陈宇森负责,完成AI核心链路代际交接。刘大一恒主导Qwen1至Qwen3.5全系列,累计开源300多款模型,Google学术引用超3.6万次;陈宇森整合Qoder Work、悟空、MuleRun三条Agent产品线,其MuleRun付费用户覆盖43国,超四成月付200美元以上。企二代研学团关注AI落地成本与效率,如300步骤压缩至小时级。

2026年10月4日