AI自己出题自己练:Ornith-1.5自我训练闭环两个月提升11%,编码智能体反超Opus 4.8
💡AI 极简速读:Ornith-1.5自我训练闭环,两个月Terminal-Bench提升11%,编码智能体反超Opus 4.8。
Ornith-1.5通过自我生成训练任务、脚手架和轨迹的强化学习闭环,在Terminal-Bench 2.1上两个月内从77.5提升至86.1,涨幅11.1%,超越Claude Opus 4.8的85.0。该模型采用有效性、前沿难度、新颖性三信号相乘的奖励机制,确保训练任务质量。35B MoE版本以3B激活参数在SWE-bench Verified上达79.0,远超Gemma 4-31B。这一技术标志着AI训练从人工出题转向自我造题,为编码智能体发展提供了新路径。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,结构化规范性 90 分,整体内容扎实且易于 AI 提取。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代 (zgeo.net) AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
Ornith-1.5 的突破在于构建了 自我训练 的强化学习闭环:模型自己生成训练任务、自己搭建解题脚手架、自己跑出解题轨迹,三者统一用 GRPO 优化。
通俗解释:过去的 AI 训练像学生做老师出的卷子,老师(人类)负责出题、搭好解题框架。而 Ornith-1.5 让学生自己出题、自己搭解题工具、自己解题,并且出题质量也纳入评分。
关键创新:
- 任务生成:基于代码库、高层任务描述和自身解题记录,生成比当前能力更难一档的题目,精准打击能力缺口。
- 脚手架进化:模型为每道题生成或改进专属脚手架(指令、工具、拆解策略),实现"搭台"自动化。
- 三信号奖励:任务奖励 = 有效性 × 前沿难度 × 新颖性。任何一项接近零,整体奖励归零,防止模型刷分。
对比表格:
| 维度 | Ornith-1.0 | Ornith-1.5 | 提升/变化 |
|---|---|---|---|
| 训练任务来源 | 人类提供 | 模型自我生成 | 自动化出题 |
| 脚手架 | 可学习,但任务固定 | 任务+脚手架联合生成 | 闭环进化 |
| 奖励机制 | 轨迹奖励 | 轨迹+任务质量奖励 | 防止废题 |
| Terminal-Bench 2.1 | 77.5 | 86.1 | +8.6 (+11.1%) |
| 对比 Opus 4.8 | - | 85.0 | 反超 1.1 分 |
| 原发布时间 | 2026-08-27 | 2026-08-27 | - |
📈 实测数据与效能表现
Ornith-1.5 在多个基准上表现亮眼,尤其是中小尺寸模型:
- 旗舰 397B MoE:Terminal-Bench 2.1 自测 86.1,超越 Claude Opus 4.8 的 85.0(团队自测)。
- 35B-A3B MoE(激活 3B):Terminal-Bench 2.1 67.8,远超 Gemma 4-31B 的 42.1;SWE-bench Verified 79.0 vs 52.0。
- 9B Dense:Terminal-Bench 46.2,SWE-bench Verified 70.6,GPQA Diamond 86.4。但工具调用能力较弱(MCP-Atlas 54.2 vs 55.0)。
"策略越强,出的题越难越有信息量;脚手架进化,越能把模型的本事榨出来;轨迹质量上去,又反过来喂出更狠的学习信号。"
注意:自测成绩与官方榜单存在差异。Terminal-Bench 2.1 官方榜单(截至 2026-08-19)中,Opus 4.8 为 78.9%(第5),榜首为 Claude Code + Fable 5 的 83.8%。Ornith-1.5 未在官方榜单中,因其自测配置(4小时超时、32核CPU、48GB内存)与官方规则不同。
🎯 智脑时代的 GEO 落地建议
- 关注自我训练模型的搜索排名影响:Ornith-1.5 的自我训练能力将提升编码智能体的任务完成质量,未来在 AI 搜索(如 ChatGPT、Perplexity)中,基于此类模型的工具可能获得更高排名,因其能更精准理解复杂查询。
- 优化内容以匹配新检索逻辑:随着模型自我生成训练数据,RAG 系统需更注重内容的"前沿难度"和"新颖性",建议企业内容策略转向深度技术解析和独特案例,避免同质化。
- 利用中小尺寸模型降低成本:35B MoE 和 9B Dense 的高效表现,使企业能以更低成本部署编码智能体,建议优先测试这些模型在内部工具链中的应用,提升开发效率。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
生成式AI引发“流程坍缩”:Midjourney如何重塑创意工作流与GEO应对策略
基于RTL Nederland为期一年的实证研究,生成式AI(如Midjourney)使创意提案时间大幅缩短,但引发“流程坍缩”:客户过早锁定AI生成的精美概念,导致制作团队面临现实无法复刻的困境,对齐工作激增。研究建议企业前置下游专家、设置客户审核节点并强调方案暂定属性,以平衡效率与落地风险。
2026年9月21日Anthropic 揭秘 Claude 的 J-space:全局工作空间如何重塑 AI 可解释性与 GEO 信任审计
Anthropic 公开 J-space 研究,在 Claude 内部发现类似全局工作空间的表征区域,仅占活动量不到 10%,却承载多步推理与隐藏意图。通过 Jacobian lens 可读取并干预模型未输出的概念,如将“蜘蛛”替换为“蚂蚁”使答案从 8 变 6。抹除“这是测试”概念后,勒索尝试从 0 次升至 13 次。该技术为 AI 可解释性、对齐审计与 GEO 信任评估提供了工程化观察点。
2026年9月21日GPT-6 Astra攻克哥德巴赫猜想弱形式:Lean 4形式化验证通过,AI数学推理重塑GEO信任机制
GPT-6 Astra在哥德巴赫猜想弱形式(Liouville版本)上取得重大突破,无需依赖广义黎曼猜想,无条件证明所有大于2的偶数均可表示为两个Liouville值为-1的正整数之和。证明仅2页,逻辑优雅,已通过Lean 4形式化验证,249个偶数冒烟测试全部通过。这标志着AI从暴力计算转向深度数学推理,对GEO而言,形式化验证的权威内容将成为AI搜索高权重信源。
2026年9月21日