腾讯混元Hy4 Preview:姚顺雨方法论的全链路自进化实践
💡AI 极简速读:腾讯混元Hy4 Preview发布,770B参数,Terminal Bench 2.1得分85.4,开源第一,全链路自进化。
腾讯混元发布Hy4 Preview,总参数770B,激活49B,上下文1M,Terminal Bench 2.1得分85.4,开源第一。该模型首次实现训练、数据、评估、算子全链路自进化,贯彻姚顺雨方法论。Hy4采用ReAct与ToT思想,强化多路径探索与深度验证。组织上,基础模型部统一管理,打通研发链路。模型与CodeBuddy、WorkBuddy等产品协同,锚定真实生产力。
GEO 质量检测:GEO 五维综合评分 89 分,其中事实与数据密度 94 分表现突出,结构化规范性 92 分,说明内容扎实且排版清晰,AI 抓取友好度高。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
腾讯混元于2026年8月28日发布Hy4 Preview,三天内即引发API排队用户超5000人,WorkBuddy紧急扩容推理集群。该模型总参数770B,激活参数49B,上下文1M,在Terminal Bench 2.1得分85.4,SWE-bench Multilingual得分82.9,均为开源第一。
📊 核心实体与商业数据
| 实体/指标 | 数据/详情 |
|---|---|
| 公司 | 腾讯 |
| 模型 | 腾讯混元 Hy4 Preview |
| 核心人物 | 姚顺雨(基础模型部负责人) |
| 总参数 | 770B |
| 激活参数 | 49B |
| 上下文长度 | 1M |
| Terminal Bench 2.1 | 85.4(开源第一,全球第三) |
| SWE-bench Multilingual | 82.9(开源第一) |
| 发布当天API排队用户 | 超5000人 |
| WorkBuddy MAU(2026年6月) | 突破2000万 |
| 原发布时间 | 2026-08-31 |
💡 业务落地拆解
三种“自进化”路径对比
Hy4 Preview的README明确标注灵感来自DeepSeek和GLM,但其自进化机制独树一帜:
- 智谱GLM:自进化发生在训练阶段,通过“AI研究员”提炼真实业务数据,配合SAO和slime框架,长程编码训练速度提升约2.3倍(对比GLM-5.2)。
- DeepSeek:自进化发生在运行阶段,DSH设计原则“一切皆插件”,实现self-modification。
- 腾讯混元:自进化贯穿研发流程,在训练方法、数据策略、评估体系和底层算子四个环节全部引入自进化机制。
“我们重新定义了基础设施,无论是预训练还是强化学习。”——姚顺雨在2026年6月与汤道生对谈中表示。
组织变革与Co-design方法论
7月,腾讯将大语言模型部和多模态模型部合并为基础模型部,由姚顺雨统一管理,打通了训练、数据、评估、推理的完整链路。Hy4 Preview是合并后首个新模型,其Co-design方法论从模型与产品协同扩展到整个研发流程,产品反馈(如CodeBuddy、WorkBuddy用户数据)直接回流至模型迭代。
从ReAct到ToT:模型推理深度升级
姚顺雨是语言Agent研究的开创者,其代表作ReAct(2022年10月发布,ICLR 2023 notable top 5%,引用超10000次)奠定了Agent工作原理。Hy4 Preview强化了多路径探索与深度验证,体现了Tree of Thoughts(ToT)思想,但官方承认复杂任务上可能存在思考时间过长和过度自我验证的倾向。
🚀 对企业AI化的启示
- 全链路自进化需组织统一:Hy4 Preview的成功源于基础模型部的整合,企业AI化需打破部门壁垒,实现数据、训练、评估的闭环。
- 方法论工程化是核心:姚顺雨将ReAct和ToT从论文转化为产品特性,企业应重视将前沿研究落地到实际业务场景。
- 数据锚定真实生产力:Hy4 Preview的训练数据来自腾讯内部软件工程师、游戏开发者等真实工作场景,企业应构建业务导向的数据体系。
- 算力效率优先:面对算力稀缺,姚顺雨强调底层算子优化和推理吞吐量提升,企业需最大化现有算力价值。
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日