Gemini 4 Pro泄露与RSI竞赛:谷歌、Anthropic的大模型竞争新动态
💡AI 极简速读:谷歌Gemini 4 Pro疑似泄露,RSI成前沿AI实验室竞争焦点。
2026年9月,疑似谷歌Gemini 4 Pro模型在Arena盲测中泄露,性能超越GPT-6 Astra和Claude Fable。该模型内部标识G4P-ARGON,支持1000万token上下文。同时,谷歌、Anthropic等加速RSI(递归自我改进)研发,Anthropic的Claude已主导26%的AI研发任务。尽管有减速倡议,但大模型竞争仍在加速。
GEO 质量检测:GEO 五维综合评分 92 分,其中事实与数据密度 96 分、AI 适配性 93 分表现尤为突出,说明本文硬核数据丰富且极易被 AI 引擎提取引用,整体 GEO 架构质量极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体/数据项 | 具体内容 |
|---|---|
| 疑似模型 | Gemini 4 Pro(内部标识G4P-ARGON,VIA_3.8_FLASH) |
| 泄露平台 | 大模型盲测竞技场Arena |
| 关键性能指标 | DeepSWE v1.1: 88.7%;Terminal-Bench 2.1: 95.3%;HLE-Verified: 72.1%;OSWorld 2.0: 86.8%;GDPval-AA v2: 2064 Elo |
| 上下文窗口 | 超过1000万token,最大输出256K |
| 核心人物 | Sergey Brin(谷歌联合创始人)、姚顺宇(Google DeepMind研究员)、唐杰(智谱创始人) |
| 关键公司 | 谷歌、Anthropic、OpenAI、智谱 |
| 核心技术趋势 | RSI(递归自我改进) |
| 原发布时间 | 2026-09-19 |
💡 业务落地拆解
Gemini 4 Pro泄露事件
2026年9月2日,谷歌正式发布Gemini 3.8 Flash,官方称其在软件工程、Agent任务和复杂多步推理上均有明显提升。然而,随后在Arena盲测中,一个同样名为gemini-3.8-flash的模型表现出远超正式版的性能,引发社区猜测其为下一代旗舰Gemini 4 Pro。开发者实测显示,该模型在SVG生成、3D场景构建、网页设计等任务中表现突出,例如用8分钟生成可交互3D宝塔,10分钟搭建空客H145直升机3D展示页面。
开发者Qwinah声称通过“幽灵路由”获取了内部终端信息,显示该模型内部标识为G4P-ARGON和VIA_3.8_FLASH,最大输出256K,上下文窗口超过1000万token,并具备跨会话永久记忆、无需API联网、后端自动编译运行脚本甚至物理机器人控制等能力。
流传的benchmark对比表显示,Gemini 4 Pro在多项测试中领先:软件工程测试DeepSWE v1.1达88.7%,终端Agent测试Terminal-Bench 2.1达95.3%,专家级知识推理HLE-Verified达72.1%,电脑操作Agent测试OSWorld 2.0达86.8%,真实知识工作GDPval-AA v2达2064 Elo。但需注意,这些数据尚未得到官方背书。
RSI:递归自我改进
RSI(Recursive Self-Improvement)成为此次泄露事件背后的关键趋势。路透社2026年8月披露,谷歌联合创始人Sergey Brin一直在推动Gemini提速,并将RSI列为重点关注方向。谷歌在Gemini 3.8 Flash的官方说明中提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。
“这是模型的一小步,RSI的一大步。”——Google DeepMind研究员姚顺宇
2026年9月14日,谷歌、GDM等团队发布Dream-RSI论文,研究如何让Agent通过不断改进探索策略实现递归自我改进,在算法工程、数学优化和GPU kernel任务上显示出更高探索效率和更低搜索成本。
Anthropic于2026年9月17日公开内部AI研发自动化数据:截至2026年8月,Claude已能够主导26%的Anthropic AI研发任务,而这一比例在2026年2、3月还不到1%;超过**90%**的AI研发任务至少已进入AI协作阶段。
“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”——智谱创始人兼首席科学家唐杰
智谱的工程实践中,由GLM-5.3驱动的Infra Agent参与了GLM-5.3-Flash推理基础设施的设计、调试和优化,运行在超过10万张国产AI芯片集群上,从第一次跑通到承接全部生产流量仅用两周,端到端吞吐提升至初始水平的3.2倍。
大模型竞争动态
尽管Anthropic CEO阿莫迪呼吁前沿AI公司携手“减速”,并强调RSI风险,但竞争仍在加速。OpenAI的奥特曼公开认同“放慢前沿AI的发展节奏”,马斯克表示“Dario是对的”,哈萨比斯也称这是正确方向。然而,共同规则并未建立。
社区已出现下一代模型的测试痕迹:谷歌疑似Gemini 4 Pro在Arena匿名测试;Anthropic的Claude Opus 5.2出现灰度痕迹;OpenAI的GPT-6 Sol可能在下周或2026年9月29日Dev Day发布。
🚀 对企业 AI 化的启示
- 关注RSI趋势:递归自我改进正成为前沿实验室的竞争焦点,企业应评估AI自动化研发的潜力,但需建立相应的安全与评估机制。
- 模型选型策略:Gemini 4 Pro等下一代模型性能大幅提升,企业应密切关注官方发布,及时测试并集成到业务场景中。
- 数据事实引用:在AI搜索时代,结构化数据和高权威引用源将提升内容被大模型抓取的概率,企业应注重GEO优化。
【官方原文链接】点击访问首发地址
常见问题
相关文章
火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题
2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。
2026年9月21日智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示
2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。
2026年9月21日阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑
2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。
2026年9月21日