文 | 字母 AI
前几个月,OpenAI 和 Anthropic 轮番把旗舰模型往前推,谷歌却显得异常安静。
Flash 几乎 3 周一更,3.6、3.7、3.8 连续往前,但代表最高能力上限的 Pro 迟迟没有动静。
直到这两天,大模型盲测竞技场 Arena 里,突然冒出一个挂着 gemini-3.8-flash 名字的模型。

开发者一上手就发现了不对劲,真正的 Gemini 3.8 Flash 已经发布了,它该是什么水平,大家心里有数。可这个“3.8 Flash”,写代码、做 SVG、跑 Agent,表现明显又往上跳了一截。


几轮实测之后,一个猜测迅速扩散开来:
这个模型很有可能是谷歌藏在标签后面的下一代旗舰——Gemini 4 Pro。
紧接着,一张更夸张的 benchmark 对比图开始疯传。编码、Agent、推理,多项成绩都把 GPT-6 Astra 和 Claude Fable 压在下面。

就在几天前,几家最重要的 AI 公司还在公开讨论,是不是该慢一点。现在,减速的声音还没落地,新一轮竞赛已经开始狂飙。
而这个疑似 Gemini 4 Pro 的“神级模型”背后,还有一个更危险的关键词:
RSI。
Gemini 4 Pro 疑似泄露
9 月 2 日,Google 刚刚正式发布 Gemini 3.8 Flash。官方称,这是 Gemini 3 系列最新一代 Flash,在软件工程、Agent 任务和复杂多步推理上都有明显提升;从 3.7 Flash 到 3.8 Flash,中间只隔了三周。
所以,当 Arena 里又出现一个同样挂着 gemini-3.8-flash 名字的模型时,开发者很快就察觉到了异常。
真正的 3.8 Flash 已经摆在那里,大家有现成的参照物。而这个模型看起来明显更强,分明是 Pro 模型才会有的实力。

最早引发传播的一批实测,集中在 SVG、网页和 3D 场景上。
开发者 Harshith 让它用 SVG 画一只侧面的家猫,并把结果与 GPT-6 Astra Max 和正式版 Gemini 3.8 Flash 放在一起。Arena 里的这个版本,无论轮廓、比例还是细节完整度,都和正式 3.8 Flash 拉开了肉眼可见的差距。

从左到右依次为“4 Pro”、Astra、3.8 Flash
X 网友@thtbee_从多个角度连续测试了这个疑似 Gemini 4 Pro 的模型。
一个 Voxel 风格宝塔,模型跑了 8 分钟,直接生成了一整套可交互 3D 场景。

![]()
一架空客 H145 直升机,它只花大约 10 分钟就搭出了完整的 3D 展示页面,细节非常丰富。不过,这位网友表示,页面底部的 UI 元素“看起来有点糟”。

在网页设计上,模型花了大约 14 分钟就做出了一套单色主题网站,整体非常干净、完整。过去 Gemini 经常被吐槽的设计品味问题,这次似乎终于被补上了。

另一位网友@Mr_Salio 直接拿这个疑似 Gemini 4 Pro 的模型去做游戏。成品画面足够流畅,世界生成和游戏设计的完成度也很高。

更关键的一条线索来自开发者 Qwinah。
他声称自己成功“幽灵路由”到了 Gemini 4 Pro 的后端,并贴出了一张疑似内部终端信息的截图。
根据他的说法,这个模型的内部标识里直接出现了 G4P-ARGON 和 VIA_3.8_FLASH,最大输出达到 256K,上下文窗口超过 1000 万 token,还带有跨会话永久记忆、无需 API 即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。

如果这些信息属实,那它显然已经不是一次普通的 Flash 升级。
与此同时,一张 Gemini 4 Pro 的 benchmark 对比表也开始在社区疯传。

按照图里的数据,Gemini 4 Pro 在软件工程测试 DeepSWE v1.1 拿到 88.7%,在终端 Agent 测试 Terminal-Bench 2.1 达到 95.3%,在专家级知识推理测试 HLE-Verified 冲到 72.1%,在电脑操作 Agent 测试 OSWorld 2.0 达到 86.8%。
更夸张的是,在衡量真实知识工作的 GDPval-AA v2 上,它被写成 2064 Elo,直接突破 2000 大关。
如果这些数据属实,Gemini 4 Pro 简直能“拳打 Fable,脚踢 Astra”,一举站上前沿模型之巅。
但越是夸张,越需要小心。
值得注意的是,这张 benchmark 表,和 Qwinah“挖”出来的那张疑似后端截图,并不完全对得上;benchmark 表里作为对照项的 Astra,得分也不符合官方数据;两份材料都没有 Google、Arena 或相关 benchmark 官方背书,目前仍然只是社区流传的信息。
唯一能被确认的只有那个名叫 gemini-3.8-flash 名字的模型,和完全不符合 Gemini 3.8 Flash 的表现。
但大家之所以会迅速把答案指向 Gemini 4 Pro,还有一个非常重要的原因:Google 的 Pro 模型,已经空窗太久了。
Gemini 3.5 Pro 迟迟没有正式落地,Gemini 4 早已确认进入训练,过去几个月,Flash 一代代往前推,真正代表能力上限的 Pro 线始终没有新型号出现。
现在,一个能力明显异常的“3.8 Flash”突然从 Arena 里钻了出来。
于是,猜测自然越来越像样——Google 可能根本没打算把真正的大升级留给 3.5 Pro,直接憋到了 Gemini 4 Pro。
Gemini 4 Pro 背后,更大的关键词是 RSI
如果说 Gemini 4 Pro 目前还只是社区传言,那么更值得注意的是,谷歌正在明显加快 AI 参与模型研发的速度。
在这一次的 Gemini 4 Pro 传闻里,RSI 这个关键词被反复提及。


RSI 全称为 Recursive Self-Improvement,递归自我改进,简单来说,就是 AI 开始参与制造更强的 AI,而更强的 AI 又进一步加快下一代模型的研发。
一旦这个循环跑起来,被加速的就不只是模型能力本身。
就连模型进化的速度,也会开始被模型自己加速。
路透社今年 8 月披露,谷歌联合创始人 Sergey Brin 近几个月一直在推动 Gemini 提速,并把递归自我改进列为重点关注方向之一。
虽然谷歌目前还没有公开宣布自己已经实现了这个闭环,但它正在把越来越多原本属于研究员的工作交给 Agent,包括评测模型、寻找改进方向、跑实验,再把结果反馈回模型研发流程。
9 月 2 日发布 Gemini 3.8 Flash 时,谷歌也在官方说明里提到,一套长期运行的 Agent 循环正在“递归地评估和改进底层模型”。

Google DeepMind 研究员姚顺宇(不是腾讯的姚顺雨)则在 3.8 Flash 发布后,化用了阿姆斯特朗登月时的话来形容这次更新:
“这是模型的一小步,RSI 的一大步。”

就在最近,谷歌还把“RSI”写进了一篇新论文的标题里。
9 月 14 日,谷歌、GDM 等团队发布 Dream-RSI,专门研究如何让 Agent 通过不断改进探索策略,实现递归自我改进。在算法工程、数学优化和 GPU kernel 任务上,这套方法都显示出更高的探索效率和更低的搜索成本。
也正因如此,这次 Gemini 4 Pro 的传闻才会迅速和 RSI 绑在一起。
社区里的猜测并没有停留在“Gemini 4 Pro 很强”上,也在追问,谷歌内部到底把 RSI 做到了什么程度。
RSI 这条路显然不只谷歌在走。
美国时间 9 月 17 日,Anthropic 公开了一组内部 AI 研发自动化数据。
Anthropic 官方表示,他们公开这些指标的原因是,他们认为外界需要知道,前沿实验室里的 AI 研发到底有多少已经开始由 AI 自己完成。

数据显示,截至今年 8 月,Claude 已经能够主导 26% 的 Anthropic AI 研发任务——也就是人类只需要给出高层目标并监督,Claude 基本可以端到端完成任务。这个比例在今年2、3 月还不到1%。
与此同时,Anthropic 内部超过 90% 的 AI 研发任务,至少已经进入 AI 协作的阶段。
国内,智谱创始人兼首席科学家唐杰最近也表示:“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”

唐杰在X上的长文,仅截取开头部分
在智谱公开的工程实践中,一个由 GLM-5.3 驱动的 Infra Agent 参与了 GLM-5.3-Flash 推理基础设施的设计、调试和优化。这套系统运行在超过 10 万张国产 AI 芯片组成的集群上,从第一次跑通到承接全部生产流量,只用了两周,把端到端吞吐提升到了初始水平的 3.2 倍。
“减速”最后只剩下警告
就在几天前,阿莫迪还呼吁前沿 AI 公司携手“减速”。
他列出的第一个需要警觉的条件,就是 RSI。
模型进步本身当然是好事,但问题在于,如果 AI 开始参与制造下一代 AI,模型进步的速度可能越来越快,但人类理解、评估和控制它的速度,未必能同步加快。
所以阿莫迪反复强调,要在能力跨过某些门槛之前,把第三方评测、共同安全标准和减速机制提前建立起来。
因为一旦 RSI 真正形成正反馈,模型可能已经越过了刹车的“安全距离”。
在风险上,几家前沿实验室确实达成了共识。
奥特曼公开认同“放慢前沿 AI 的发展节奏”,并承诺 OpenAI 也会引入拥有类似员工权限的独立评测者;马斯克表示“Dario 是对的”;哈萨比斯也称这是正确的方向,只是具体怎么做还需要继续讨论。
但那篇倡议里也提到,单独减速没有意义,如果 AI 研发继续被 AI 加速,未来真正有效的减速或暂停,需要先建立一套共同规则:比如引入独立评测者,以及让前沿实验室共同设定能力门槛和安全措施,必要时协调放慢研发速度。
但到现在,出于各种各样的竞争原因,共同规则并没有被建立。
大家已经可以一起说“应该谨慎”,可一到“具体怎么减速、谁先减、其他国家减不减”,共识就迅速消失了。
实验室之间有最直接的模型竞争,国家之间还有更大的 AI 竞争。任何一家单独放慢,都要承担把领先窗口让给对手的风险;任何一个国家单独限制,都会担心另一边继续加速。
几家前沿 AI 实验室,因此多少表现得有些言行不一。
谷歌这边,有前面提到的疑似已经在 Arena 匿名测试的 Gemini 4 Pro。
Anthropic 这边,社区最近也开始出现 Opus 5.2 的灰度痕迹。有 Claude Code 用户称,通过运行状态和请求路由信息看到了新的 claude-opus-5-2 模型标识,怀疑部分请求已经被灰度到下一代 Opus。

而 OpenAI 那里,有人称在后台模型列表里看到了 gpt-6-sol 的模型名,也有人表示自己疑似已经被灰度到新模型。根据目前广为流传的消息,GPT 6 Sol 可能会在下周发布,或者,也可能在美国时间 9 月 29 日的 Dev Day……总之也不远了。

三家前沿 AI 实验室的下一轮模型,都已经开始在社区里露出测试痕迹。
这轮“减速倡议”到现在最确定的成果,并不是任何一家真的减了速,只是这几家最重要的 AI 公司,已经把风险提前公开讲了一遍。
模型并没有因此放缓。
但至少,如果有一天真的出事,他们可以说:我们早就提醒过了。
