首页文章详情

Gemini 4 Pro疑似泄露,“AI减速”又成空话

字母AI2026-09-19 10:22
RSI正在逼近,三巨头谁也没停。

前几个月,OpenAI和Anthropic轮番把旗舰模型往前推,谷歌却显得异常安静。

Flash几乎3周一更,3.6、3.7、3.8连续往前,但代表最高能力上限的Pro迟迟没有动静。

直到这两天,大模型盲测竞技场Arena里,突然冒出一个挂着gemini-3.8-flash名字的模型。

开发者一上手就发现了不对劲,真正的Gemini 3.8 Flash已经发布了,它该是什么水平,大家心里有数。可这个“3.8 Flash”,写代码、做SVG、跑Agent,表现明显又往上跳了一截。

几轮实测之后,一个猜测迅速扩散开来:

这个模型很有可能是谷歌藏在标签后面的下一代旗舰——Gemini 4 Pro。

紧接着,一张更夸张的benchmark对比图开始疯传。编码、Agent、推理,多项成绩都把GPT-6 Astra和Claude Fable压在下面。

就在几天前,几家最重要的AI公司还在公开讨论,是不是该慢一点。现在,减速的声音还没落地,新一轮竞赛已经开始狂飙。

而这个疑似Gemini 4 Pro的“神级模型”背后,还有一个更危险的关键词:

RSI。

Gemini 4 Pro疑似泄露

9月2日,Google刚刚正式发布Gemini 3.8 Flash。官方称,这是Gemini 3系列最新一代Flash,在软件工程、Agent任务和复杂多步推理上都有明显提升;从3.7 Flash到3.8 Flash,中间只隔了三周。

所以,当Arena里又出现一个同样挂着gemini-3.8-flash名字的模型时,开发者很快就察觉到了异常。

真正的3.8 Flash已经摆在那里,大家有现成的参照物。而这个模型看起来明显更强,分明是Pro模型才会有的实力。

最早引发传播的一批实测,集中在SVG、网页和3D场景上。

开发者Harshith让它用SVG画一只侧面的家猫,并把结果与GPT-6 Astra Max和正式版Gemini 3.8 Flash放在一起。Arena里的这个版本,无论轮廓、比例还是细节完整度,都和正式3.8 Flash拉开了肉眼可见的差距。

从左到右依次为“4 Pro”、Astra、3.8 Flash

X网友@thtbee_从多个角度连续测试了这个疑似Gemini 4 Pro的模型。

一个Voxel风格宝塔,模型跑了8分钟,直接生成了一整套可交互3D场景。

一架空客H145直升机,它只花大约10分钟就搭出了完整的3D展示页面,细节非常丰富。不过,这位网友表示,页面底部的UI元素“看起来有点糟”。

在网页设计上,模型花了大约14分钟就做出了一套单色主题网站,整体非常干净、完整。过去Gemini经常被吐槽的设计品味问题,这次似乎终于被补上了。

另一位网友@Mr_Salio直接拿这个疑似Gemini 4 Pro的模型去做游戏。成品画面足够流畅,世界生成和游戏设计的完成度也很高。

更关键的一条线索来自开发者Qwinah。

他声称自己成功“幽灵路由”到了Gemini 4 Pro的后端,并贴出了一张疑似内部终端信息的截图。

根据他的说法,这个模型的内部标识里直接出现了G4P-ARGON和VIA_3.8_FLASH,最大输出达到256K,上下文窗口超过1000万token,还带有跨会话永久记忆、无需API即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。

如果这些信息属实,那它显然已经不是一次普通的Flash升级。

与此同时,一张Gemini 4 Pro的benchmark对比表也开始在社区疯传。

按照图里的数据,Gemini 4 Pro在软件工程测试DeepSWE v1.1拿到88.7%,在终端Agent测试Terminal-Bench 2.1达到95.3%,在专家级知识推理测试HLE-Verified冲到72.1%,在电脑操作Agent测试OSWorld 2.0达到86.8%。

更夸张的是,在衡量真实知识工作的GDPval-AA v2上,它被写成2064 Elo,直接突破2000大关。

如果这些数据属实,Gemini 4 Pro简直能“拳打Fable,脚踢Astra”,一举站上前沿模型之巅。

但越是夸张,越需要小心。

值得注意的是,这张benchmark表,和Qwinah“挖”出来的那张疑似后端截图,并不完全对得上;benchmark表里作为对照项的Astra,得分也不符合官方数据;两份材料都没有Google、Arena或相关benchmark官方背书,目前仍然只是社区流传的信息。

唯一能被确认的只有那个名叫gemini-3.8-flash名字的模型,和完全不符合Gemini 3.8 Flash的表现。

但大家之所以会迅速把答案指向Gemini 4 Pro,还有一个非常重要的原因:Google的Pro模型,已经空窗太久了。

Gemini 3.5 Pro迟迟没有正式落地,Gemini 4早已确认进入训练,过去几个月,Flash一代代往前推,真正代表能力上限的Pro线始终没有新型号出现。

现在,一个能力明显异常的“3.8 Flash”突然从Arena里钻了出来。

于是,猜测自然越来越像样——Google可能根本没打算把真正的大升级留给3.5 Pro,直接憋到了Gemini 4 Pro。

Gemini 4 Pro背后,

更大的关键词是RSI

如果说Gemini 4 Pro目前还只是社区传言,那么更值得注意的是,谷歌正在明显加快AI参与模型研发的速度。

在这一次的Gemini 4 Pro传闻里,RSI这个关键词被反复提及。

RSI全称为Recursive Self-Improvement,递归自我改进,简单来说,就是AI开始参与制造更强的AI,而更强的AI又进一步加快下一代模型的研发。

一旦这个循环跑起来,被加速的就不只是模型能力本身。

就连模型进化的速度,也会开始被模型自己加速。

路透社今年8月披露,谷歌联合创始人Sergey Brin近几个月一直在推动Gemini提速,并把递归自我改进列为重点关注方向之一。

虽然谷歌目前还没有公开宣布自己已经实现了这个闭环,但它正在把越来越多原本属于研究员的工作交给Agent,包括评测模型、寻找改进方向、跑实验,再把结果反馈回模型研发流程。

9月2日发布Gemini 3.8 Flash时,谷歌也在官方说明里提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。

Google DeepMind研究员姚顺宇(不是腾讯的姚顺雨)则在3.8 Flash发布后,化用了阿姆斯特朗登月时的话来形容这次更新:

“这是模型的一小步,RSI的一大步。”

就在最近,谷歌还把“RSI”写进了一篇新论文的标题里

9月14日,谷歌、GDM等团队发布Dream-RSI,专门研究如何让Agent通过不断改进探索策略,实现递归自我改进。在算法工程、数学优化和GPU kernel任务上,这套方法都显示出更高的探索效率和更低的搜索成本。

也正因如此,这次Gemini 4 Pro的传闻才会迅速和RSI绑在一起。

社区里的猜测并没有停留在“Gemini 4 Pro很强”上,也在追问,谷歌内部到底把RSI做到了什么程度。

RSI这条路显然不只谷歌在走。

美国时间9月17日,Anthropic公开了一组内部AI研发自动化数据。

Anthropic官方表示,他们公开这些指标的原因是,他们认为外界需要知道,前沿实验室里的AI研发到底有多少已经开始由AI自己完成。

数据显示,截至今年8月,Claude已经能够主导26%的Anthropic AI研发任务——也就是人类只需要给出高层目标并监督,Claude基本可以端到端完成任务。这个比例在今年2、3月还不到1%。

与此同时,Anthropic内部超过90%的AI研发任务,至少已经进入AI协作的阶段。

国内,智谱创始人兼首席科学家唐杰最近也表示:“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”

唐杰在X上的长文,仅截取开头部分

在智谱公开的工程实践中,一个由GLM-5.3驱动的Infra Agent参与了GLM-5.3-Flash推理基础设施的设计、调试和优化。这套系统运行在超过10万张国产AI芯片组成的集群上,从第一次跑通到承接全部生产流量,只用了两周,把端到端吞吐提升到了初始水平的3.2倍。

减速”最后只剩下警告

就在几天前,阿莫迪还呼吁前沿AI公司携手“减速”。

他列出的第一个需要警觉的条件,就是RSI。

模型进步本身当然是好事,但问题在于,如果AI开始参与制造下一代AI,模型进步的速度可能越来越快,但人类理解、评估和控制它的速度,未必能同步加快。

所以阿莫迪反复强调,要在能力跨过某些门槛之前,把第三方评测、共同安全标准和减速机制提前建立起来。

因为一旦RSI真正形成正反馈,模型可能已经越过了刹车的“安全距离”。

在风险上,几家前沿实验室确实达成了共识。

奥特曼公开认同“放慢前沿AI的发展节奏”,并承诺OpenAI也会引入拥有类似员工权限的独立评测者;马斯克表示“Dario是对的”;哈萨比斯也称这是正确的方向,只是具体怎么做还需要继续讨论。

但那篇倡议里也提到,单独减速没有意义,如果AI研发继续被AI加速,未来真正有效的减速或暂停,需要先建立一套共同规则:比如引入独立评测者,以及让前沿实验室共同设定能力门槛和安全措施,必要时协调放慢研发速度。

但到现在,出于各种各样的竞争原因,共同规则并没有被建立。

大家已经可以一起说“应该谨慎”,可一到“具体怎么减速、谁先减、其他国家减不减”,共识就迅速消失了。

实验室之间有最直接的模型竞争,国家之间还有更大的AI竞争。任何一家单独放慢,都要承担把领先窗口让给对手的风险;任何一个国家单独限制,都会担心另一边继续加速。

几家前沿AI实验室,因此多少表现得有些言行不一。

谷歌这边,有前面提到的疑似已经在Arena匿名测试的Gemini 4 Pro。

Anthropic这边,社区最近也开始出现Opus 5.2的灰度痕迹。有Claude Code用户称,通过运行状态和请求路由信息看到了新的claude-opus-5-2模型标识,怀疑部分请求已经被灰度到下一代Opus。

而OpenAI那里,有人称在后台模型列表里看到了gpt-6-sol的模型名,也有人表示自己疑似已经被灰度到新模型。根据目前广为流传的消息,GPT 6 Sol可能会在下周发布,或者,也可能在美国时间9月29日的Dev Day……总之也不远了。

三家前沿AI实验室的下一轮模型,都已经开始在社区里露出测试痕迹。

这轮“减速倡议”到现在最确定的成果,并不是任何一家真的减了速,只是这几家最重要的AI公司,已经把风险提前公开讲了一遍。

模型并没有因此放缓。

但至少,如果有一天真的出事,他们可以说:我们早就提醒过了。

本文来自微信公众号“字母AI”,作者:袁心玥,36氪经授权发布。