首页文章详情

刚刚,Gemini 4 Pro全新曝光,实测碾压Opus 5.5

新智元2026-09-27 16:12
怎么每个人都在测Gemini 4 Pro?

Gemini 4 Pro,又曝出新的检查点了!

最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕!

有开发者直呼:「在爆肝 400 小时使用 Opus 5.5 和 GPT-6 之后,Gemini 4 Pro 依然让我头皮发麻!」

谷歌的新一代大杀器,展现出超强的3D 物理模拟能力、代码生成能力和长文本推理能力。

有开发者直呼:「在爆肝 400 小时使用 Opus 5.5 和 GPT-6 之后,Gemini 4 Pro 依然让我头皮发麻!」

而且,谷歌内部高层的态度也很鲜明。

Google DeepMind新任掌门Koray Kavukcuoglu首次公开确认:Gemini 4已经进入后训练早期。

它的训练进度大大提前,仅耗时两个月,早期预训练就基本结束。

准备好,一大波硬核实测来了!

核心实测大赏:7大硬核Demo 

一夜之间,仿佛每个人都能用Gemini 4 Pro了。

从晒出的Demo来看,它在3D生成、物理引擎模拟和长文本代码构建上的表现,令人惊艳。

孔雀SVG测试也来了,显示出巨大的飞跃。

水上飞机起飞,吊打Opus 5.5 

知名测评博主 @AI_Screening 要求它和Opus 5.5用代码生成一个3D浮筒飞机在水面滑行起飞的物理模拟。

之前,Opus 5.5生成的视频惊呆了一大群人,但没想到,这次,Gemini 4 Pro的表现完全超越了它!

可以看到,Opus 5.5生成的飞机虽然在动,但机身晃动剧烈,仿佛随时要解体,水面的物理反馈也很生硬。

但Gemini 4 Pro就要丝滑多了,加速平稳,水面反射清晰,对「溅水」效果的渲染很逼真。

从流体力学逻辑和画面整洁度看,属于把Opus 5.5按在地上摩擦。

16分钟手搓「3D国际空间站」 

开发者 @thtbee_ 抛出了一个王炸。

在没有任何3D模型导入的情况下,Gemini 4 Pro 仅仅用了 16分钟,通过纯代码,就生成了一个交互式的3D国际空间站绕地球运行的模拟程序!

令人惊喜的是,它不仅自己用 Three.js 建好空间站模型,还很聪明地从网上抓取了正确的地球贴图,保证经纬度和颜色绝对准确。

这种「无中生有」的建模能力,让人惊叹。

当然,也有人吐槽生成的UI界面有点丑,且背面仍有透视bug。

从灯塔到火箭发射(Three.js渲染) 

网友 @HarshithLucky3 甩给它一个高难度指令:「用 Three.js 将一个灯塔变成火箭发射,不要包含任何UI元素。」

结果,Gemini 4 Pro 完美遵循了指令!

测试者夸爆了它的「审美」:它为画面中的所有元素都添加了质感极佳的纹理,整个3D输出质量好到离谱。

3D Wii 遥控器高精度还原 

开发者 @LuminaBench 测试了它的工业设计建模能力,让它生成一个 3D 的任天堂 Wii 遥控器。

结果,它对3D物体的细节把握非常强,并且生成速度「快得难以置信」!

要说有什么不完美,就是它在处理Prompt时似乎有点过度雕琢,会竭尽全力去丰富细节,哪怕你没要求。

不过,它的设计审美在不同部件上表现不太稳定,有些地方绝佳,有些地方略显违和。

据测试,Checkpoint 2 的细节密度非常出色,而且精确度高得多,还是目前最快的前沿模型,无人能及。

机械蜂鸟,碾压 GPT-6 Sol 

博主 @TimJayas 甩出了他的「祖传」机器蜂鸟prompt,考验模型对复杂机械结构和动态行为的理解。

结论是:「Gemini 4 Pro 的表现简直太棒了!老实说,质量与 Fable 旗鼓相当,但远远好于 GPT-6 Sol!」

当然,它有时也会被GPT-6 Astra碾压。

14分钟生成完整网站,单提示词生成游戏 

而且,它的工程能力超强。

 一位开发者仅用 14分钟,就生成了一个极具创意的产品展示完整网站,前后端全包。「真的就是几分钟一个网站。」

更让人惊喜的是,多人反馈,只需要输入一个Prompt,它就能直接给你吐出一个完整交互的网页游戏。

参数大泄露:1000万上下文+自主智能体 

虽然新检查点最近才曝光,但Gemini 4 Pro的参数此前就已经泄露了。

有人曝出,Gemini 4 Pro有1000万Token的上下文窗口,和256k的输出上限,如果属实,就彻底告别「代码写一半就断」的噩梦,一句话生成大型软件的全套代码。

它可以永久跨会话记忆,无需API即可联网,具备真正的AI Agent能力。

甚至,它还有机器人控制能力, 可以直接作为大脑,控制现实物理世界中的机器人!

此前一张基准测试图显示,Gemini 4 Pro在编程、智能体、推理上均超越 GPT-6 Astra 和 Claude Fable 5.1。

它在AI智能体编程测试(DeepSWE v1.1)拿下 88%,在编码能力测试(Terminal-bench 2.1)飙到惊人的 95.3%!

有人惊呼:闻到了RSI的味道。

谷歌真急了:2个月训完,全军冲刺4.0! 

为什么Gemini 4 Pro会突然空降?因为谷歌的底线被碰了。

落后GPT-6和Opus 5.5一段时间后,巨头开始反扑。

就在周三,Google DeepMind 新任掌门人 Koray Kavukcuoglu 首度公开「交底」,透露了重磅消息。

根据The Information爆料,Koray 透露,Gemini 4 自 7 月启动了「有史以来最具野心的预训练」后,仅仅耗时约两个月,就基本完成了早期预训练!

目前,Gemini 4 已经全面进入了重要的「后训练」阶段。

「我们的意图是尽可能快地发布一个早期的后训练版本,」Koray 难掩兴奋地表示,「因为我们看到了结果,我们感到非常激动!」

这也是为什么,竞技场上会突然冒出这个「半成品但已经极强」的测试节点。

而且,发现Gemini 3.5 Pro 性能不足以碾压对手后,谷歌直接壮士断腕,把所有算力全砸向 Gemini 4!

当被尖锐地问及「是否担心谷歌已经落后于同行」时,Koray斩钉截铁地说:「我对我的团队有百分之百的信心,我们注定永远要站在技术的最前沿。」

他透露,Gemini 4 目前正在被内部工程师用于Antigravity AI ——这是对之前「谷歌员工用 Claude 写代码」传闻的回击。

而且,他强调,他们不再执着于AGI的概念,「真正的问题是,我们是否有能力构建出我们可以完全信任的智能体」?

他还透露,Gemini 4 的研发,帮助谷歌硬件工程师设计「未来两到三代的 TPU」。显然,这种算法与芯片底层深度绑定的护城河,让英伟达很警惕。

最后,Koray 抛出了时间表:他希望 Gemini 4 的正式发布时间能「远早于年底」。

还有消息称,Gemini 4 Pro十一就可能发布

性能炸裂就算了,谷歌还准备掀起价格战。据泄露,Gemini 4 Pro 的定价极具攻击性:

输入:$2.25 / 100 万 Tokens

输出:$11.25 / 100 万 Tokens

对比友商动辄几十美刀的旗舰模型,这简直是「骨折价」。

难怪有人喊话:「这性价比绝了,4 Pro要是真超预期,现在充会员就是抄底!」

而且,谷歌要把 AI 芯片送上天了!

下周,谷歌将搭乘 SpaceX 的猎鹰9号,把装有4颗 TPU 芯片的卫星送入太空!

未来,天上可能真会出现一张庞大的星链 AI 数据中心网。

看来,此前LMSYS里的 gemini-3.8-flash 只是「极早期后训练」的冰山一角。

但正如测试者所言:「第二个检查点比第一个检查点有了肉眼可见的巨大飞跃,谷歌这次是真的在『烹饪』一道大菜。」

OpenAI和Anthropic如何接招?

Gemini 4 Pro的加入,会不会改变ASI决赛的终局?

参考资料:

https://x.com/alannnfx/status/2103750054607565014?s=20 

https://x.com/alannnfx 

https://x.com/alannnfx/status/2103887770016227351 

https://x.com/alannnfx/status/2103750054607565014?s=20 

https://x.com/alannnfx/status/2103887770016227351 

https://x.com/AIBoticssq/status/210349105724846399 

本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。