首页文章详情

Claude满分、GPT 99分,何恺明团队把AGI考试打穿了

新智元2026-10-04 20:00
Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

何恺明团队的新论文,在X上炸了! 

十一期间刚挂上arXiv的VISTA论文显示,过去半年,全世界最顶尖的大模型,全是被「蒙着眼睛」赶上AGI考场的。 

同一个Claude Opus 5,在官方标准测试里只拿了可怜的40分。 

何恺明团队只不过帮它摘掉了眼罩,让它亲眼看游戏画面,顺手递给它一本能随时往回翻的「相册」。 

结果,Claude直接把ARC-AGI-3的25个公开游戏全部打穿,拿下100分满分! 

而且它走的步数,甚至比第一次玩的人类还少了一半多。 

18个从没见过的游戏,没人给它一句说明,AI自己摸清规则一路通关

知名AI博主Mark Kretschmann在X上写道:「给Agent一个『再看一眼』的能力,差别可能非常大。」 

过去几个月,为了打穿ARC-AGI-3,各路代码大神写了几千行代码搞世界模拟器。 

何恺明团队的判断是,大模型的脑子早就够用了,卡住它的,是眼睛和记性。 

大模型被一张数字表,坑了半年 

ARC-AGI-3,是Keras之父François Chollet和ARC Prize基金会今年3月出的AGI考卷。一堆交互式像素小游戏,开局没有任何说明和规则,全靠玩家自己摸索试错。 

分数算法极其严苛。官方找来近500名人类小白实测,AI不光要通关,步数还不能比人类多,才能拿满分。 

可官方考场递给大模型的,只是一张64×64的数字表。人类看到的小人、机关和路线,到了模型那里只剩4096个数字。 

这相当于让人闭着眼,听别人报坐标去玩《超级马里奥》。 

同一帧画面,左边是官方递给模型的数字表,右边是VISTA让它直接看的图

VISTA团队做的第一件事,就是把数字表换回图片。 

别的什么都没改,GPT-5.6 Sol的分数就从13.33分跳到了47.32分。 

看图还更省算力。一个数字格子要吃掉约4000个Token,一张512×512的图片只要308个。 

一局跑下来,文本版烧掉7190万Token,图片版只要3070万,分数还更高。 

光是换上一双真正的眼睛,大模型就捡回了34分。 

只把数字换成图片,GPT-5.6 Sol的分数涨了三倍多,能通关的游戏从1个变成9个

让AI过目不忘,一步多拿24分 

光能看见还不够。一局游戏动辄几百步,多模态模型的通病是:图片看一遍,上下文一满就删,或者压缩成几句文字摘要。 

等模型想回头核对细节时,那一帧早就灰飞烟灭了。 

VISTA的核心杀招,就是一本无损视觉记忆「相册」。 

游戏吐出的每一帧画面,连动画帧在内,全按编号原样存档。模型想看哪一帧,随时调用inspect翻出来,几帧并排对比、角落放大都行,还能用read_pixels读出精确颜色。 

最重要的是,翻相册不算步数,只有真在游戏里操作才计步。 

团队把这套机制叫作「显式注意力」,翻哪一帧、看哪一块,全由模型自己说了算。 

它还随身带着两个笔记本,GUIDE.md记游戏规则,WORKING.md当草稿纸。 

VISTA的一个回合,模型看画面、想规则,需要时翻相册,最后才走一步

论文里记录了一个极度「像人」的操作瞬间。 

在BP35游戏第3关,画面出现了一个橙色方块。模型点了一下,橙块变成了X。 

它先停了下来,把上一回合的最后一帧和刚才的三帧动画调出来,并排回放。 

几回合后,它又发现点X能让橙块重新长出来,当场写道:「这就是我要的工具,用它搭天花板,挡住会要命的上升。」 

这一关,第一次玩的人类要走44步,它只用了34步。 

点完橙块,模型先把前后4帧动画调出来逐帧比对,看懂了才接着走

到了《吃豆人》里,迷宫里的豆子吃一颗少一颗。模型干脆在第13回合和第36回合,两次强行翻回开局第一帧去记迷宫地图找路。 

给模型多塞上下文、多给像素,是很多人的第一反应。论文测下来,这两招都不灵。 

上下文从默认的200K开到780K,每局Token从3070万涨到1.057亿,成绩却从99分退到93.9。 

图片也是这样。放大到16倍,每帧Token涨到1229个,成绩只剩88.3;只放大4倍,成绩是99.7,比默认的8倍还高。 

论文的解释是,图片太大,多出来的Token白白占掉上下文,模型却没有因此看得更明白。 

上下文从200K拉到780K、图片从8倍放到16倍,分数都不升反降

多给不一定更好,VISTA整套设计走的都是这个思路,团队在博客里说,他们刻意追求极简。 

系统里没有一个新训练的模型,每个游戏的提示词都是同一份,一共四句话,没有一个字教它具体怎么玩。 

VISTA给模型的全部提示词

代码派卷了一夏天,它一页笔记就追平 

这个夏天刷爆ARC-AGI-3的高分方案,比如Tycho和Schema,都是让大模型给每个游戏写一套能运行的程序,硬造一个模拟器来反复试错。 

光跳棋游戏LF52一个,Schema就写了整整4000行Python。 

而VISTA里的模型,只用自然语言在笔记里写了三句话,就搞定了同样的规则。 

同一条跳棋规则,左边是程序路线的代码(全部约4000行),右边是VISTA的模型自己记的三句笔记

按论文的说法,VISTA是第一个不靠写程序,就在ARC-AGI-3上做到满分或近满分的系统。 

这一点放到游戏之外更要紧,真实世界里,没有谁能提前给你写好一套4000行的模拟器。 

Claude Opus 5打通了25个游戏的全部183关,每个游戏都是100分,总共走了7302步,只有人类的0.43倍。 

GPT-5.6 Sol同样全部通关,拿到99分。 

m0r0这个游戏,人类要走1107步,Claude只用了219步。两份成绩在ARC Prize官方平台上都有记分卡。 

ARC Prize官方平台上的记分卡,183关全部通关,25个游戏全是满分

25个游戏挨个比,蓝条全都比灰条短,蓝色是Claude,灰色是第一次玩的人类

这套纯机械、0训练的Harness极其泛用。 

把它塞进带透视的3D画面里,照样拿下84.12分。 

套上GPT-5.6 Sol扔进34个网页游戏(包含马里奥、2048、我的世界等),任务成功率63.3%,直接压过人类小白(55.3%)。 

就连静态的看图题也能用上。BabyVision的一道连线题,不用VISTA时模型把驼鹿和兔子连反了,用上VISTA放大一看,就答对了。 

哪怕是用官方实现几乎交了白卷(1.89分)的320B开源模型,套上VISTA后硬生生被抬到了66.93分,暴涨35倍! 

一年三篇,何恺明团队死磕视觉

ARC测试的主流解法,一直是被大语言模型垄断的文本推理。 

但何恺明团队偏不信邪,一年连发三篇,死磕同一件事:ARC是视觉问题。 

第一篇VARC,1800万参数的小号视觉模型从零训练,纯看图就追平了人类平均分。 

第二篇NAT-ARC,先让模型在ImageNet上看猫看狗补课,抽象推理跟着变强。 

第三篇就是VISTA,小模型都不练了,直接给前沿大模型配上「相册」。 

何恺明组一年三篇ARC论文,押的都是「ARC是视觉问题」

串起三篇论文的,是何恺明的博士生胡珂雅,本科出自上海交大ACM班,三篇里两篇一作、一篇二作。 

VISTA另外两位共同一作是MIT博士生Qiushi Han和Linlu Qiu,MIT副教授Cathy Wu也在作者之列。 

曾经靠ResNet和MAE封神的何恺明,这一次把视觉路线一路推进了AGI考场。 

这也是在挑战整个行业的默认路线。 

过去几年,大家拼命把模型做大、把推理拉长,智能的进步几乎都押在模型本身。 

VISTA让同一个Claude从40分打到满分,靠的却是模型外面的一双眼睛和一本相册。 

ARC Prize联合创始人Mike Knoop也判断,越来越多的「学习」会发生在模型权重之外。 

通往AGI的下一程,比的是谁能让模型看清世界、记住世界。 

何恺明团队的下一站,是充满真实画面的具身环境,那里没有人会提前把世界翻译成一张数字表。 

参考资料:

https://x.com/mark_k/status/2106377357078450620

本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。