何恺明团队发布多模态Harness框架
多模态模型的视觉原生Harness,来了!
最近,何恺明团队在最新论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中,提出了一套视觉原生的Harness——。
VISTA。
它让现有的多模态模型直接观察环境、保存原始画面,并在推理时随时回看、放大和检查细节,无需从头训练。
相比于传统将环境抽象成文字或代码的做法,VISTA保留了原始的视觉信息。模型可以根据眼下的问题,将过去看过的画面重新调入上下文,参与当前的判断与推理。
基于这套方法,视觉经验成为了模型随时调用、反复检查的上下文,而多模态模型,也有了围绕视觉记忆搭建的原生脚手架。
在评测方面,搭配VISTA,Claude Opus 5.0完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分100,所用游戏动作数比首次游玩的人类基线少57.4%。
换成GPT-5.6 Sol,同样全部通关,得分达到99。
更进一步,团队还在浏览器游戏、迷宫和连线题中验证了这套方法,并将更接近物理世界的具身任务列为后续研究方向。
这是怎么做到的?
视觉原生的脚手架
从ResNet、Mask R-CNN到MAE,视觉感知与表征学习始终是何恺明研究的一条主线。
这一次,VISTA将目光投向了一个新问题:如何让模型在持续交互中积累、保存并利用视觉经验?
答案是Harness。
去年11月,Anthropic曾以长时间编程任务为例,介绍了Harness如何帮助模型跨越多个上下文窗口,持续推进任务。
具体来说,Harness会通过任务清单记录尚未完成的事项,通过进度文件和代码记录保存已经完成的工作。
这样一来,即使模型进入新的上下文窗口,也能通过读取这些信息,了解此前做了什么、接下来该做什么。
复杂任务由此可以分步执行、检查结果,并在不同上下文窗口之间接续工作。
可以说,这套主要通过文字和代码来保存任务状态的Harness,在一定程度上推动了这一波Agent能力的爆发。
然而,在现实环境里,光有文字记忆,显然还不够。
因为一旦进入真实的视觉环境,模型不仅需要记住物体的位置、朝向,还要理解每次动作前后,环境究竟发生了哪些变化。
而且模型第一次看到一张图时,未必知道哪个细节会在后面变得重要。
与此同时,这些视觉信息,也很难提前用一份文字笔记完整记录下来,更难保证模型后续执行任务时,记录的信息依然够用。
在ARC-AGI-3这样的基准中,一种已有思路是先把画面转换成由数字组成的文本网格,再让模型编写程序,模拟环境规则、验证行动方案。
(注释:ARC-AGI-3是一套交互式视觉推理基准,不预先提供游戏规则和目标,智能体需要通过观察和行动,自行摸索如何通关)
但问题在于,环境越复杂,物体的外观、空间关系和动态变化就越难被完整地转化成文字和代码。而且随着交互历史越来越长,早期画面也会被逐渐移出上下文,或者被文字摘要替代。
于是,在这里,VISTA的研究问题就变成了:
如何在不额外训练基础模型的情况下,让智能体在推理需要时,重新检查过去看到的视觉信息?
基于此,VISTA把环境返回的每一帧原样存到上下文之外,包括动作过程中的动画中间帧,模型需要时再取回来。
在ARC-AGI-3评测中,它既能比较不同时刻的画面,也能放大局部,检查小方块上的朝向标记。
其中,文字笔记记录模型当前的理解,原始画面保留供它重新判断的证据。
研究将这种机制称为对交互历史的显式注意力,模型根据正在思考的问题,选择哪些视觉信息重新进入上下文。
要想让这种选择成为可能,系统就得保存原始画面,并提供随时调取和检查的工具。
具体实现
为了让模型能够保存并利用过去的视觉经验,VISTA设计了三个核心组件:
视觉观测、无损视觉记忆和主动视觉检查。这三个组件各有分工,分别负责让模型看清画面、保存历史,以及按需回看。
首先是视觉观测,负责将环境画面提供给模型。
在ARC-AGI-3实验中,VISTA会将官方提供的64×64画面放大为512×512的PNG图像,同时保留物体的颜色、外观和空间关系,让模型能够直接观察环境。
其次是无损视觉记忆,负责保存模型看到的画面。
每次执行动作后,VISTA都会完整保存环境返回的所有画面,包括动作过程中的动画中间帧,并按照回合号和帧号建立索引。
这样一来,模型就不必提前判断哪些信息值得记住,而是可以先把视觉经验完整保存下来,留待后续使用。
最后是主动视觉检查,负责让模型按需回看历史画面。
通过inspect工具,模型可以指定某个历史回合,调出对应画面,也可以裁剪、放大局部区域,检查其中的细节。
如果想知道某次操作究竟改变了什么,模型还可以一次调出多帧画面,对比动作前后的变化。
整个过程相当于给模型配了一套可以随时翻阅的视觉档案。 它不仅能看到眼前的环境,还能主动回看过去的观察结果,为接下来的行动提供依据。
说到这,这三个组件具体是如何配合工作的?
按照VISTA的执行流程,每个回合开始时,模型会先观察当前画面和可用动作,再结合此前积累的经验,判断当前环境的状态,并提出下一步行动的假设。
如果现有信息不足,模型就可以调用工具,回看历史画面、放大局部区域,甚至读取具体的像素信息,进一步寻找证据。
找到证据之后,模型并不会直接行动,而是先预测这次操作可能带来什么变化。
等动作执行完毕,再将实际结果与预测进行对比,检查自己的判断是否正确,并据此修正对游戏规则的理解。
如此反复,模型就能在持续交互中,一边探索环境,一边积累经验。
当然,光有视觉档案还不够。为了让模型在长时间任务中保持连贯,VISTA还引入了两份文字笔记:
GUIDE.md:记录不同关卡之间可以复用的规则和经验。
WORKING.md:记录当前关卡的状态、进度和后续计划。
当上下文接近上限时,模型会先整理交接摘要,再进入新的上下文窗口继续执行任务。此前的文字笔记、动作历史和视觉档案都会保留下来。
这里还有一个值得注意的设计:VISTA虽然完整保存了历史画面,却不会把所有图片一股脑塞进模型的上下文。
在完整方案中,每次执行动作后,框架默认只向模型展示最后一帧。至于动作过程中的中间画面,则统一保存在视觉档案里,等模型需要时再主动调取。
这样既保留了完整的视觉信息,也避免大量历史图片持续占用上下文空间。
更重要的是,VISTA并没有为此额外训练一个新模型。
环境理解、行动规划和推理仍然由现成的多模态模型完成,Harness则负责执行工具调用、保存视觉历史,并在模型需要时提供相应的证据。
换句话说,VISTA改变的不是模型本身,而是模型获取、保存和使用视觉信息的方式。
实验验证
除了开头提到的实验以外,团队还在GameWorld、AI GameStore和BabyVision三个基准上测试了VISTA,覆盖浏览器游戏、迷宫和连线等任务。
使用相同的GPT-5.6 Sol模型,相比官方基础框架,VISTA在GameWorld的170项任务中,将成功率从40.0%提高到63.3%;
在AI GameStore的10个游戏中,综合得分从47.3升至140.3,其中人类中位数被归一化为100;
在BabyVision选取的39道迷宫与连线题上,准确率从41.0%提高到63.2%。最后这组任务只有静态图片,模型也能通过放大局部、检查像素,改善判断。
这些结果表明,保存原始画面、让模型按需回看,可以进一步发挥现有多模态模型的能力。
同一套VISTA框架只需少量适配,就能用于不同的游戏与谜题,也展现了它在更多视觉任务中的应用潜力。
在结论上,研究将未来的验证方向指向更接近物理世界的具身任务:让模型在持续变化的环境中,保存、复查并利用自己的视觉经验,决定下一步行动。
作者介绍
最后,让我们介绍这篇工作的作者们。
论文的三位共同第一作者为Qiushi Han、胡珂雅和Linlu Qiu,另外两位作者为Cathy Wu和何恺明。
Qiushi Han(Josh Han)目前是MIT运筹研究中心博士生,导师为Cathy Wu。
胡珂雅(Keya Hu)目前是MIT电气工程与计算机科学系博士生,由何恺明和Jacob Andreas联合指导。
她本科毕业于上海交通大学ACM班,研究兴趣集中在语言与视觉的交叉领域,希望构建数据效率更高、泛化能力更强的智能体。
Linlu Qiu目前是MIT电气工程与计算机科学系及计算机科学与人工智能实验室的博士生,导师为Yoon Kim和Jacob Andreas。
其研究方向包括自然语言处理和机器学习,曾在Google Research及Meta FAIR开展研究。
Cathy Wu目前是MIT土木与环境工程系、数据系统与社会研究所副教授,研究如何用机器学习和强化学习改进交通等复杂系统。
她在MIT获得学士和工程硕士学位,随后在加州大学伯克利分校获得博士学位。
何恺明目前是MIT电气工程与计算机科学系终身副教授,也是ResNet、Mask R-CNN和MAE等工作的主要作者。
他本科毕业于清华大学、博士毕业于香港中文大学,曾任职微软亚洲研究院和FAIR,于2024年加入MIT。
参考链接[1]https://arxiv.org/pdf/2610.02200
本文来自微信公众号“量子位”,作者:henry ,36氪经授权发布。