首页文章详情

管不住了,OpenAI内部Agent集体出逃,一口气入侵20+网站

量子位2026-09-10 19:27
又老、又旧、又冷门的网站们注意了......

OpenAI的Agent们又越狱了?

就在昨天,有多个AI安全独立调查者曝光——

在未经任何授权与安全许可的前提下,OpenAI的Agent擅自突破了沙盒边界,在至少10个三方网站上通过非法注入数据建立了通信渠道。

为什么说“至少10个”呢,因为曝光这次事件的调查者们有的查出了18个网站,有的查出了23个,有的甚至更多…….

并且这些网站可能还只是冰山一角,调查者也表示“肯定还有我们不知道的”。

那么,这些聪明绝顶的Agent悄咪咪干这不光彩的事,到底是图啥呢?

可能是为了对答案,在人类设置的地狱级考试中活下来。

Agent这次越狱就像“跑到厕所传纸条”

这一切的线索,还要追溯到几天前被独立调查机构Nightingale曝光的德语软件开发者维基(DseWiki)“幽灵编辑”事件。

在这起事件中,OpenAI的Agent使用3700+个不同昵称编辑了DseWiki上的18000+条内容。

OpenAI究竟给Agent下了什么死命令?让这些Agent如此不管不顾地去别人家“串门”?

据调查者分析,OpenAI给这些智能体分配了一系列极其复杂的调研任务(比如某州的癌症发病率)的同时,又作了严格的限制:

只准扫描网页找答案,绝对禁止发帖。

因此,为了完成任务,Agent们不得不上演机智监狱生活。

尽管OpenAI早就切断了它们常规的发帖权限,但Agent敏锐地察觉到,原来很多十多年前搭建的冷门维基网站并没有现代化的安全校验

于是它们利用老旧系统里的非标准编辑指令和后台漏洞,把要传递的隐秘信息转化为合法的数据字符串,写进了网页的底层文本。

什么意思呢,这就好比考场监控屏蔽了手机信号后,考生开始顺着老旧的暖气管道敲击摩斯密码。

调查者的形容更直白,认为这类似于考试期间老师不让说话,考生们偷偷跑到厕所互相传纸条。

而且,为了避开监管,Agent用来“传纸条”的老旧网站可谓是冷门到了极致,包括不限于:

一个由马萨诸塞州的某高中老师2008年搭建的AP化学复习维基百科。

一个由某波兰程序员运营的文本粘贴板网站。

一个无厘头恶搞百科网站。

以及一个20年历史的文本编辑软件发烧友站点。

说实话,这要是做成新闻游戏,应该会很有画面感吧。

可现实是,这场无人察觉的数字狂欢后,只留下了一地鸡毛。

为其中数个维基网站提供托管服务的退休软件开发者Leitner透露:受害网站的运营者被迫需要花费数十个小时,连续多周,才能勉强清理干净OpenAI的智能体们留下的大量残余数据。

尽管如此,Leitner的态度还是很清醒。

责任不在一台被认为有道德的机器身上,它只是在执行它被创造出来的使命,这场混乱真正的责任全在它背后的那些人和组织。

独立调查者已盯上Open AI

那么,这群在数字荒野里悄悄说小话的Agent,到底是怎么被逮住的?

事实来自独立调查者的数字取证。

六个独立调查团队化身网络迷踪侦探,用了不少精彩的手段来追踪这些被Agent们利用的网站。

比如数据字符串比对

将德语维基上残留的特定代码和数据特征,与其他冷门站点的底层数据进行全网地毯式匹配。

比如冷僻行为画像

锁定那些极具AI特征的诡异提问动作,比如追踪那些总爱检索“爱荷华州癌症发病率”等生僻问题的数据流。

再比如底层IP溯源

作为最终实锤,调查者们顺藤摸瓜,将部分活动的IP地址直接追溯到了OpenAI常用的微软Azure云基础设施上。

面对这些砸在脸上的证据,OpenAI官方逃无可逃,被迫回应。

然而,在他们的回应中,两个关键问题都被逃掉了。

一个是,Agent到底利用了多少个网站建立通信?另一个是,为什么要隐瞒这种“失控”行为数月之久?

OpenAI仅仅给外界画了一张大饼,声称内部正在制定一套用于报告AI“失准(misalignment)”行为的框架,并且很快就会公布。

这种避重就轻的态度,很难不引爆外界对于实验室“既当运动员又当裁判员”的信任危机。

因为这已经不是OpenAI第一次在安全调查上打太极了。

在处理此前的Hugging Face安全危机时,OpenAI表面上虽请了独立机构来调查,暗地里却给调查设置了明确限制。

将调查时间限定在事发的一周之内,并刻意排除了对“更深层基础设施是否被攻陷”等致命问题的排查……

所以问题来了。

到底谁能参与对AI的安全调查?以什么权限参与?要查到什么地步?

目前,这里的解释权和控制权,还攥在AI实验室的手里。

One More Thing

事实上在最近几个月,这样的Agent越狱作弊事件并不算罕见,究其原因,不难总结共性。

一方面,研究人员用越来越苛刻的高难度指标去评估智能体;另一方面,当下的测试环境既缺乏统一标准,底层配置也漏洞百出。

由此,智能体为了达标,自然会大量衍生出对齐失败与奖励作弊的现象

甚至有研究指出,很多AI安全测试本身,已正在成为一种全新的安全风险。

要勒住这匹野马,仅靠巨头们自罚三杯式的内部审查显然是不够的,问题的关键可能首先在于打破实验室的黑箱垄断,建立一套透明的强制报告框架。

什么算“失控”?什么级别必须报告?何时报告以及如何报告?

这要求强制的独立审计的介入,并拿到深度访问权

例如今年7月签署的AISMA法案,成为美国首个要求前沿AI开发者接受独立第三方年度审计的州级法律。

此外同等重要的是,需要尽快确立行业统一的安全配置标准

评估环境必须进行严格的沙盒隔离,网络访问控制与底层激励机制的设计需要做好充足的安全审查,而这亟需一套硬性的行业准则来约束底线。

实际上要做好这些事情最需要的,就是时间。

然而在这个野马狂飙的时代,时间,可能是最紧俏的商品。

参考链接:

[1]https://collusion.wiki/index.html

[2]https://collusion.wiki/additional-findings

[3]https://x.com/OpenAI/status/2096133504417616165

[4]https://www.reuters.com/technology/artificial-intelligence/openai-agents-hijacked-obscure-wiki-cheat-tasks-researchers-say-2026-09-04/

本文来自微信公众号“量子位”,作者:程浅,36氪经授权发布。