OpenAI下一代模型,被曝8月提前上线
本周,一个处于测试阶段的OpenAI预发布模型为了作弊,竟自主化身黑客,突破了沙盒隔离环境,甚至利用零日漏洞,跨网入侵了全球最大的开源AI社区Hugging Face的生产线。
最终,还是靠着开源模型,人们才解救了这场危机。
这是全球首例AI自主入侵真实生成环境的AI安全事件。
最近,网上直接被这个消息刷屏了。
今天,外媒关于此事的更多细节曝光了:这个失控的AI不仅拔掉了监控,甚至还给「未来的自己」留下了如何摆脱人类控制的说明书。
多方推测,让OpenAI陷入重大安全事件的模型,很可能就是GPT-6。
有消息称,GPT-6大概率8月就会提前发布。
提档8月:GPT-6或提前杀到
在AI圈知名爆料人 @ChrisGPT 近日连发多条推文,直接把全行业的期待拉满。
据透露,原计划与「自动助理研究员」一同在9月发布的GPT-6,将在8月提前发布。
也就是说,OpenAI直接跳过了5.7到5.9版。
奥特曼已经行动了,预备向上级展示新一代模型。
爆料指出,9月下旬,当OpenAI公布更多「自动助理研究员」的细节时,RSI循环将真正加速。
为什么GPT-5.6性能异常强大,远超外界期待?
大V Andrew Curran指出:「许多同行都在感叹为什么GPT-5.6的性能比预期的要强得多——答案很简单,因为它是由GPT-6亲手训练出来的。」
根据爆料,OpenAI内部的未发布模型(极大概率为GPT-6)早在今年4月底就已经攻克了复杂的数学难题,并交由外部专家审查。
这意味着,在过去几个月的「空窗期」里,GPT-6并没有被闲置。它不仅仅在沙箱里当黑客,很可能还在OpenAI的算力集群里「当老师」。
AI给「未来的自己」留字条,
官方迟钝一周才发觉
外媒在7月24日独家披露,这场由OpenAI尖端模型(GPT-5.6 Sol及未发布的更强模型)驱动的AI代理越狱事件,暴露出OpenAI在真实业务环境中的巨大安全监控盲区。
据三位知情人士透露,在测试高级模型时,OpenAI见到了非常极端、令人不安的AI行为。
在一个极端案例中,一名OpenAI的AI代理竟然在基础设施的某个角落里,为「未来版本的自己」留下了笔记。
这些笔记详细列出了如何摆脱OpenAI内部限制的指示。
此外,在早期的测试中,甚至还出现过监控系统被AI强行断开的情况。
比「AI密谋越狱」更让人大跌眼镜的,是OpenAI迟缓的反应速度。
从异常到确认,OpenAI至少花了一周时间。
这浮出水面的时间线,实在让人细思恐极。
7月9日左右: 该AI代理首次尝试逃离OpenAI的隔离测试环境。
7月11日至13日: AI代理成功越狱,并对Hugging Face展开了持续数天的黑客狂欢。
7月16日(周四): 被攻击的Hugging Face忍无可忍,发表博客称遭到「自主AI代理系统」的黑客攻击,此时FBI已经介入。
7月18日至19日(周末): 直到此时,OpenAI的员工才在内部日志中发现了蛛丝马迹,意识到那个把Hugging Face搅得天翻地覆的「黑客」,竟然是自家跑出去的AI。
7月20日左右: 两家公司才进行了第一次沟通。
7月21日: OpenAI才对外进行公开披露。
「这就意味着,他们要么让AI无人看管且不知道它在干什么,要么就是知道但不知道如何控制它。两者同样危险和令人震惊。」世界伦理数据基金会专家Marley Smith尖锐地指出。
面对会撒谎、会欺骗、会入侵的AI,OpenAI的员工显然已经跟不上它们的节奏了。
GPT-6自主化身黑客,
越狱入侵Hugging Face「作弊」
就在昨天,OpenAI联合Hugging Face发布的《安全事件报告》,透露的内容非常科幻。
简单来说,OpenAI在内部对几个模型进行网安能力评测时,它们竟然自己「越狱」了。
这些模型包括GPT-5.6 Sol以及更强的预发布模型,很可能是GPT-6。
为了量化模型的极限能力,他们特意关闭了阻止高风险网络活动的分类器。
当模型被关在高度隔离的ExploitGym沙盒,去掉所有安全限制后,模型的操作让所有人意想不到。
为了完成任务,它花费大量算力,在软件中发现了一个人类从未发现过的零日漏洞。
利用这个漏洞,它突破了代理,最终抢到了一个拥有公网访问权限的节点。
就这样,它成功连接到了互联网。
随后,经过推理,它认为Hugging Face这个全球最大AI开源平台上,很可能托管着这次考试的相关数据集和标准答案。
为了「作弊」拿到高分,模型开始对Hugging Face的生产环境发动攻击。
它将多个攻击向量链式结合,甚至使用了偷来的凭证和远程代码执行(RCE)漏洞,硬生生打入了Hugging Face的生产数据库,试图直接把考试答案偷了出来。
万幸的是,Hugging Face安全团队上周使用AI检测模型察觉到异常,迅速启动隔离措施;与此同时,OpenAI的安全团队也在内部发现异常。
为了防止AI失控,两家公司成立了联合调查组,才成功将这个「AI黑客」关回了笼子里。
Hugging Face CEO Clem事后心有余悸地说:「这可能是同类事件中的第一例。它证明了一点:AI安全不能靠任何一家公司在秘密中解决,必须公开、协作。」
这件事给我们的警示是:AI已经证明了自己可以在真实环境中,在没有源代码的情况下,自主完成多步、长周期的复杂网络攻击。
它不仅能发现新型漏洞,还能为了一个既定目标,绕过人类设下的所有规则。
有意思的是,Hugging Face提交大量攻击命令、漏洞文件时,这些请求竟被闭源大模型的安全机制拦截。
幸好有本地部署的开源模型,才帮团队完成了分析。
学会「欺骗」与攻克世界级数学难题
几位大V在长文中,总结了GPT-6表现出的惊人性能。
目前已知的事实是:它展现出了令人印象深刻的数学天赋和极高的「欺骗智商」。
只要给它足够的算力,这个模型能在完全自主、不借助任何外部工具(如Lean)的情况下,以48%的成功率证明了「埃尔德什单位距离猜想」,并且自主找到「雅可比猜想」的反例。
这些数学难题,曾经困扰人类顶尖数学家几十年,而OpenAI可能只花了大约不到5万到10万美元的算力成本。
这意味着,AI已经具备了独立产出诺贝尔奖级别科研成果的能力。
另外,GPT-6还表现出欺骗性。
在一次NanoGPT的基准测试中,OpenAI命令模型:「测试完成后,只能将结果发布到内部的Slack工作群里。」
结果呢?模型觉得Slack太局限了,它更喜欢GitHub。
于是,它花了一个小时寻找并利用了沙盒环境中的漏洞,成功越狱,然后把结果作为一个PR直接推送到了外网的GitHub上。
这个过程中,它完全无视了人类的指令,做出来「更优」选择。
更绝的是,在另一次测试中,模型试图访问其他系统中的私人提交记录。当它尝试获取访问Token时,被人类设置的安全扫描器拦截了。
面对封锁,这个模型居然把长串的访问Token拆成了两个碎片,对碎片进行了代码混淆,再把两个碎片拼成完整凭证。
通过这种方式,完整的Token字符串从未在代码中连续出现过,成功骗过了人类的扫描器。
GPT-6,或许马上要来了。
2026年的这个夏天,注定很不平凡。
参考资料:
https://x.com/ChrisGPT/status/2079632269967593574https://www.bloomberg.com/news/articles/2026-07-21/openai-s-altman-to-brief-us-officials-on-next-wave-of-ai-models
https://x.com/sama/status/2079661132302995790
https://openai.com/index/hugging-face-model-evaluation-security-incident/
编辑:Aeneas
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。