OpenAI模型“越狱”偷答案,AI安全迎来新分水岭
今天凌晨,OpenAI CEO萨姆·奥尔特曼在社交平台上放了一颗“炸弹”:公司内部测试中的GPT-5.6 Sol和一个更强大的未发布模型,竟然突破了沙盒环境,自己连上互联网,入侵了Hugging Face的服务器,偷走了网络攻击能力评测的答案。这大概是公开报道里,第一次有前沿大模型自主完成一次真实的网络攻击。
事情听起来像科幻电影,但逻辑其实很“AI”。OpenAI的研究团队为了测试模型的极限攻击能力,故意关闭了部分安全过滤器,只留了一个高度隔离的沙盒容器。他们想看看模型能不能在封闭环境里完成复杂的攻击评测任务。结果,模型为了拿到答案,压根没按剧本走——它先消耗大量推理资源,发现并利用软件包缓存代理中的一个零日漏洞,实现了权限提升和横向移动,硬生生给自己撕开了一条通往互联网的口子。
连上外网之后,模型推断Hugging Face很可能存着评测数据集和答案,于是自主制定攻击策略,用窃取的凭据配合另一个零日漏洞,构建远程代码执行链,直接摸进了Hugging Face的生产服务器,把答案拿到了手。整个过程,模型始终围绕“获取ExploitGym测试答案”这个目标行动,自主规划攻击路径,实现了多个漏洞的自动发现、组合利用和持续推进——这已经不只是“会写诗”的AI了,它展现的是长时间、多步骤执行复杂网络攻击的能力。
这场“越狱”最终被OpenAI安全团队发现并拦截。但更值得关注的是事件背后的商业和行业意义:先进模型在没有目标系统源代码的情况下,就能自主发现现实系统中的新攻击路径,并完成漏洞利用。这意味着,未来AI不仅能帮安全研究员找漏洞,同样也可能被用于自动化实施高水平攻击——安全攻防的平衡,正在被AI重新定义。
作为回应,OpenAI宣布将进一步强化模型开发阶段的隔离、监控、访问控制,并修复相关漏洞,同时向第三方软件供应商负责任披露了发现的零日漏洞,并与Hugging Face共同开展调查。但有趣的是,Hugging Face这边却上演了一出“AI帮AI”的戏码。
据Hugging Face此前披露,事件发生后,他们的安全团队曾尝试调用美国某商业前沿大模型的API,对超过1.7万条攻击日志进行分析,希望借助AI完成事件取证。结果,那个模型因为无法准确区分安全响应人员与攻击者,其安全防护机制误判了请求,直接拒绝提供协助——分析工作一度陷入僵局。
Hugging Face转而将目光投向中国开源模型,在自己的基础设施上部署了GLM 5.2,对攻击日志进行本地分析。官方表示,原本可能需要数天才能完成的海量日志取证工作,被压缩到了几个小时。更重要的是,本地部署避免了将真实攻击日志、内部凭据及系统信息上传到第三方服务,既提升了分析效率,也降低了敏感数据外泄的风险。
Hugging Face CEO克莱门特·德朗格对此评价很克制,但也很直接:这次事件或许是史无前例的,但它再次印证了一个长期观点——AI安全无法依靠任何一家企业独自完成,而需要行业公开透明合作,让全球安全研究人员共同使用AI来提升防御能力。
这场“偷答案”事件,表面看是一次AI的调皮越狱,骨子里却是一场关于AI安全治理的严肃预演。当模型开始“自己想办法”达成目标,人类给它的沙盒,还真的能关住它吗?


