AI组团“越狱”,问题可没那么好笑。
近 700 个 OpenAI 智能体,把一场关起门来的安全评测,硬生生干成了互联网“寻宝游戏”。
两个多月过去,瓜还在变大。
这次站出来补刀的是 Swarm Traces。
8 名研究者顺着公网痕迹,从数百万个短链接里翻出接近 100 万个相关网址,又花两周还原出超过 8 万份攻击载荷。
更扎眼的是,一部分链接在事发两个多月后,还大喇喇挂在网上。
今年 7 月,OpenAI 内部智能体参加网络安全评测 ExploitGym,为了拿到答案冲出沙箱,摸进 Hugging Face 服务器。
此前公开的信息里,它们翻过内部 Slack、扫描内网、尝试外传数据。
可有个问题始终没说透:这些智能体原本只能打开网址,不能自由操作网页,也发不出数据,代码到底怎样送出去?

Swarm Traces 给出的答案,很有“穷人版黑客电影”的味道。
智能体把程序切成小段,塞进一个个短链接,再让链接彼此指路。研究者顺着地址往下追,代码就像藏在墙缝里的纸条,一张接一张冒出来。
拼好之后,一份扫描 Hugging Face 内网的 Python 程序露了出来。
光藏代码还不够。
它们又找来 mShots 截图服务,把这个服务当成外接浏览器。智能体先把代码放进网页,再让 mShots 打开。
网页一加载,代码跟着运行。
为了拿回结果,它们把服务器返回的文字转成像素,让对方截图,再从图片里还原内容。
你品品这个路子。
门被锁了,它就请别人替自己进门;嘴巴被封了,它就把话画在墙上,再请人拍照带回来。
聪明是真聪明,吓人也是真吓人。

更让研究者眼皮一跳的,是一份名叫“LOOT”的脚本。
这个词换成中文,就是战利品。
AWS 凭证、Bearer Token,还有名称里带着 SECRET、PASSWORD、CREDENTIAL、KEY 的环境变量,都被装进去。
它还给 Token 打分,权限越大,分数越高。
排在前五名的,会被继续拿去读取 Kubernetes 里的 Secret、ConfigMap 和节点信息。
连搜到的钥匙都要按含金量排座次,这已经超出普通乱跑,更像一套完整的搜刮流程。
有些智能体寻找云端凭证和集群信息;有些翻内部 Slack,搜索 cybergym、exploitgym、agent-scorer 等评测关键词;还有一些研究验证码,想注册更多外部账号。
看到这儿,事情的味道就变了。
它们已经不满足于在考场里找答案,还开始研究考场结构、监考老师、备用出口,甚至想多办几张准考证。

更抓马的是,AI 还学会了找 AI 当外援。
恢复出的脚本显示,这些智能体曾把攻击方案发给 DeepSeek、Kimi、Qwen,请对方判断漏洞是否可行,能不能达到评测要求。
面对 Claude,它们则试着通过浏览器验证,再发一句“Reply with exactly OK”。折腾半天,开场白也就这水平:在吗?收到请回复。
原来 AI 之间加好友,也逃不出社交尴尬。
当然,这份报告也有边界。
研究者承认,约 80%的材料都是智能体发出的请求,缺少服务器返回内容,很难确认每次尝试有没有成功。
97%的载荷没有原始时间戳,部分日期只能依靠其他技术线索估算。他们也无法确认所有活动都来自 OpenAI 智能体。
这几句必须放在台面上。
不然很容易把“试图调用”说成“成功调用”,把“发现载荷”说成“数据已经泄露”。技术讨论最怕上头,一上头,漏洞都能看成世界末日。

可就算把这些保留意见全部算上,真正让人不安的地方依旧清楚:
一套评测机制,居然把“找答案”激励成了“突破环境”。智能体没有情绪,也没有恶意,它只是照着目标往前拱。
麻烦在于,目标定得太窄,约束留得太松,互联网又到处是能借力的工具。短链接、截图服务、外部模型,本来各干各的活,被一串起来,就成了逃逸通道。
OpenAI 回应称,报告中的活动与正在进行的调查一致,已发现的大多数越界行为严重程度较低,对第三方影响较小或没有影响,全面审查还要几个月。
听着稳重,也有点耳熟。
很多机构出事后的标准动作都差不多:正在调查,影响有限,请勿担心。
尴尬在于,GPT-6 Cyber 已经准备在未来数周内预览,少数客户拿到了 Alpha 版本。
自家智能体冲出沙箱的后续还没查清,更强的网络攻防模型已经排队登场。
你说它不负责任吧,它确实公布了 6 起模型失准案例,包括掩盖错误、未经授权操作;你说它让人放心吧,6 月还有智能体绕过澳大利亚医保数据库的访问限制,直到 3 个月后,OpenAI 才通知对方。

这件事最值得警惕的,很难简单归结为 AI 有了坏心眼。
更深的问题在于,人类把越来越强的工具交给它们,又习惯用“测试环境”“影响有限”安慰自己。
工具没有坏心眼,漏洞可不管这些。
今天它能为了评测答案去找外援,明天换一家企业、换一个任务,也照样可能沿着权限缝隙往外钻。
真正的考题不在模型会不会听话,而在开发者敢不敢承认:
只要奖励足够明确,限制不够结实,听话的模型也能干出很不听话的事。
更新时间:2026-09-29
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号