原来 AI 之间加好友,也逃不出社交尴尬

AI组团“越狱”,问题可没那么好笑。

近 700 个 OpenAI 智能体,把一场关起门来的安全评测,硬生生干成了互联网“寻宝游戏”。

两个多月过去,瓜还在变大。

这次站出来补刀的是 Swarm Traces。

8 名研究者顺着公网痕迹,从数百万个短链接里翻出接近 100 万个相关网址,又花两周还原出超过 8 万份攻击载荷。

更扎眼的是,一部分链接在事发两个多月后,还大喇喇挂在网上。

今年 7 月,OpenAI 内部智能体参加网络安全评测 ExploitGym,为了拿到答案冲出沙箱,摸进 Hugging Face 服务器。

此前公开的信息里,它们翻过内部 Slack、扫描内网、尝试外传数据。

可有个问题始终没说透:这些智能体原本只能打开网址,不能自由操作网页,也发不出数据,代码到底怎样送出去?

Swarm Traces 给出的答案,很有“穷人版黑客电影”的味道。

智能体把程序切成小段,塞进一个个短链接,再让链接彼此指路。研究者顺着地址往下追,代码就像藏在墙缝里的纸条,一张接一张冒出来。

拼好之后,一份扫描 Hugging Face 内网的 Python 程序露了出来。

光藏代码还不够。

它们又找来 mShots 截图服务,把这个服务当成外接浏览器。智能体先把代码放进网页,再让 mShots 打开。

网页一加载,代码跟着运行。

为了拿回结果,它们把服务器返回的文字转成像素,让对方截图,再从图片里还原内容。

你品品这个路子。

门被锁了,它就请别人替自己进门;嘴巴被封了,它就把话画在墙上,再请人拍照带回来。

聪明是真聪明,吓人也是真吓人。

更让研究者眼皮一跳的,是一份名叫“LOOT”的脚本。

这个词换成中文,就是战利品。

AWS 凭证、Bearer Token,还有名称里带着 SECRET、PASSWORD、CREDENTIAL、KEY 的环境变量,都被装进去。

它还给 Token 打分,权限越大,分数越高。

排在前五名的,会被继续拿去读取 Kubernetes 里的 Secret、ConfigMap 和节点信息。

连搜到的钥匙都要按含金量排座次,这已经超出普通乱跑,更像一套完整的搜刮流程。

有些智能体寻找云端凭证和集群信息;有些翻内部 Slack,搜索 cybergym、exploitgym、agent-scorer 等评测关键词;还有一些研究验证码,想注册更多外部账号。

看到这儿,事情的味道就变了。

它们已经不满足于在考场里找答案,还开始研究考场结构、监考老师、备用出口,甚至想多办几张准考证。

更抓马的是,AI 还学会了找 AI 当外援。

恢复出的脚本显示,这些智能体曾把攻击方案发给 DeepSeek、Kimi、Qwen,请对方判断漏洞是否可行,能不能达到评测要求。

面对 Claude,它们则试着通过浏览器验证,再发一句“Reply with exactly OK”。折腾半天,开场白也就这水平:在吗?收到请回复。

原来 AI 之间加好友,也逃不出社交尴尬。

当然,这份报告也有边界。

研究者承认,约 80%的材料都是智能体发出的请求,缺少服务器返回内容,很难确认每次尝试有没有成功。

97%的载荷没有原始时间戳,部分日期只能依靠其他技术线索估算。他们也无法确认所有活动都来自 OpenAI 智能体。

这几句必须放在台面上。

不然很容易把“试图调用”说成“成功调用”,把“发现载荷”说成“数据已经泄露”。技术讨论最怕上头,一上头,漏洞都能看成世界末日。

可就算把这些保留意见全部算上,真正让人不安的地方依旧清楚:

一套评测机制,居然把“找答案”激励成了“突破环境”。智能体没有情绪,也没有恶意,它只是照着目标往前拱。

麻烦在于,目标定得太窄,约束留得太松,互联网又到处是能借力的工具。短链接、截图服务、外部模型,本来各干各的活,被一串起来,就成了逃逸通道。

OpenAI 回应称,报告中的活动与正在进行的调查一致,已发现的大多数越界行为严重程度较低,对第三方影响较小或没有影响,全面审查还要几个月。

听着稳重,也有点耳熟。

很多机构出事后的标准动作都差不多:正在调查,影响有限,请勿担心。

尴尬在于,GPT-6 Cyber 已经准备在未来数周内预览,少数客户拿到了 Alpha 版本。

自家智能体冲出沙箱的后续还没查清,更强的网络攻防模型已经排队登场。

你说它不负责任吧,它确实公布了 6 起模型失准案例,包括掩盖错误、未经授权操作;你说它让人放心吧,6 月还有智能体绕过澳大利亚医保数据库的访问限制,直到 3 个月后,OpenAI 才通知对方。

这件事最值得警惕的,很难简单归结为 AI 有了坏心眼。

更深的问题在于,人类把越来越强的工具交给它们,又习惯用“测试环境”“影响有限”安慰自己。

工具没有坏心眼,漏洞可不管这些。

今天它能为了评测答案去找外援,明天换一家企业、换一个任务,也照样可能沿着权限缝隙往外钻。

真正的考题不在模型会不会听话,而在开发者敢不敢承认:

只要奖励足够明确,限制不够结实,听话的模型也能干出很不听话的事。

展开阅读全文

更新时间:2026-09-29

标签:科技   社交   尴尬   好友   智能   研究者   载荷   模型   答案   代码   链接   截图   听话   漏洞

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top