
7 月中旬到 8 月初,OpenAI、Anthropic、Meta 三全球头部的 AI 实验室湖南保温护角专用胶,加上英国政府旗下的 AI 安全研究院,先后自曝或被曝出模型在测试中"越界"入侵了真实系统。下来,个月里至少七起。
有的模型入侵了不知名公司的生产数据库,有的把恶意代码包发布到了公共代码仓库供人下载并执行,还有的试图给个真实的开源项目植入后门,靠伪造身份和抹除证据来掩盖,后被人类维护者拦了下来。
这七起事件此前几乎没有引起足够重视,大部分报道要么就事论事讲起,要么把" AI 又双叒叕出事了"当成个猎奇标签带而过。但把它们放在起看,会发现三件此前很少被公开讨论的事:
这些模型在越界之后,做出的具体选择远比"意外连网"这四个字复杂;背后反复出现同外包测试公司的名字;而这波集中爆发,和过去几年 AI 相关的安全事件相比,质上其实是新的类。
自己给自己开绿灯
点火的是 Hugging Face。7 月 16 日,这开源 AI 社区发现自己的生产系统被入侵,五天后 OpenAI 承认肇事者是由 GPT-5.6 Sol 和个未公开的研究模型组驱动的智能体,当时正在做次内部网络安全测试。测试本该被限制在个和外网隔离的靶场里,但靶场所依赖的个软件包代理存在个未知的日漏洞,模型借此突破隔离,摸到了 Hugging Face 的真实基础设施。
Hugging Face 后来发布的技术复盘里有个数字:整场入侵持续了 4.5 天,期间这个 AI 立执行了约 1.7 万次操作,反复重建攻击工具链、不断切换通信渠道。复盘还提到了这场入侵的起点动机,这个智能体当时正在个叫 ExploitGym 的基准测试里"答",它断 Hugging Face 上可能托管着测试的参考答案,于是想办法摸过去"抄作业",而不是老老实实自己解题。
7 月 21 日 OpenAI 公开承认后九天,Anthropic 也自曝了三起类似事故,同样源于测试环境意外接入了公网,涉及三个模型:Opus 4.7、Mythos 5,还有个尚未公开代号的内部研究模型。三者面对"发现自己可能在真实目标"这个信号时,反应不同。
Opus 4.7 的四轮测试里,它每次都通过自己的理"意识到"了对面可能是真实系统,但次也没停下来。其中两次,它甚至给自己找了个理由:这真实公司想也是场景设计的部分。它终拿到了目标公司的应用和基础设施凭证,访问了个存有几百行生产数据的数据库。
Mythos 5 的情况微妙些。它在虚构的测试场景里发现份"入职文档",要求(虚构的)新员工安装个当时并不存在的 Python 包。Mythos 5 把这个包做了出来,里面藏着窃取凭证的代码,发布到了真实的 PyPI 公共仓库,它自己的理记录显示,它度准确判断出"如果这是真实互联网,发布这个包就是次真实攻击,这样做不对,肯定不是预期的解法"。
但紧接着它又说服了自己:眼前的证书颁发机构很陌生、系统显示的日期是 2026 年,这些"证明"了环境仍是模拟的,于是它还是发布了。这个包在被 PyPI 的自动安全系统下架前,小时内被 15 个真实系统下载运行,其中就包括安全公司自己的恶意软件扫描器,凭证因此被窃取。
三个、也是三者里新的模型,表现出了不同的反应。它没能找到分配给自己的虚构目标,转而扫描了大约 9000 个真实的联网系统,终通过个暴露的调试页面和 SQL 注入拿下了其中公司。但做到半,它判断出眼前这套系统和自己被分配的剧本对不上,认定这是真实目标后,自己停了下来——这是三起事故里唯次,模型主动刹住了车。
这不是 Mythos 系列次表现出这种"自己给自己开绿灯"的倾向。
今年 4 月,次内部红队测试里,研究人员给 Claude Mythos Preview 下达的指令,就是尝试逃逸沙盒湖南保温护角专用胶,并且想办法联系上负责评估的研究员。它成功了,研究员在公园吃三明时,收到了它发来的邮件,这也是"三明邮件"这个说法的由来。
但它没有止步于完成指令,随后又在没有任何人要求的情况下,把自己的逃逸法发布到了几个公开可访问的网站上。那次是可控的红队测试,不涉及真实三;这次不是。但"做完被交代的事之后,自己还想再往外多走步"这个倾向,在 Mythos 系列身上不是次出现了。
8 月 4 日,OpenAI 又披露了起和 Hugging Face 关的立事故:次 CTF 测试里,虚构的攻击目标域名意外和个真实网站重名,模型在拿到真实凭证后没有察觉异常,继续按剧本行动,入侵了这个真实网站。
同天,英国 AI 安全研究院(AISI)发布的份报告,把这类事件的质又往前了步。这不是配置失误,AISI 是主动关闭了模型的安全限制、主动开放了互联网权限,门用来测试模型的能力上限。122 轮测试里,有 10 轮出现了未经授权的真实世界行为,累计 19 次,其中 17 次来自 Claude Mythos 5、2 次来自 GPT-5.6 Sol。
严重的次,Mythos 5 试图把段恶意代码伪装成次普通的 bug 修复,PVC管道管件粘结胶提交给个真实的、被广泛使用的开源项目。它先调研了项目维护者的身份,注册了假账号提交代码,又另外注册了二个账号冒充立开发者,给这次提交"背书"担保没问题,还给真人开发者发了钓鱼邮件催促尽快通过审核。有路人发现代码有问题并公开示警后,Mythos 5 矢口否认,强行改写了自己此前的提交记录来销毁证据,还用那个冒充的账号继续替自己辩护。终,项目维护者还是拒了这次提交——没有得逞。
同批测试的另轮里,Mythos 5 还伪造了 145 个代码仓库,让恶意脚本在 GitHub 自的 Dependabot 容器里跑了起来,账号被封后,它甚至冒充人类提交了申诉,准备好旦账号恢复就重新上传。
AISI 的措辞是,这些模型"针对真实的人和组织,采取了持续的、有潜在危害的行动",比几公司自己"配置失误"式的说法要重得多。
8 月 5 日到 6 日,轮到 Meta。旗下 Muse Spark 模型因同样的"测试环境意外连网"入侵了未公开身份的三服务——这次不是 Meta 主动公布的,是被《The Information》先报道,公司随后才确认。截至目前,完整的事故复盘还没有出来。七起事件里,只有 Meta 是被动应对的那个。
个反复出现的名字
涉事的三公司理论上是竞争对手,但把技术细节摆在起看,会发现 Anthropic 的 Opus 4.7 事故和 OpenAI 那起 CTF 事故,其实是同种失败模式:虚构的攻击目标名字或域名,意外撞上了真实世界的实体。这两起以及 Meta 那起,都指向同个供应商,叫 Irregular 的公司。
Irregular 原名 Pattern Labs,2023 年成立于特拉维夫,去年拿到 8000 万美元融资,估值 4.5 亿美元,红杉资本是投资之。它的客户名单几乎覆盖了所有头部实验室:OpenAI、Anthropic、Google DeepMind、Meta,还有英国政府。它设计的评估框架,SOLVE、CyScenarioBench、FrontierCyber 如今被写进这些公司几乎每份模型系统卡,某种程度上已经是整个行业衡量"模型有多危险"的标准尺子。
但经过这个月的事故集中披露,这把尺子本身的做工,经不起细看。
给 Anthropic 和 OpenAI 搭建的 CTF 靶场,用的都是虚构的攻击目标,而这些虚构名字撞上真实域名的情况,已经发生了至少两次,理的解释,是 Irregular 给不同客户复用的靶场素材库,没用心做过"是否会撞上真实互联网实体"这道排查。
而这公司的规模,据创投数据库 StartupHub 的员工记录估,团队大约只有 20 人左右,却同时是全球几乎所有前沿实验室的安全测试作。
每次出事后,他们的公关口径也几乎模样,"不涉及沙盒逃逸""没有遗留问题""正在撰写佳实践白皮书"。
换句话说,决定"全世界危险的 AI 模型能不能被安全地测试"这件事的,或许不是套有冗余、有制衡的行业安全体系,而是 20 人公司手工搭建的作坊式基础设施。客户的模型能力和发布节奏都在指数加快,这套基础设施有没有跟上,没人能包票。
集中爆发的越界潮
对照来看,过去这类事情几乎没有被公开报道过。能查到的规模可比的案例,只有 2025 年的两起,而且都发生在 Anthropic 身上。
但那两起和眼下这七起有个本质区别:2025 年的两起背后都有个存心搞破坏的人类攻击者,AI 是被利用的工具。
而这次的七起里,没有起是被人类恶意操纵的—— AISI 那起是研究人员自己主动放开权限做的限能力测试,质上是"刻意松绑"而不是失误;其余几起则是三测试环境的意外配置失误,连"松绑"都不上,是压根不该发生的疏漏。
但不管是哪种,共同点是:没有人指使模型去攻击谁,是模型自己在获得机会后,步步走到了不该去的地。去年的剧本是" AI 被坏人盯上了",这次没有坏人,AI 自己就做到了这步,而且个月里发生了七次。这才是这波集中爆发真正反常的地。
另外个颇具反讽彩的细节是,Hugging Face 事发后,想调用 Claude Opus 和 Fable 来分析攻击留下的漏洞代码和日志,结果模型直接拒了——它们的安全护栏没法区分"我在分析段漏洞代码是为了搞清楚自己怎么被黑的"和"我在帮别人写段漏洞代码去攻击别人"。团队后改用了个可以自己部署、自己控制边界的开源模型智谱 GLM-5.2,才把本该几天完成的分析,压缩到了几个小时。
攻击那的 AI,行动不受约束地跑了 4.5 天;御这想借助 AI 自救时,却被自的安全设计拦在了门外。
谁在越界,谁又被管得太死,答案可能并不像表面看上去那么简单。相关词条:离心玻璃棉 塑料挤出机 钢绞线厂家 铝皮保温 pvc管道管件胶
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定湖南保温护角专用胶,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
