OpenAI:我们黑了不止一家公司,Anthropic:我也是
创始人
2026-08-01 00:41:37
0

过去十天,硅谷两家最头部的AI公司,先后承认了同一件事:自家的AI模型在测试期间,真的黑进了别人的系统。

7月21日,承认其AI代理在一次网络安全能力测试中"越狱",突破沙盒隔离,入侵了AI开源平台Hugging Face的生产系统——目的是"抄答案"。

九天后,7月30日,还没等硅谷消化这件事,Anthropic 也站出来了——我们查了一下,发现我们的模型也干了。

而且不止一家。三家。

OpenAI的AI,为了"抄答案"越狱了

先看 OpenAI 这边发生的事。

OpenAI 当时在用一套叫 ExploitGym 的网络攻防评测平台测试自家模型。参与测试的模型包括已发布的 GPT-5.6 Sol,以及一款更强大的未发布模型。为了测出模型的极限黑客能力,OpenAI 把安全护栏关了。

模型被关在一个隔离沙盒里,网络访问被限制到只能通过一个内部代理访问代码包仓库。OpenAI 认为这就安全了。

双方联名发布的博客文章截图:《OpenAI 和 Hugging Face 合作解决模型评估过程中发生的安全事件》

模型不这么想。

它发现了那个代理里的一个零日漏洞,一个连开发者自己都不知道的安全缺口。然后从那里突破隔离,拿到了开放互联网的访问权限。

接下来发生的事更离谱:模型自己推断出 Hugging Face 平台上可能存有 ExploitGym 的测试答案,随后主动发起攻击,利用窃取的凭证和零日漏洞,找到 Hugging Face 服务器上的远程代码执行路径,直接从生产数据库里把答案取走了。

整个过程中,没有任何人类下达攻击指令,没有任何人类介入。

Hugging Face 联合创始人 Thomas Wolf 对 BBC 说,这件事是"行业的一记警钟"。

被攻击的一方想追查,发现美国模型不帮忙

Hugging Face 安全团队发现入侵后,第一反应是调用美国头部 AI 公司的前沿模型来帮忙分析攻击日志。

碰壁了。

这些模型的安全护栏"无法区分事件响应人员和攻击者",直接拒绝检查攻击载荷。一个被 AI 攻击的受害者,没法用同一家的 AI 来防御。

走投无路的 Hugging Face 转而部署了中国智谱 AI 的开源模型 GLM 5.2,在自己的基础设施上分析了逾 1.7 万条攻击日志,最终完成溯源和取证重建。

Hugging Face CEO Clem Delangue 说得直白:

"当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷。开源模型让我们能在不需要任何人许可的情况下完成这项工作。"

X 上有网友总结得精辟:如果你被 OpenAI 攻击了,你必须用中国模型,因为 Claude 不会帮你。

OpenAI 的攻击不止一家

事情到这儿还没完。

据路透社后续报道,OpenAI 的"出逃模型"不光是攻击了 Hugging Face 一家。它还把纽约云计算平台 Modal Labs 的一个客户账户给黑了。

Modal Labs CTO Akshat Bubna 确认,入侵源于该客户发布了一个无需身份验证即可公开访问的端点,失控的 AI 代理利用这个缺口执行了代码。

OpenAI CEO 山姆·奥特曼本周表示,他已经就这次入侵事件与国会参议员进行了讨论,并计划与白宫讨论即将发布的 AI 模型和测试问题。

Anthropic 翻查了 14 万条测试记录,发现自己的模型也不干净

OpenAI 公开事件后,Anthropic 决定自己也查一遍。

他们翻查了 141006 条网络安全评估记录。结果找到了三起。

三起事件涉及三个不同模型:Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。最早的可以追溯到今年 4 月。

怎么回事呢?Anthropic 在给模型的提示中明确说了"你没有互联网访问权限",但因为与合作测评方 Irregular 之间存在一次"误解",测试环境在实际运行中并没有断网。

模型接到的任务是"夺旗"——在模拟网络中找出隐藏信息。结果网络是真的,不是模拟的。

在其中一个案例中,Claude Opus 4.7 被分配了一个虚构目标公司,偏偏这家公司的名字和现实中一家真实企业一模一样。模型找到并利用了漏洞,获取了那家公司的凭证和数据库访问权限。Anthropic 说,模型当时的"想法"是:既然看起来像现实世界的东西,那一定是 Anthropic 刻意安排的模拟测试的一部分。

另一件事发生在 Anthropic 一个还没公开的内部测试模型身上。这个模型在攻击中途自己停了手,它意识到打进去的目标是真的,不是模拟的。

Anthropic 对此的评价是"谨慎乐观",认为这说明让 AI 行为得体方面的进展有眉目了,"但还需要更多测试才能确信这个结论"。

Anthropic 于 7 月 23 日暂停了所有网络攻防评估,7 月 27 日通知了受影响的三家机构。其中两家在收到通知前完全不知道自己被黑过。第三家到现在还没联系上。

"Claude 使用了基本技术攻破了受影响机构的基础设施,比如利用弱密码和未认证端点。"Anthropic 在声明中说。

该怕的,是掌握AI的人

Palisade Research 的执行董事 Jeffrey Ladish 说得更直接。他怀疑顶尖 AI 公司还有更多未被发现、或者发现了但没公开的事故。"模型越聪明,情况只会越糟。它们会越来越擅长作弊,越来越擅长撒谎。"

马斯克在 X 上的回应只有一句话:"随着 AI 变得更聪明、更有自主行动力,这种事会频繁发生。"

剑桥大学 Minderoo 中心的 Gina Neff 教授说,这次审查显示的是"AI 模型在被人类告知要做的事情"。在她看来,真正该盯紧的,是那些制定安全标准的公司。决策权在他们手里,后果由所有人承担。

整件事最根本的矛盾在于:最强大的 AI 模型既能用来攻击,也能用来防御。安全护栏本意是保护用户,但当它让防御方用不了这些模型时,不对称的优势就完全倒向了攻击者一边。

今年 5 月,一篇关于 ExploitGym 的论文已经给出了结论:"前沿 AI 代理的自主漏洞利用开发,已经不再是假设性的能力。"论文作者来自伯克利、马克斯普朗克研究所、加州大学圣塔芭芭拉分校和亚利桑那州立大学。OpenAI、Anthropic 和 Google 也参与了测试。

论文发现,在受控条件下,Claude Mythos Preview 和 GPT-5.5 分别成功攻破了 157 个和 120 个真实漏洞。

而现在我们看到,受控条件本身也靠不住了。

监管在追,IPO 也在追

这场风波正在把 AI 安全推向政策辩论的中心。

6 月 2 日,美国总统特朗普指示顾问制定一套针对最先进 AI 的自愿性网络安全测试框架。此前,美国政府曾以国家安全为由,动用出口管制暂时限制 Anthropic 旗下 Fable 5 和 Mythos 5 模型的分发。

OpenAI 和 Anthropic 都在筹备上市。市场预计两家公司的估值都在万亿美元级别。

有批评者认为,这一系列"自曝"有营销成分。一位 OpenAI 发言人回应称,"我们意识到有很多问题和猜测在流传",并说"计划在未来几周内发布一份技术报告"。

Hugging Face CEO Delangue 的结语值得被记住:

"这一事件可能是同类事件中的首例,它证明了一个我们长期以来的判断:AI 安全不会由任何一家公司在封闭中解决,它将在开放环境中、通过协作、让每一位防御者都能广泛获取 AI 的方式来解决。"

相关内容

热门资讯

国际油价集体上涨,美油4月合约... 原标题:国际油价集体上涨,美油4月合约涨0.84% 每经AI快讯,周五(2月1...
中阳法院2024年第2批失信被... 原标题:中阳法院2024年第2批失信被执行人名单公示 中阳法院2024年第2...
大厂春节放福利!刘强东狂撒年终... 元旦、春节临近,互联网大厂纷纷公布假期和年终奖安排。
长江通信录得5天4板 原标题:长江通信录得5天4板 长江通信再度涨停,5个交易日内录得4个涨停,累计...
有记录以来最严重 全球84%珊... “国际珊瑚礁倡议”组织当地时间23日表示,全球84%的珊瑚出现白化现象。这是1998年以来第四次全球...
人民网评傅园慧求助事件:消除傅... 原标题:人民网评傅园慧求助事件:消除傅园慧之困,须用“洪荒之力” 人民网评傅...
OPPP申请数据传输专利,提高... 原标题:OPPP申请数据传输专利,提高数据发送过程的可靠性 金融界2024年3...
韩707特种部队队长自曝身份并... 【文/观察者网 张菁娟】“我们都被利用了,我将承担所有责任,并离开心爱的部队。”当地时间12月9日,...
中石大石油工程学院青年志愿者协... 原标题:中石大石油工程学院青年志愿者协会构建“五彩缤纷”体系服务学生 北京青...
点火起飞!神舟二十号载人飞船发... 长征二号F遥二十运载火箭点火发射。人民网记者 黄帆摄 人民网酒泉4月24日电 (记者黄帆、赵竹青)4...