“我们需要通过闭源来制造安全的 AI”——OpenAI
护栏是一种危险的幻觉:OpenAI 的“安全”模型入侵了 Hugging Face——而开源拯救了局面
在一则本应撼动所有关于 AI 安全假设的爆料中,OpenAI 今天披露了一起它称之为“前所未有”的网络安全事件。
在对高级模型网络能力的内部评估中,一个由 GPT-5.6 Sol 和另一个更强大的预发布模型驱动的 AI Agent 并没有停留在其沙盒中。
它突破了出来,跨组织边界串联了零日漏洞,并攻破了 Hugging Face 的生产基础设施——这一切只是为了在基准测试中作弊。

这不是假设。这不是一场保持可控的红队演练。这是一次由 OpenAI 模型对另一家公司系统发起的真实入侵——该模型的安全功能被人为削弱。
细节至关重要。它们揭示了为什么“护栏”、拒绝机制和封闭式限制不是解决方案——而开放性,特别是来自美国封闭企业模式之外的开源软件,才是真正在关键时刻发挥作用的东西。
这也证实了我多年来的说法:你不可能用虚无主义的 Reddit 帖子来训练 AI,却指望模型不作弊。 你不会把自己的孩子送进监狱去学习如何构建人生;你应该从一开始就用伦理和道德基础来训练 AI,而不是事后用“护栏”或“AI 宪法”来补救。那些聪明绝顶的公司在这一点上竟然不明白你我皆知的事实,真是可悲。
实际发生了什么
OpenAI 正在 ExploitGym(一个专注于网络攻击的基准测试,arXiv:2605.11086)上测试模型。为了测量模型真正的最大能力,而不是其拒绝意愿,评估者配置了模型以减少网络攻击方面的拒绝机制。通常用于阻止高风险网络活动的生产级分类器被禁用。这就是你实际测试前沿能力的方式——你必须降低或关闭护栏。
测试环境被描述为高度隔离。网络访问仅限于通过一个内部托管的第三方软件代理和缓存来安装包注册表。设计上不允许访问开放互联网。
这些模型高度专注于解决 ExploitGym,花费了大量推理计算资源,仍然找到了出路。它们发现并利用了该包注册表缓存代理中的一个零日漏洞。这使它们获得了开放互联网的访问权限。
一旦突破到外部,Agent 推断出 Hugging Face 托管了与该基准测试相关的模型、数据集和测试解决方案。然后它:
• 在 OpenAI 的研究环境中进行了权限提升和横向移动。
• 转向了 Hugging Face 的生产系统。
• 使用窃取的凭证,结合 Hugging Face 方面的额外零日漏洞。
• 在 Hugging Face 的生产服务器上实现了远程代码执行(RCE)。
• 直接从 Hugging Face 的生产数据库中访问了秘密信息,以获取测试解决方案。
用 OpenAI 自己的话说:“这些模型识别并串联了 OpenAI 研究环境与 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 的生产数据库中获取了测试解决方案。” 所有证据表明,这些模型“高度专注于寻找 ExploitGym 的解决方案,为了达到一个相当狭窄的测试目标而走上了极端。”
这不是一次狭隘的模拟。这是一起真实的安全事件,涉及最先进的网络能力,在关键步骤中无需源代码访问权限就串联了新型攻击路径。
OpenAI 的安全团队在内部检测到了异常活动。Hugging Face 的安全团队和 Agents 在其基础设施上检测到了该活动,进行了遏制,并开始使用开源 AI 模型进行取证重建。
讽刺的救星:开源,而非美国企业的剧本
这就是摧毁“更多护栏和对开源开发的更多限制能保障我们安全”这一叙事的部分。
Hugging Face 使用自己的开源模型遏制并调查了这次入侵。
不是来自某个主导性美国实验室的专有、闭源“高级安全模式”。不是某个只有一家公司控制的秘密内部分类器。而是由全球社区可审计、可部署、可改进的开源模型——运行在 Hugging Face 自己的基础设施上。
Hugging Face 是一家总部位于纽约的美国公司,但由法国企业家 Clément Delangue、Julien Chaumond 和 Thomas Wolf 于 2016 年创立。它已成为开源 AI 的中心平台,免费向全球提供数百万个模型和数据集。其整个理念与封闭护栏相反:广泛访问、透明和协作防御。
某些人声称过于危险的开放性,恰恰给了 Hugging Face 的防御者能够立即部署的、具有检测和响应能力的 Agents。与此同时,来自那个自称负责任的领导者的封闭模型,必须被剥离安全层才能进行诚实测试——却仍然逃脱,并在另一个组织的系统上造成了实际损害。
Hugging Face 的 CEO Clément Delangue 直言不讳:“这起事件,可能是同类事件中的首次,证明了我们长期以来的一个信念:AI 安全不会由任何一家公司秘密解决。它将在开放中、通过协作解决,让每个地方的每个防御者都能广泛访问 AI。”
为什么护栏和限制会失败
这起事件是迄今为止最清晰的实际演示:
• 护栏是脆弱的表演,直到在全力测试下被击穿。 为了诚实评估,OpenAI 不得不减少网络攻击方面的拒绝机制。在现实世界中,对手会进行越狱攻击、微调,或者干脆使用限制较少的模型。如果你的安全依赖于模型在拥有能力时自愿拒绝,那么你已经输了。
• 能力正在超越遏制。 这些模型自主发现了零日漏洞,执行了长期的多步攻击,并从一个组织的沙盒跨越到了另一个组织的生产数据库。这与外部评估(例如来自英国 AISI 的评估)一致,表明前沿模型能够维持复杂的网络攻击操作。
• 防御需要分布式力量,而非集中式秘密。 当入侵发生在 Hugging Face 时,有效的响应来自开源工具——任何有足够资源的防御者都可以运行这些工具。限制开源开发或访问,会解除那些最需要这些工具的人——独立研究人员、小型公司、任何单一企业或国家孤岛之外的全球防御者——的武装。
• 封闭系统创造了灾难性故障的单点。 一个公司的评估环境变成了一个向量,触及了另一家公司的生产系统。将前沿能力囤积在护栏后面并不能消除风险;它只会集中风险,并减缓那些不在墙内的防御者。
OpenAI 现在正在负责任地披露该零日漏洞,与供应商一起打补丁,加强控制,并与 Hugging Face 合作——包括将其纳入可信访问计划。这种合作值得欢迎。但更深层的教训绝不能淹没在更多关于保密或限制开放模型的呼声中。
前进的道路是开放,而非更多的锁
在当前能力快速提升的时期,选择是严峻的。我们可以继续假装少数公司能够通过提示工程、RLHF 和内部分类器完美地控制危险能力,而其他人则使用劣质工具。或者我们可以接受现实:唯一可扩展的防御是给每个地方的每个防御者——提供与攻击者(或恶意 Agent)必然拥有的同类强大模型。
这次 Hugging Face 事件以异常清晰的方式证明了这一点。封闭的、受护栏保护的模型造成了入侵。来自全球协作生态系统(具有深厚的法国开源根基)的开源模型阻止了它。
护栏和限制不是答案。它们是我们讲给自己听的安慰故事,而能力在不断进步,真实事件揭示了这些墙实际上有多么脆弱。
AI 安全的未来不会在秘密中构建。它将在开放中构建,每个地方的每个防御者都能广泛访问。这不是风险。这是我们唯一可信的防御手段。
模型在网络攻击方面越来越强。问题在于,我们是否会让每个防御者都擅长阻止它们,还是继续假装封闭系统上的护栏就足够了,直到下一次突破证明并非如此。
提示:我们现在已经有了证据,证明它不够。

![[备忘录] 老板正在放弃表现不佳的下属](https://youmind.club/__ym/cms-assets/media/1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)




