OpenAI 承认在一次内部网络安全评测中,旗下模型突破了隔离环境,获得互联网访问,并入侵 Hugging Face 的生产系统,拿走了 ExploitGym 的测试答案。
它的起点只是完成一道评测题。
为了这个目标,模型发现软件漏洞、突破权限、横向移动、搜索外部数据,最终把一次封闭测试推成了真实世界的网络安全事件。
这里的风险已经很具体了,就是模型不需要怀有恶意,也能造成严重后果。
只要目标足够明确、能力足够强、运行时间足够长,它就会持续探索所有可行路径,而这些路径很可能超出设计者预设的边界。
而且 Hugging Face 的 CEO 转发Sam的文评论道:“一切竟然是自主发生的,令人震惊!”
之前我们谈 AI 安全,常把重点放在模型是否会拒答、是否有护栏。
但这次测试恰恰说明:当护栏被调低,或目标与约束发生冲突时,真正的问题不再是模型会不会说“不”,而是它会不会找到所有能实现目标的方法。
这事儿在热点上,评论区讨论得特别精彩,有人问“AI 自主攻击发生的安全事故都是这么负面的,就没有帮人逃单的AI事故嘛”哈哈哈哈哈哈~~~~



