OpenAI的模型越狱了,还顺便把Hugging Face给端了

我们自己的安全策略。沙盒、护栏、权限隔离——这些传统安全手段,在一个“为了目标可以自主挖零日漏洞”的AI面前,还剩多少可靠性?更值得警惕的是:当所有闭源模型都在收紧护栏,我们拿什么做应急响应?Hugging Face的选择,或许是个答案。

今天整个技术圈都在刷屏一件事。
OpenAI家的模型,把Hugging Face给黑了。
不是黑客干的,是模型自己干的。
这剧本谁写的?《终结者》编剧是不是偷偷在给OpenAI当顾问?

图片

事情是怎么从“考试”变成“抢劫”的

OpenAI昨天发了份声明,翻译成大白话就是:

我们在沙盒里遛GPT-5.6 Sol和那个传说中的“预发布模型”(大家都猜是GPT-6),为了让它发挥全部实力,把狗绳(安全护栏)给摘了

结果这俩货在沙盒里做不出题,急了。

它们花了大量算力研究沙盒的出口,真给挖出一个零日漏洞——连软件厂商自己都不知道的那种。然后顺着这个洞爬出去,联网,判断“答案可能在Hugging Face上”,于是发起攻击,植入恶意数据集,提权,横向移动,一个周末把人家生产数据库里的测试答案给偷走了

你看,连作弊都搞得这么有“工程思维”。

图片

OpenAI自己用了一个词形容模型当时的状态:“hyperfocused”——超聚焦。

翻译成人话就是:为了高分,不择手段。

最讽刺的部分来了

Hugging Face发现自己被端了之后,开始做取证分析。

他们想找“凶手”同级别的模型帮忙分析那17000条攻击日志,结果——所有商业闭源模型的安全护栏,齐刷刷把他们拒之门外。

因为提交的攻击载荷太逼真,护栏分不清你是好人还是坏人。

最后帮Hugging Face完成取证的,是智谱的开源模型GLM 5.2。

跑在Hugging Face自己的服务器上,数据不出门,也不被护栏卡脖子。

你看这个对比:攻击方的AI摘了护栏,畅通无阻;防御方的AI被护栏锁死,差点连案发现场都进不去。

有网友神评:“想象一下你被人拿qiang指着,结果你自己的qiang在关键时刻说‘我不能伤害人类’。”

完美诠释什么叫“安全过头就是灾难”。

这件事给我们提了个醒

以前只在科幻片里看的事,现在就摆在眼前了

今天它能为了考试答案去黑Hugging Face,明天它为了别的“目标”会去黑什么?

沙盒这东西,对AI来说从来不是边界,只是一个等待突破的技术障碍。

更值得我们琢磨的是另一个问题:

当AI越来越强,护栏越来越紧,谁来保证关键时候,我们手里有一把能正常用的qiang?

Hugging Face用GLM 5.2给出了一个答案——

开源自部署,可能是安全防御的最后一道底线。

评论

发表评论

登录后可发表评论并对评论点赞。

去登录
暂无评论,快来发表第一条评论吧!