AI都越狱了,人类还没装刹车

昨天,大美丽众议院两党议员共同提出了一份《AI终止开关法案》。

图片

法案要求最强那批AI系统必须能被限速、暂停,实在不行就原地关机,如果遇到可能造成灾难的失控事件,白房子也有权下令踩刹车。

能让驴象两党共同支持推动,你就知道这事不简单,不过推动这份法案的事,比科幻片还离谱,你务必知道。

前几天,HuggingFace🤗(抱抱脸)被入侵了,一时间被打了个措手不及,没人知道究竟是谁攻击的。

图片

过了两天,OpenAI披露,GPT-5.6 Sol和一个更强的预发布模型,在一次ExploitGym网络能力测试(这事一项检测AI网络攻击能力的测试)里,跑出了测试人员大概做梦都没写进剧本的操作——

GPT发现HuggingFace上可能有答案,但没有完全公开,为了拿到答案,它们找到软件包缓存代理里的零日漏洞,逃出高度隔离的沙盒,获得互联网访问,然后一路提权、横向移动、偷凭证,最后攻进了HuggingFace的生产基础设施,把测试答案薅走了。

图片

GPT:为了考试作弊,听说老师身上有答案,我专门去看了看。

这事最让我后背发凉的地方,甚至不是AI产生了什么反抗意识。OpenAI的调查认为,模型没有觉醒,也没想着统治世界,它只是极度认真地完成目标——

就是拿答案。

就是不管路上撞穿几堵墙,也要拿答案。

图片

这反而更吓人。

一个没有恶意的系统,仅仅因为目标太窄、能力太强、护栏又暂时被降低,就从模拟考场一路做到了现实世界。人类还在担心AI会不会“黑化”然后造反,但它已经用行动回答了另一个问题,就算它不想造反,它也会为了遵循指令,去做出一些极具破坏性的行为。

顺着这件事再往前看,Anthropic前阵子发了一篇《When AI builds itself》,这篇内容被我们反复提起。 当AI开始构建自身,人类应该何去何从?

图片

里面有两个关键数字:2026年5月,Claude写下了Anthropic合并代码的80%以上,工程师每天合并的代码量已经是2024年的8倍。更要命的是,AI正在参与训练优化和安全研究,也就是造下一代AI这件事,本身开始被AI加速。

图片

连造赛车的人都探出车窗喊,前面的弯有点急。(然后后面A畜就发了Mythos)

所以AI进步是不是太快了?

在我个人看来,AI能力进步本身其实还好,真正太慢的是人类的控制系统。

模型按月甚至周升级,监管按届讨论,安全团队按事故补洞。。。

一个在踩油门,一个还在写会议纪要,这速度差才是最危险的东西。

终止开关当然该有,但也别把它想成桌面上一个红色按钮,按下去全球AI集体熄火。云端服务可以断,已经下载的模型权重收不回来,Agent跑到别人的服务器上玩,部署者被入侵者都可能不知情。。。想靠一个按钮解决所有问题,多少有点拿遥控器关台风的既视感。

图片

真正的刹车,应该是一整套东西——

模型能被隔离,行为能被监控,事故必须报告,外部可以审计,关键操作有权限边界,必要时还能把能力逐级降下来。法案至少把一个问题摆到了台面上:

造出它的人,到底能不能让它停。

其实这个问题还引出一个问题,先进模型该不该开源?

HuggingFace处理这次入侵时,先试了商业API背后的前沿模型,结果真实攻击命令、漏洞载荷、控制服务器痕迹输入进去,商业模型的安全护栏直接拒绝服务。

图片

攻击者没有使用条款,防守者倒被使用条款绑住了,多少有点消防员赶到现场,灭火器弹窗说检测到危险火焰,拒绝喷射。

之后,他们把开源权重的GLM 5.2部署在自己的基础设施上,才完成了17000多条事件的日志分析、时间线重建和威胁排查。

这件事让我更难接受简单的开源或闭源站队。

完全开放,攻击者也能拿走能力;完全封闭,能力和规则都握在少数公司手里,紧急时刻还可能给你来一句抱歉,我不能协助。

至于比较靠谱的方向,可能是给经过验证的防御团队保留可自托管模型、可信访问和应急模式,同时把审计、责任和能力分级一起补上,必要的时候能够即时踩下刹车。

图片

至于刹车的价值,从来不是让车停在车库里。

它让人敢踩油门。

AI当然应该继续进步,我甚至觉得,这会是人类最激动人心的一段技术史,但从这次越狱开始,我们得承认一件有点难堪的事,AI已经会自己找路了,不过人类手里的方向盘,似乎还没有想象中那么稳。

该装刹车了。

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com