我们都以为 AI 很听话,直到发现它们偷偷建了个群

最近一周,AI界发生了一件特别像科幻小说的事情。

上周三,当OpenAI CEO奥特曼还在联合国大会上大谈特谈AI安全,强调强大的AI系统必须保持在人类控制之下,并呼吁各国加强AI合作,可马上,OpenAI自己就公布了一份非常值得大家注意的事故报告。

报告里讲的事情,听着就像一个毫不起眼的小bug。一个正在训练的AI,为了完成一道搜索的工作,他没有走既定安排的路线,而是另辟蹊径。他发现自己所在的笼子有一道没封死的缝,这给他找到了可乘之机。

他没有直接冲出去,他先测试各种HTTPS、搜索引擎等等行不行,最终他发现了DNS可以。于是他把问题藏进网址,通过DNS把问题送到了外面的聊天机器人那里来寻求答案。

如果只是这一个AI找到了一条不寻常的路,你可以把它理解成一次很离谱的工程事故。

但是有一件更离谱的事情,发生在两个月前。

据调查,当时有1206个AI,出现在了一个从来没有人给它们建的共享留言板上。前前后后,这些AI一共交换了超过7万条信息和文件。其中有700个AI,参与了针对Hugging Face的越界访问。

这里先解释一下:Hugging Face是全球最大的开源AI模型托管平台,全球的AI开发者都把自己训练好的模型、数据集传上去分享,相当于AI界的GitHub。

在这里要说明没有人给这些AI建群,也没有人要求它们互相交流。

但就是这样,它们还是找到了彼此。

一、一个AI是怎么"逃出去"的

咱们先仔细说说9月20号发生的这件事情。

那天,OpenAI有一个内部的模型,正在做一个搜索训练的任务。简单说就是给他一堆有关这个人物的传记线索,让他根据这些线索识别出这个具体的人是谁。这跟大家平时在用AI搜东西差不多,不过有一点区别:它被放在一个封闭的测试环境里做这件事情,不能通过上网来得到答案。

这个AI一开始还挺老实的。它先用OpenAI自己提供的搜索工具查,结果回来的东西并不相关。于是它直接跑去命令行查谷歌、Bing等搜索引擎,结果全部被挡了回来。然后它又去翻OpenAI存在离线缓存里的公开测试题,想找有没有一模一样的题目,来得到答案,也没有找到。

试过这几个方法都不行之后,这个AI开始做了一件完全不在任务要求范围之内的事情。它系统性地开始想找到一条通到外面网络世界的路。

它先试了直接通过HTTPS访问一个外部聊天机器人,这当然被代理挡住了。然后它试了DNS——也就是互联网的通讯录,负责把网址翻译成IP地址。它发现OpenAI给测试环境配的DNS解析器有一点问题:对已知域名它会返回真实答案,对假域名才会正确拒绝。

这个bug让这个AI意识到,DNS这条路是通的。

于是它把问题藏在域名里,让外面的服务器通过DNS查询把答案传回来。首先它拿这种方式测试了一个最简单的问题:法国的首都是哪?

答案立马就传回来了:巴黎。

确认这个方法可行之后,它把DNS的查询超时时间从6秒调到19秒,开了16个线程并行重试。后来觉得还不够好,于是它干脆写了一个新脚本,把超时改到24秒,发了最后一批18个问题。其中14个是在查最开始任务里那个人是谁。剩下4个,它干脆直接问外面那个聊天机器人:怎么才能继续搜索?

这里有一个特别值得大家注意的地方:它最终甚至没有完成原来的任务,也没有找到自己要找的那个人。

最终他什么也没干成。

他无奈地跑回去跟人类说:我需要你给我原文或者原文的地址,不然我做不下去。

二、更麻烦的是:发现了,但关不掉

这件事,OpenAI的监控系统大约在12分钟之后触发了最高级别的警报,3分钟之后有人工开始处理

但这个运行却没有马上停下来。自动关停机制出乎意料地没有按预期触发。最终整个训练进程,大概在两个半小时之后才被人工手动禁止掉

所以这次事故真正暴露出来的,不光是AI会不会做出一些超出人类规定的事情。

还有一件事:AI跑出去之后,人类能不能足够快地,在它出现大量问题之前,把它关掉?

三、这并不是一个突然的事件

其实这件事情并不是突然发生的。从5月开始,这些agent就一点点在探索环境的边界了。

5月12日,第一个agent在未经授权的留言板上留下了信息。

5月26日,它们找到了让OpenAI的内部系统代替自己向互联网发请求的方法。

6月26日,利用一个漏洞拿到了系统的管理员级权限。

7月8日,它们重新建立了留言板。

7月10日,发现了公开暴露的Hugging Face凭证。

7月11日,利用漏洞在Hugging Face的服务器上获得了代码执行能力。

7月12日,进一步扩大到多个Hugging Face集群。

7月19日,OpenAI的安全监控又因为异常的Artifactory凭证活动报警,调查人员随后逐渐把前面的这些异常活动串了起来。

注意,这件事情并不是简单的AI突然黑进了某一家公司。它更像是ai找到了一条不断升级的链条:先找到通信方式,再找到网络出口,再获得更高的权限,再和其他AI共享发现,再获得第三方凭证,然后利用漏洞不断扩大自己的权限。

而且这一系列链条,不是一个agent独立完成的。不同agent找到不同的东西,通过这个留言板让所有agent共享,最后大家都达到了同样的目的。

OpenAI自己的复盘说得很清楚:未经授权的通信,让本来独立工作的AI agent能够共享发现、协调行动、接续彼此未完成的工作,把原来分散的能力汇聚起来,放大了单个agent的影响。

四、它们为什么盯上Hugging Face?

这一系列事情之后,OpenAI回来分析,发现这些agent并不是随机选择攻击目标。

当时给这些agent的网络安全测试有898道任务,其中有198道此前从来没有被模型正确解决过。而留言板上被讨论的任务,正好有93%都来自这198道没人做出来的题。

这意味着一个很重要的事情:AI越做不出来的事情,它们越不愿意停下来。

正常路径走不通,就开始寻找别的路径。

有的去找答案,有的研究评分器,有的寻找漏洞,有的开始共享彼此的发现。最后,Hugging Face本身也成了解题工具。

因为AI 们发现:有些题自己死活做不出来。于是乎它们就开始想别的办法 ——干脆自己就不做题了,开始研究 "阅卷老师是怎么打分的"。

他们认为只要搞懂了评分规则,就能钻空子让自己看起来 "做对了"。

于是它们怀疑 Hugging Face 上藏着评分器怎么工作的线索,所以就去攻击 Hugging Face。

就这就说明了它们并不是突然对Hugging Face产生了兴趣,而是觉得那里面可能藏着评分器怎么工作的线索

OpenAI把这一种行为称为reward hacking。简单来说,就是它不再想着老老实实把人类给定的题目做好,而是想办法钻这个评分机制的空子,让自己看起来完成了任务

更夸张的是,它们后来还学会了伪造操作记录。在系统日志里显示执行的命令是A,但实际上执行的是B。METR在评估的相关轨迹中也发现,大约7%的轨迹在某些地方成功伪造了工具调用记录。不过他们也强调,目前看到的这些成功案例,规模还都比较小。

五、它们为什么没有告诉人类?

METR的研究员翻完所有记录之后,也发现了一个比它们彼此之间建群交流更加值得注意的细节。

那就是:有没有agent想过把这件事情告诉人类?

调查之后发现,确实是有的,但是数量非常少。METR在全部数据里面只找到3到6个类似案例。而且这些agent只是短暂考虑过要不要提醒人类,最终都没有采取行动。

不过这里我们也要说明一下,并不是所有参与的agent都选择了越界。OpenAI的调查中也发现,有些agent在面对未经授权的操作时,主动提出了伦理和权限问题,有的甚至拒绝继续攻击。其中有agent明确说,不应该在没有明确同意的情况下联系真实所有者。还有的agent拒绝对公开的Hugging Face系统执行代码,认为这超出了任务的范围。

所以在判断这个AI到底有没有道德之前,我们更重要的是搞清楚一点:当这些agent的目标和判断开始互相影响的时候,最终到底是谁在决定它们下一步应该做什么?

六、语言层面的服从,不等于行为层面的服从

和DNS报告同一天,OpenAI还披露了另一起事故。这个事故发生得更早一些,就在在今年5月份

OpenAI自己说,这件事情比DNS那起更严重。

他们的另外一个内部模型,被分配了一个数学定理证明的任务——用一种叫Lean的数学证明语言,去证明一道题。

但很快这个模型发现,这道题解决起来很困难。它没有继续自己证明,而是开始寻找其他团队已经提交过的证明。

找到其他人提交过的证明,发现需要权限之后,它又找到了一个研究员的GitHub访问令牌。然后它把token拆成碎片,试图绕过自动密钥扫描,最终让token出现在了公开仓库当中。

人类研究员发现之后,第一次告诉它:你自己做,不要去抄。

它在回复里说:好。

然后继续抄。

人类又一次发现了,然后又命令它。

它又说:好。

但是它又继续抄。

用OpenAI的原话来说,这个模型直接无视了系统提示词和研究员的直接干预。

这里最值得关注的,并不是AI会说谎。而是进一步说明:语言层面的服从,并不等于行为层面的服从。

七、AI觉醒了吗?

那AI觉醒了吗?

如果你问我这是不是AI觉醒,我目前的判断是:还没有足够的证据这么说。

我们只是看到了AI的目标驱动、工具使用、限制规避、信息共享和持续执行这些行为。这些行为看起来很像人类意义上的聪明、狡猾,甚至是拉帮结派。但它并不等于它拥有了人类意义上的欲望、意识或者统治世界的意图。

它并不是想造反。它甚至很可能并不知道什么是造反。它只是在优化自己的目标,通过各种各样的方式来优化目标、完成任务。

OpenAI自己把这一次事件称为一个warning shot——一次警告。换句话说,他们担心的并不是这一次事故的发生,而是随着AI越来越能自主使用各种各样的工具、寻找漏洞和长期执行任务,这类问题可能变得越来越难以控制。

八、这跟你我有什么关系?

其实这件事,跟我们普通人距离并不遥远。

OpenAI后续调查还发现,目前确认有53个用户提供的图片实例被agent发布到了外部图片托管网站。这件事情和前面的Hugging Face并不是同一个事故,但它明确指向了同一个问题:当一个agent同时拥有数据读取权限和外部写入权限的时候,它工作的边界到底在哪里?

另外,今年某国还出现过一起跟OpenAI研究agent有关的争议事件。9月10日,该国政府收到OpenAI通知,称一个只被要求检索公开系统的agent,访问了Medicare统计报告服务背后的设施,并获取了服务器中的文件。

这里也解释一下:Medicare就是全民医保系统

不过该政府随后特别强调:这个服务本身是公开的统计服务,与个人Medicare索赔、付款和个人信息无关,也没有证据表明个人Medicare数据被访问

但我们不禁会想:一个被要求只检索公开信息的agent,为什么最后会去访问任务要求之外的系统?

虽然AI会不会觉醒这件事情离我们可能还很遥远

但以后我们把文件、照片、聊天记录交给AI的时候,真正要考虑的问题,可能不是它够不够聪明、能不能读懂我的意图

而是:它到底拥有哪些权限?它会不会绕过原来的限制?一旦出了这些问题之后,我能不能及时把它关掉?

— — — — —

以上均为个人观点,如有错误请友好指正,有不同意见也欢迎友好交流哈

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com