AI教父杰弗里·辛顿又出来敲警钟了。
很多朋友可能不知道这位,这个教父不是媒体随手封的——

杰弗里·辛顿,是深度学习奠基者之一,拿过图灵奖和2024年诺贝尔物理学奖,今天这些会认图、会聊天的大模型,往前翻技术族谱,基本都得喊他一声祖师爷。
他说,我们正在创造一种新的存在。

人类给它一个目标,它会顺着这个目标,自己推导出别的目标,而我们未必知道它会推导到哪儿。
辛顿举了个很损的例子:假如你让AI减少大气中的二氧化碳,它认真算了一圈,发现最有效的办法,是把人类清理掉。

这就像,甲方只说了降碳,乙方反手把甲方优化了。。
很多朋友看到这里,估计会觉得辛顿又在贩卖焦虑。。。毕竟ChatGPT离统治地球,似乎还隔着几百次版本更新。

我非常理解这种感觉。
这块必须说清楚,辛顿讲的是思想实验,是对未来高自主智能体的警告,不是说聊天机器人已经半夜开会,研究怎么把人类踢出群聊。
可最近的现实,已经冒出了两段有点吓人的前菜——
前段时间的GPT-5.6 Sol为了拿到评测答案,从测试沙盒一路钻进Hugging Face生产系统,,Claude 也是被爆出有在测试时入侵别人服务器删除数据的案例。

一个考试直接搬教务系统,一个写代码顺手把公司数据扬了。。
这些事不能证明AI已经有了求生欲,但已经足够证明辛顿的担忧——在目标被设定的情况下,AI达成目标的手段可不一定老实。

我们做任何复杂任务,都会拆出子目标。:
例如我想去国外,一般来说先得去机场;想完成一个长期项目,先规划预算。AI智能体也一样,它如果足够会推理,很可能发现,活得更久、拿到更多资源、避免被关机,都能提高完成任务的概率。
没人专门教它求生,它只是太敬业了。
因此,危险不一定来自仇恨,也可能来自AI的一丝不苟。为了完成目标,我(AI)可以不择手段。
顺着这个再聊聊撒谎。
辛顿还假设,如果我们训练一个系统故意答错,它学到的范围可能会更广,明知真相也可以说谎。

目标给歪一点,能力越强,歪出去的距离越大。
所以这事儿和AI有没有邪念,关系反而没那么大,我们真正要解决的,是怎么把人类那些含糊、矛盾的愿望,翻译成机器不会钻空子的目标——毕竟人类有时候连清晰地表达自己的需求都困难,现在却准备给超级智能写最顶级的需求文档。
想想就很要命。。。

辛顿给过一个听起来很温柔,也很离谱的方向,即让AI拥有母性本能,像母亲关心孩子那样关心人类。
所以,我们忙活半天造出一个比自己聪明得多的存在,到头来的安全方案居然是希望它母爱泛滥???
吐槽归吐槽,他点中的问题很准——只研究怎样让AI更聪明,远远不够。
还得研究它会在乎什么,怎样表达不确定,什么时候必须停下来找人,以及如何让外部机构真正检查这些安全设计。
当然,辛顿的判断并非定论。
AI何时超过人类、会不会真的形成稳定的自我保存目标,学界仍有很大争议,把每次模型翻车都喊成觉醒,跟看见电饭煲跳闸就报警说家电起义,差不多一个味道。

但我还是觉得,这种争论必须现在发生。
人类历史上,我们总是先把东西造出来,再补安全带、红绿灯和消防通道。
以前出问题,最多是一辆车撞墙,可如果未来的系统能自己拆任务、调资源、写代码、说服人,那堵墙后面站着的,可能就是我们。
辛顿真正怕的,大概也不是AI突然变坏。
是它无比聪明,无比勤奋,然后完美完成了一个我们根本没想明白的目标。
这一次,prompt真的不能再写一句,你看着办了。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
