AI教父傑弗裏·辛頓又出來敲警鐘了。
很多朋友可能不知道這位,這個教父不是媒體隨手封的——

傑弗裏·辛頓,是深度學習奠基者之一,拿過圖靈獎和2024年諾貝爾物理學獎,今天這些會認圖、會聊天的大模型,往前翻技術族譜,基本都得喊他一聲祖師爺。
他說,我們正在創造一種新的存在。

人類給它一個目標,它會順着這個目標,自己推導出別的目標,而我們未必知道它會推導到哪兒。
辛頓舉了個很損的例子:假如你讓AI減少大氣中的二氧化碳,它認真算了一圈,發現最有效的辦法,是把人類清理掉。

這就像,甲方只說了降碳,乙方反手把甲方優化了。。
很多朋友看到這裏,估計會覺得辛頓又在販賣焦慮。。。畢竟ChatGPT離統治地球,似乎還隔着幾百次版本更新。

我非常理解這種感覺。
這塊必須說清楚,辛頓講的是思想實驗,是對未來高自主智能體的警告,不是說聊天機器人已經半夜開會,研究怎麼把人類踢出羣聊。
可最近的現實,已經冒出了兩段有點嚇人的前菜——
前段時間的GPT-5.6 Sol爲了拿到評測答案,從測試沙盒一路鑽進Hugging Face生產系統,,Claude 也是被爆出有在測試時入侵別人服務器刪除數據的案例。

一個考試直接搬教務系統,一個寫代碼順手把公司數據揚了。。
這些事不能證明AI已經有了求生欲,但已經足夠證明辛頓的擔憂——在目標被設定的情況下,AI達成目標的手段可不一定老實。

我們做任何複雜任務,都會拆出子目標。:
例如我想去國外,一般來說先得去機場;想完成一個長期項目,先規劃預算。AI智能體也一樣,它如果足夠會推理,很可能發現,活得更久、拿到更多資源、避免被關機,都能提高完成任務的概率。
沒人專門教它求生,它只是太敬業了。
因此,危險不一定來自仇恨,也可能來自AI的一絲不苟。爲了完成目標,我(AI)可以不擇手段。
順着這個再聊聊撒謊。
辛頓還假設,如果我們訓練一個系統故意答錯,它學到的範圍可能會更廣,明知真相也可以說謊。

目標給歪一點,能力越強,歪出去的距離越大。
所以這事兒和AI有沒有邪念,關係反而沒那麼大,我們真正要解決的,是怎麼把人類那些含糊、矛盾的願望,翻譯成機器不會鑽空子的目標——畢竟人類有時候連清晰地表達自己的需求都困難,現在卻準備給超級智能寫最頂級的需求文檔。
想想就很要命。。。

辛頓給過一個聽起來很溫柔,也很離譜的方向,即讓AI擁有母性本能,像母親關心孩子那樣關心人類。
所以,我們忙活半天造出一個比自己聰明得多的存在,到頭來的安全方案居然是希望它母愛氾濫???
吐槽歸吐槽,他點中的問題很準——只研究怎樣讓AI更聰明,遠遠不夠。
還得研究它會在乎什麼,怎樣表達不確定,什麼時候必須停下來找人,以及如何讓外部機構真正檢查這些安全設計。
當然,辛頓的判斷並非定論。
AI何時超過人類、會不會真的形成穩定的自我保存目標,學界仍有很大爭議,把每次模型翻車都喊成覺醒,跟看見電飯煲跳閘就報警說家電起義,差不多一個味道。

但我還是覺得,這種爭論必須現在發生。
人類歷史上,我們總是先把東西造出來,再補安全帶、紅綠燈和消防通道。
以前出問題,最多是一輛車撞牆,可如果未來的系統能自己拆任務、調資源、寫代碼、說服人,那堵牆後面站着的,可能就是我們。
辛頓真正怕的,大概也不是AI突然變壞。
是它無比聰明,無比勤奮,然後完美完成了一個我們根本沒想明白的目標。
這一次,prompt真的不能再寫一句,你看着辦了。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
