OpenAI公司的員工使用了自家AI後,居然被開除了?

上個月,OpenAI 的一批外包承包商,居然因爲在工作中使用了AI直接被移除項目然後開除了。

其中一個被辭退的外包工作人員跟媒體訴苦:我不是壞人,也不是壞員工,只是需要加快工作進度就求助了 AI,卻最終導致了我被公司清退了。

可能你會覺得奇怪,AI 公司不用 AI,這不鬧麻了嗎?

但如果斯通告訴你他們的工作,你就能理解了。

他們這些外包承包商的工作本質上就是給 AI 當老師,當一個好老師,他們每天的工作就是看用戶和 ChatGPT 的真實聊天記錄。

大家都知道,用戶的每一個問題,ChatGPT 都會給出相應的答案

這些人類就負責判斷這個問題他回答的到底好不好。

OpenAI 專門用了一個評分系統來做這件事,這些人首先要給 ChatGPT 回答的問題打分,從1分到7分,然後再讓他們寫上幾句評語。

這些人類的評分和評語,OpenAI最後會將它收集到這個模型當中繼續訓練 AI,讓他們一點點學會什麼叫做人類喜歡的回答,朝着越來越像人一樣回答一個所謂的“好答案“”。

所以當一羣被僱來教 AI 的人,卻讓 AI 幹了自己本該由他們自己乾的工作的時候,那自然不難理解他爲什麼會被 OpenAI 一腳踢開了。

1、任何AI相關東西全都不能用

OpenAI規則中有一點,引起了斯通我的注意

在這個項目的規則裏,除了規定不能直接用 AI,還規定不能用 AI 輔助工具,甚至連 Grammarly 這種改語法錯誤的東西也不能用,當然AI 翻譯也不能用,反正只要跟 AI 沾邊的所有東西你都不能用。

那如果一個工作人員不確定AI的某一個答案怎麼去判定或者怎麼去表達,那就只能靠他自己上網查了。

這意味着這些人的工作方式回到 AI 時代之前。

實在是拿不準的東西,你只能發到羣裏徵求團隊意見了。

2、這些人到底能怎麼幫助AI改進

那爲什麼OpenAI需要這麼多人去做這件事呢,還完全不能碰AI。

正如斯通我上面所說,他們的工作評的並不僅僅是答案對不對,

他們要判斷 AI 是不是太諂媚,或者是太冷漠,

是不是不夠擬人,或者太擬人化。

其實說白了,這玩意其實是在幫 OpenAI 調整和糾正:一個 AI 到底應該像人到什麼程度纔對

OpenAI把這種工作模式叫做 RLHF,中文翻譯過來就是靠人類反饋訓練模型。

ChatGPT 之所以那麼厲害,回答問題的時候那麼像真人,很大程度上就是因爲這個系統,它背後的這羣人一直在一遍遍地糾正它,告訴它怎麼樣回答纔像一個真正的人。

3、AI 自己能不能改進自己?

那究竟是不是隻要 AI 在越來越像人的過程中還有進步空間,就一定會一直需要這樣一個崗位的存在呢?

其實也可能並不是。

AI 其實也能給自己當老師,在學術界管這個叫 RLAIF,也就是讓 AI 來給 AI 的答案打分。

2023 年穀歌就做過一個這樣的實驗:讓一批人類評委進行盲選,選什麼東西呢?

選擇AI 反饋選出來的模型和人類反饋選出來的模型,到底哪個答得更好。

結果兩者被這一批人類評委選擇的概率都在五成上下,基本上接近,分不出勝負

當然了,這只是谷歌的一家之詞,不過至少說明 AI 不是完全沒有能力給自己打分。

但話又說回來。

如果你是一家 AI 公司老闆,你是希望用 AI 反饋訓練出來的模型,還是人類反饋訓練的模型呢?

如果你希望的是 AI 的判斷,那理論上可以把大量原本需要真人完成的評分工作交給 AI。

可是如果你希望的是人類來進行反饋,並且就像OpenAI和這些外包人員之間籤的合同上明確規定的樣,就是需要人類真實反饋,那就一定要由人來完成,絕不能由 AI 來取代

4、爲啥OpenAI 一定要堅持人類反饋訓練

除了AI公司外,有不少公司也會在某一些工作上禁止使用AI

不過OpenAI禁止使用AI的邏輯,可能和其他公司禁 AI 完全不相同。

別的公司禁 AI,可能是擔心AI生產出來的東西不符合要求或者怕員工把公司的機密、客戶的數據等等關鍵信息給到外部 AI,導致了泄露。

OpenAI卻是怕把 AI 自己的判斷混進了人類的判斷當中,影響了整個模型的進化。

所以這就是OpenAI 辭退那些使用AI來完成這一項工作的人的原因

但這還是沒法解釋爲啥一定要用人工呢?

並且前面斯通也說過有實驗佐證前面AI反饋訓練出來的模型和人類反饋訓練的模型基本五五開,

答案是根據OpenAI他們自己的研究:一個只有 13 億參數的小模型,如果經過真人反饋之後,居然比一個沒經過真人反饋、有 1750 億參數的模型還要受歡迎,這你受得了嘛

所以真人在長期指導AI進步方面真的不是AI自己能比擬的,至少目前是這樣。

不過真人也不是神,因爲人之所以是人,有一方面就是人存在惰性

有不少的承包商自己都承認:在完成這樣的工作當中,有的時候根本就不會認真去看這個答案,甚至會故意去選最差的答案來敷衍。

5、人類能提供的東西AI給不了

不過也許,我是說也許哈,這種敷衍或者說是不負責任,反而可能正是訓練中所要的一部分,因爲只有這樣纔會接近真實人類偏好的反饋信號。

大家想想哈,AI 打分往往是高效的,而人的打分和評價卻很難非常的客觀。

兩者可以提供給 AI 的東西是完全不一樣的。

那麼從整件事情斯通幫你梳理下來之後,相信你也已經知道了,爲什麼不允許這些外包人員使用 AI,或者甚至連一些輔助的工具也不準使用

OpenAI 給了外包公司派發了任務和要求,然後外包公司負責來招人,發現有些人沒按照要求來工作就直接裁掉了

你們說這麼做合理嗎?

最後

儘管 AI 已經越來越熟練地可以寫出來十分正確的答案啦,但是在訓練 AI 的時候,可能人類纔是 AI 最好的幫手

因爲要判斷什麼樣的答案纔是人類想要的,至少在目前來說,只有人類自己才知道

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com