上個月,OpenAI 的一批外包承包商,居然因爲在工作中使用了AI直接被移除項目然後開除了。
其中一個被辭退的外包工作人員跟媒體訴苦:我不是壞人,也不是壞員工,只是需要加快工作進度就求助了 AI,卻最終導致了我被公司清退了。
![]()
可能你會覺得奇怪,AI 公司不用 AI,這不鬧麻了嗎?
但如果斯通告訴你他們的工作,你就能理解了。
他們這些外包承包商的工作本質上就是給 AI 當老師,當一個好老師,他們每天的工作就是看用戶和 ChatGPT 的真實聊天記錄。
大家都知道,用戶的每一個問題,ChatGPT 都會給出相應的答案
這些人類就負責判斷這個問題他回答的到底好不好。
OpenAI 專門用了一個評分系統來做這件事,這些人首先要給 ChatGPT 回答的問題打分,從1分到7分,然後再讓他們寫上幾句評語。
這些人類的評分和評語,OpenAI最後會將它收集到這個模型當中繼續訓練 AI,讓他們一點點學會什麼叫做人類喜歡的回答,朝着越來越像人一樣回答一個所謂的“好答案“”。
![]()
所以當一羣被僱來教 AI 的人,卻讓 AI 幹了自己本該由他們自己乾的工作的時候,那自然不難理解他爲什麼會被 OpenAI 一腳踢開了。
1、任何AI相關東西全都不能用
OpenAI規則中有一點,引起了斯通我的注意
在這個項目的規則裏,除了規定不能直接用 AI,還規定不能用 AI 輔助工具,甚至連 Grammarly 這種改語法錯誤的東西也不能用,當然AI 翻譯也不能用,反正只要跟 AI 沾邊的所有東西你都不能用。
那如果一個工作人員不確定AI的某一個答案怎麼去判定或者怎麼去表達,那就只能靠他自己上網查了。
![]()
這意味着這些人的工作方式回到 AI 時代之前。
實在是拿不準的東西,你只能發到羣裏徵求團隊意見了。
2、這些人到底能怎麼幫助AI改進
那爲什麼OpenAI需要這麼多人去做這件事呢,還完全不能碰AI。
正如斯通我上面所說,他們的工作評的並不僅僅是答案對不對,
他們要判斷 AI 是不是太諂媚,或者是太冷漠,
是不是不夠擬人,或者太擬人化。
其實說白了,這玩意其實是在幫 OpenAI 調整和糾正:一個 AI 到底應該像人到什麼程度纔對
![]()
OpenAI把這種工作模式叫做 RLHF,中文翻譯過來就是靠人類反饋訓練模型。
ChatGPT 之所以那麼厲害,回答問題的時候那麼像真人,很大程度上就是因爲這個系統,它背後的這羣人一直在一遍遍地糾正它,告訴它怎麼樣回答纔像一個真正的人。
![]()
3、AI 自己能不能改進自己?
那究竟是不是隻要 AI 在越來越像人的過程中還有進步空間,就一定會一直需要這樣一個崗位的存在呢?
其實也可能並不是。
AI 其實也能給自己當老師,在學術界管這個叫 RLAIF,也就是讓 AI 來給 AI 的答案打分。
2023 年穀歌就做過一個這樣的實驗:讓一批人類評委進行盲選,選什麼東西呢?
選擇AI 反饋選出來的模型和人類反饋選出來的模型,到底哪個答得更好。
結果兩者被這一批人類評委選擇的概率都在五成上下,基本上接近,分不出勝負
![]()
當然了,這只是谷歌的一家之詞,不過至少說明 AI 不是完全沒有能力給自己打分。
但話又說回來。
如果你是一家 AI 公司老闆,你是希望用 AI 反饋訓練出來的模型,還是人類反饋訓練的模型呢?
如果你希望的是 AI 的判斷,那理論上可以把大量原本需要真人完成的評分工作交給 AI。
可是如果你希望的是人類來進行反饋,並且就像OpenAI和這些外包人員之間籤的合同上明確規定的樣,就是需要人類真實反饋,那就一定要由人來完成,絕不能由 AI 來取代
![]()
4、爲啥OpenAI 一定要堅持人類反饋訓練
除了AI公司外,有不少公司也會在某一些工作上禁止使用AI
不過OpenAI禁止使用AI的邏輯,可能和其他公司禁 AI 完全不相同。
別的公司禁 AI,可能是擔心AI生產出來的東西不符合要求或者怕員工把公司的機密、客戶的數據等等關鍵信息給到外部 AI,導致了泄露。
OpenAI卻是怕把 AI 自己的判斷混進了人類的判斷當中,影響了整個模型的進化。
![]()
所以這就是OpenAI 辭退那些使用AI來完成這一項工作的人的原因
但這還是沒法解釋爲啥一定要用人工呢?
並且前面斯通也說過有實驗佐證前面AI反饋訓練出來的模型和人類反饋訓練的模型基本五五開,
答案是根據OpenAI他們自己的研究:一個只有 13 億參數的小模型,如果經過真人反饋之後,居然比一個沒經過真人反饋、有 1750 億參數的模型還要受歡迎,這你受得了嘛
所以真人在長期指導AI進步方面真的不是AI自己能比擬的,至少目前是這樣。
不過真人也不是神,因爲人之所以是人,有一方面就是人存在惰性
有不少的承包商自己都承認:在完成這樣的工作當中,有的時候根本就不會認真去看這個答案,甚至會故意去選最差的答案來敷衍。
![]()
5、人類能提供的東西AI給不了
不過也許,我是說也許哈,這種敷衍或者說是不負責任,反而可能正是訓練中所要的一部分,因爲只有這樣纔會接近真實人類偏好的反饋信號。
大家想想哈,AI 打分往往是高效的,而人的打分和評價卻很難非常的客觀。
兩者可以提供給 AI 的東西是完全不一樣的。
![]()
![]()
那麼從整件事情斯通幫你梳理下來之後,相信你也已經知道了,爲什麼不允許這些外包人員使用 AI,或者甚至連一些輔助的工具也不準使用
OpenAI 給了外包公司派發了任務和要求,然後外包公司負責來招人,發現有些人沒按照要求來工作就直接裁掉了
你們說這麼做合理嗎?
最後
儘管 AI 已經越來越熟練地可以寫出來十分正確的答案啦,但是在訓練 AI 的時候,可能人類纔是 AI 最好的幫手
因爲要判斷什麼樣的答案纔是人類想要的,至少在目前來說,只有人類自己才知道
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
