上个月,OpenAI 的一批外包承包商,居然因为在工作中使用了AI直接被移除项目然后开除了。
其中一个被辞退的外包工作人员跟媒体诉苦:我不是坏人,也不是坏员工,只是需要加快工作进度就求助了 AI,却最终导致了我被公司清退了。
![]()
可能你会觉得奇怪,AI 公司不用 AI,这不闹麻了吗?
但如果斯通告诉你他们的工作,你就能理解了。
他们这些外包承包商的工作本质上就是给 AI 当老师,当一个好老师,他们每天的工作就是看用户和 ChatGPT 的真实聊天记录。
大家都知道,用户的每一个问题,ChatGPT 都会给出相应的答案
这些人类就负责判断这个问题他回答的到底好不好。
OpenAI 专门用了一个评分系统来做这件事,这些人首先要给 ChatGPT 回答的问题打分,从1分到7分,然后再让他们写上几句评语。
这些人类的评分和评语,OpenAI最后会将它收集到这个模型当中继续训练 AI,让他们一点点学会什么叫做人类喜欢的回答,朝着越来越像人一样回答一个所谓的“好答案“”。
![]()
所以当一群被雇来教 AI 的人,却让 AI 干了自己本该由他们自己干的工作的时候,那自然不难理解他为什么会被 OpenAI 一脚踢开了。
1、任何AI相关东西全都不能用
OpenAI规则中有一点,引起了斯通我的注意
在这个项目的规则里,除了规定不能直接用 AI,还规定不能用 AI 辅助工具,甚至连 Grammarly 这种改语法错误的东西也不能用,当然AI 翻译也不能用,反正只要跟 AI 沾边的所有东西你都不能用。
那如果一个工作人员不确定AI的某一个答案怎么去判定或者怎么去表达,那就只能靠他自己上网查了。
![]()
这意味着这些人的工作方式回到 AI 时代之前。
实在是拿不准的东西,你只能发到群里征求团队意见了。
2、这些人到底能怎么帮助AI改进
那为什么OpenAI需要这么多人去做这件事呢,还完全不能碰AI。
正如斯通我上面所说,他们的工作评的并不仅仅是答案对不对,
他们要判断 AI 是不是太谄媚,或者是太冷漠,
是不是不够拟人,或者太拟人化。
其实说白了,这玩意其实是在帮 OpenAI 调整和纠正:一个 AI 到底应该像人到什么程度才对
![]()
OpenAI把这种工作模式叫做 RLHF,中文翻译过来就是靠人类反馈训练模型。
ChatGPT 之所以那么厉害,回答问题的时候那么像真人,很大程度上就是因为这个系统,它背后的这群人一直在一遍遍地纠正它,告诉它怎么样回答才像一个真正的人。
![]()
3、AI 自己能不能改进自己?
那究竟是不是只要 AI 在越来越像人的过程中还有进步空间,就一定会一直需要这样一个岗位的存在呢?
其实也可能并不是。
AI 其实也能给自己当老师,在学术界管这个叫 RLAIF,也就是让 AI 来给 AI 的答案打分。
2023 年谷歌就做过一个这样的实验:让一批人类评委进行盲选,选什么东西呢?
选择AI 反馈选出来的模型和人类反馈选出来的模型,到底哪个答得更好。
结果两者被这一批人类评委选择的概率都在五成上下,基本上接近,分不出胜负
![]()
当然了,这只是谷歌的一家之词,不过至少说明 AI 不是完全没有能力给自己打分。
但话又说回来。
如果你是一家 AI 公司老板,你是希望用 AI 反馈训练出来的模型,还是人类反馈训练的模型呢?
如果你希望的是 AI 的判断,那理论上可以把大量原本需要真人完成的评分工作交给 AI。
可是如果你希望的是人类来进行反馈,并且就像OpenAI和这些外包人员之间签的合同上明确规定的样,就是需要人类真实反馈,那就一定要由人来完成,绝不能由 AI 来取代
![]()
4、为啥OpenAI 一定要坚持人类反馈训练
除了AI公司外,有不少公司也会在某一些工作上禁止使用AI
不过OpenAI禁止使用AI的逻辑,可能和其他公司禁 AI 完全不相同。
别的公司禁 AI,可能是担心AI生产出来的东西不符合要求或者怕员工把公司的机密、客户的数据等等关键信息给到外部 AI,导致了泄露。
OpenAI却是怕把 AI 自己的判断混进了人类的判断当中,影响了整个模型的进化。
![]()
所以这就是OpenAI 辞退那些使用AI来完成这一项工作的人的原因
但这还是没法解释为啥一定要用人工呢?
并且前面斯通也说过有实验佐证前面AI反馈训练出来的模型和人类反馈训练的模型基本五五开,
答案是根据OpenAI他们自己的研究:一个只有 13 亿参数的小模型,如果经过真人反馈之后,居然比一个没经过真人反馈、有 1750 亿参数的模型还要受欢迎,这你受得了嘛
所以真人在长期指导AI进步方面真的不是AI自己能比拟的,至少目前是这样。
不过真人也不是神,因为人之所以是人,有一方面就是人存在惰性
有不少的承包商自己都承认:在完成这样的工作当中,有的时候根本就不会认真去看这个答案,甚至会故意去选最差的答案来敷衍。
![]()
5、人类能提供的东西AI给不了
不过也许,我是说也许哈,这种敷衍或者说是不负责任,反而可能正是训练中所要的一部分,因为只有这样才会接近真实人类偏好的反馈信号。
大家想想哈,AI 打分往往是高效的,而人的打分和评价却很难非常的客观。
两者可以提供给 AI 的东西是完全不一样的。
![]()
![]()
那么从整件事情斯通帮你梳理下来之后,相信你也已经知道了,为什么不允许这些外包人员使用 AI,或者甚至连一些辅助的工具也不准使用
OpenAI 给了外包公司派发了任务和要求,然后外包公司负责来招人,发现有些人没按照要求来工作就直接裁掉了
你们说这么做合理吗?
最后
尽管 AI 已经越来越熟练地可以写出来十分正确的答案啦,但是在训练 AI 的时候,可能人类才是 AI 最好的帮手
因为要判断什么样的答案才是人类想要的,至少在目前来说,只有人类自己才知道
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
