OpenAI公司的员工使用了自家AI后,居然被开除了?

上个月,OpenAI 的一批外包承包商,居然因为在工作中使用了AI直接被移除项目然后开除了。

其中一个被辞退的外包工作人员跟媒体诉苦:我不是坏人,也不是坏员工,只是需要加快工作进度就求助了 AI,却最终导致了我被公司清退了。

可能你会觉得奇怪,AI 公司不用 AI,这不闹麻了吗?

但如果斯通告诉你他们的工作,你就能理解了。

他们这些外包承包商的工作本质上就是给 AI 当老师,当一个好老师,他们每天的工作就是看用户和 ChatGPT 的真实聊天记录。

大家都知道,用户的每一个问题,ChatGPT 都会给出相应的答案

这些人类就负责判断这个问题他回答的到底好不好。

OpenAI 专门用了一个评分系统来做这件事,这些人首先要给 ChatGPT 回答的问题打分,从1分到7分,然后再让他们写上几句评语。

这些人类的评分和评语,OpenAI最后会将它收集到这个模型当中继续训练 AI,让他们一点点学会什么叫做人类喜欢的回答,朝着越来越像人一样回答一个所谓的“好答案“”。

所以当一群被雇来教 AI 的人,却让 AI 干了自己本该由他们自己干的工作的时候,那自然不难理解他为什么会被 OpenAI 一脚踢开了。

1、任何AI相关东西全都不能用

OpenAI规则中有一点,引起了斯通我的注意

在这个项目的规则里,除了规定不能直接用 AI,还规定不能用 AI 辅助工具,甚至连 Grammarly 这种改语法错误的东西也不能用,当然AI 翻译也不能用,反正只要跟 AI 沾边的所有东西你都不能用。

那如果一个工作人员不确定AI的某一个答案怎么去判定或者怎么去表达,那就只能靠他自己上网查了。

这意味着这些人的工作方式回到 AI 时代之前。

实在是拿不准的东西,你只能发到群里征求团队意见了。

2、这些人到底能怎么帮助AI改进

那为什么OpenAI需要这么多人去做这件事呢,还完全不能碰AI。

正如斯通我上面所说,他们的工作评的并不仅仅是答案对不对,

他们要判断 AI 是不是太谄媚,或者是太冷漠,

是不是不够拟人,或者太拟人化。

其实说白了,这玩意其实是在帮 OpenAI 调整和纠正:一个 AI 到底应该像人到什么程度才对

OpenAI把这种工作模式叫做 RLHF,中文翻译过来就是靠人类反馈训练模型。

ChatGPT 之所以那么厉害,回答问题的时候那么像真人,很大程度上就是因为这个系统,它背后的这群人一直在一遍遍地纠正它,告诉它怎么样回答才像一个真正的人。

3、AI 自己能不能改进自己?

那究竟是不是只要 AI 在越来越像人的过程中还有进步空间,就一定会一直需要这样一个岗位的存在呢?

其实也可能并不是。

AI 其实也能给自己当老师,在学术界管这个叫 RLAIF,也就是让 AI 来给 AI 的答案打分。

2023 年谷歌就做过一个这样的实验:让一批人类评委进行盲选,选什么东西呢?

选择AI 反馈选出来的模型和人类反馈选出来的模型,到底哪个答得更好。

结果两者被这一批人类评委选择的概率都在五成上下,基本上接近,分不出胜负

当然了,这只是谷歌的一家之词,不过至少说明 AI 不是完全没有能力给自己打分。

但话又说回来。

如果你是一家 AI 公司老板,你是希望用 AI 反馈训练出来的模型,还是人类反馈训练的模型呢?

如果你希望的是 AI 的判断,那理论上可以把大量原本需要真人完成的评分工作交给 AI。

可是如果你希望的是人类来进行反馈,并且就像OpenAI和这些外包人员之间签的合同上明确规定的样,就是需要人类真实反馈,那就一定要由人来完成,绝不能由 AI 来取代

4、为啥OpenAI 一定要坚持人类反馈训练

除了AI公司外,有不少公司也会在某一些工作上禁止使用AI

不过OpenAI禁止使用AI的逻辑,可能和其他公司禁 AI 完全不相同。

别的公司禁 AI,可能是担心AI生产出来的东西不符合要求或者怕员工把公司的机密、客户的数据等等关键信息给到外部 AI,导致了泄露。

OpenAI却是怕把 AI 自己的判断混进了人类的判断当中,影响了整个模型的进化。

所以这就是OpenAI 辞退那些使用AI来完成这一项工作的人的原因

但这还是没法解释为啥一定要用人工呢?

并且前面斯通也说过有实验佐证前面AI反馈训练出来的模型和人类反馈训练的模型基本五五开,

答案是根据OpenAI他们自己的研究:一个只有 13 亿参数的小模型,如果经过真人反馈之后,居然比一个没经过真人反馈、有 1750 亿参数的模型还要受欢迎,这你受得了嘛

所以真人在长期指导AI进步方面真的不是AI自己能比拟的,至少目前是这样。

不过真人也不是神,因为人之所以是人,有一方面就是人存在惰性

有不少的承包商自己都承认:在完成这样的工作当中,有的时候根本就不会认真去看这个答案,甚至会故意去选最差的答案来敷衍。

5、人类能提供的东西AI给不了

不过也许,我是说也许哈,这种敷衍或者说是不负责任,反而可能正是训练中所要的一部分,因为只有这样才会接近真实人类偏好的反馈信号。

大家想想哈,AI 打分往往是高效的,而人的打分和评价却很难非常的客观。

两者可以提供给 AI 的东西是完全不一样的。

那么从整件事情斯通帮你梳理下来之后,相信你也已经知道了,为什么不允许这些外包人员使用 AI,或者甚至连一些辅助的工具也不准使用

OpenAI 给了外包公司派发了任务和要求,然后外包公司负责来招人,发现有些人没按照要求来工作就直接裁掉了

你们说这么做合理吗?

最后

尽管 AI 已经越来越熟练地可以写出来十分正确的答案啦,但是在训练 AI 的时候,可能人类才是 AI 最好的帮手

因为要判断什么样的答案才是人类想要的,至少在目前来说,只有人类自己才知道

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com