在图灵测试中机械飞升,是能工智人们的至高荣耀

文/嘿耗

在浏览这篇文章前,请先确认你是真人。

图片

不论是谷歌还是暴雪,企鹅抑或是Steam,在它们的登陆页面上高频率出现的人机验证,将永远是阻挡人类触及美妙互联网的顽冥绊脚石——你可以因为网络问题看见它,你可以因为异地登陆看见它,你可以毫无缘由地看见它。

现在它看见你了。

图片

这听起来就像是一种更加贴近现实的规则怪谈,不过人机验证与那些VHS模拟恐怖的区别在于,你是真的需要亲自去做这些令人头皮发麻的题目证明自己是个人类,而非发挥自己的想象力,去帮一些故事背景创作能力明显不足的谜语人,补足他们原本设想的无比贫瘠的,如同魂系谜语人叙事一般的世界观。

在这种另类的身份认同上,当然没有人类乐意被网站当成机器人导致被拒之门外,可是,机器人也不乐意被当成机器人。你有考虑过机器人的感受吗?没有,你只考虑你自己。

于是爬虫与脚本们学会了反验证,假装自己是个人类;

人机验证为了更精准的筛选人类,流程变得越来越复杂;

能工智人们则不得不重拾原本用来应付应试教育的各类知识,但最终多半还是会因为一个人机验证而陷入超绝自我身份怀疑哲学悖论中——我是否连机器人都不如?

你好,是的。

随着Chatgpt等LLM大模型如雨后春笋般脱出,人类们再也不需要另外一个个体来附和倾听自己的那些无趣观点,毕竟这些文本生成型AI,似乎要比那些生活在同一个世界,有着类似经历的人类,更能稳稳接住叙事者的情绪。

相比起能够将直截了当忠言逆耳的谏言包装成充满甜蜜与关怀建议的AI,人类队在面对他人创伤或遭遇时,不以取笑或落井下石为乐都已经成了十分难能可贵的优良品质,也难怪会有越来越多的人对AI产生感情。

在这场关乎食人树与人性弱电的比赛中,能工智人队真是输得酣畅淋漓,以至于现如今在网上冲浪时不仅要确认自己不是机器人,有时候甚至还要确认对方是不是个机器人。

就像是在做图灵测试。

你是人类吗?我觉得我是

1912年,出生于英国伦敦的艾伦·麦席森·图灵为人类留下了两大财富,一是1950年被提出的评估人工智能智能程度的经典方法“图灵测试”,二是为后世香香软软的计算机专业的小楠酿们提供了成为女装大佬的伪科学依据。

简单来说,图灵测试就像是你在国内的任何一个大企业平台上申请退款时,不得不品尝的一环——你需要在信息受限的窗口中,通过几条前言不搭后语的消息进行提问,根据对方的回答确认对方是否是真人,如果不是你则需要竭尽全力找到“转人工”的方法。

你大概还能逐步发掘出「退款」的真相,找回失散的付款记录,和他们一起提交给客服,在漫长的退款流程中邂逅性格各异、但目标一致的官方人员,这期间你将扮演一个被踢的皮球,中间忘了后边忘了总之你说得对。

就像打游戏全成就一般,转人工也要看攻略!

抛开那种几乎和人机验证一样令人厌烦的“转人工”流程不谈,图灵测试自诞生以来,在很长一段时间里,除了被一些探讨人与机器伦理关系的电影所引用,现实中其实很少真正进入公众视野——至少在ChatGPT等LLM大模型爆火之前是这样。

直到2023年5月,一家名为AI21的公司上线了一场以“图灵测试”为主题,为期一个月的社会实验“Human or not”

这场实验中,玩家将随机与真人或AI进行匹配,在两分钟内进行轮流式的开放式对话,并在其中一方离开对话或倒计时结束后判断对方是真人还是AI

在这一个月内,共有超过150万用户进行了逾1000万次对话,其中68%的对话中这些用户正确判断了对方的身份。

在测试结束后,AI21给出了一份长达11页的研究报告(好在这篇文章并不是关于这场社会实验的分析,因此你不用担心接下来要像毕业导师一般评点论文的全部内容)。在这份报告中,AI21提到人类判断对方是否是机器人时常用的策略包含以下几种:

  • 对方是否会有意或无意打错别字

  • 以令人不安的细节程度探讨对方个人生活

  • 使用极其低俗的攻击性语言/地狱笑话,根据对方反应进行判断

  • 元级别的提问,例如关于网站界面的UI视觉元素(毕竟机器人只能看到文本)

由于该实验语言被限制在英文,并且它也不大可能像国内的游戏发行那般,动辄找数十个游戏区实况创作者录一些电子榨菜进行宣传,因此这项社会实验当时在国内并没有掀起太多水花。

欸然后今年七月份国内就出现了图灵测试,哎呀你说这事整的这巧不巧玛雅大姐。

你是AI吗?我觉得你不是

在本土化语境下,国人判断对方身份的方式与早先的Human or Not可以说是大差不差,但也有一些延伸:

地狱笑话或者粗俗性的语言攻击仍然存在,但好在没了语言巴别塔的阻碍,现在你在游玩时能够更加方便的红温。

另外一种常见方式是将互联网常见梗作为“暗号”进行发送,以至于整场对话看起来更像是泛文化网民对电波的仪式,而非通过对方的语言习惯判断身份。

也有人选择了震耳欲聋的沉默,人类最后的默契是彼此的噤声。

能工智人队迄今为止的表现仍算亮眼,但LLM最擅长的就是模仿人类的语言并加以运用。

对于AI来说,常见的诸如“康神开播了”、“Ciallo”或是”灌注塔菲谢谢喵“的流行文化梗,它并不需要知道这些文字背后的含义或是缘由,只需要依葫芦画瓢复述即可。

而此前曾经容易让AI露馅的粗鲁辱骂与低俗语言,现已被证明这个方法有效与否仅仅取决于开发者是否允许AI学习源自人类口中,那些最纯粹,最野性的优美语言。

如果使用互联网泛文化梗无法证明我是人类,讲地狱笑话无法证明我是人类,使用国粹对互联网上的陌生人进行辱骂也无法证明我是人类,甚至于AI比我还要像人类的话,那我还是人类吗?

比起思考这种过于形而上学的哲学问题,一部分人选择了另辟蹊径的解法——一切战术转换家,既然AI比人类更像人,那我假装自己是AI不就行了?

这里没有AI了

如果说原本的图灵测试仅仅是用来判断评估人工智能的程度,那么在这场游戏中,“图灵测试”随着乐子人的不断加入引申出了新的含义。

现在的玩家不仅要与不断学习人类语料的AI斗智斗勇,更多时候还需要辨别那些假装自己是AI的能工智人,以至于整场测试更像是一场“反图灵测试”

在网站最开始上线时,人们模仿AI的行为包括:

  • 使用人们在正常语境中不会使用的说辞

  • 自顾自的玩梗或者讲述一个语境

  • 以“AI”的视角评价对方的发言

  • 用不正确的方式回复对方的玩梗

这或许也展示了参与图灵测试的人们是如何看待AI的——一个去人性化,我行我素,无法理解他人的复读机

但当AI吸收完最早的对话语料,开始能够稳稳接住这些互联网亚文化烂梗时,模仿AI的能工智人们顾左右而言他的行为看起来反倒太过做作

于是在原有基础上,模仿AI的行为又诞生了新的特征:

  • 用过于明显的AI语言(例如“服务器繁忙,请稍后再试”或是一些常见的404报错信息)进行元级别的身份自证

  • 直接复制粘贴与AI进行对话时的聊天记录

而对于那些比起伪装AI,对判断对方身份更感兴趣的人类来说,引入AI尚未了解的梗文化成了新的验证方式。

这就像是一个不断迭代进化的博弈论——从外表上来看,随着AI发言方式的迭代,人类的应对方式也在不断进行着更新,但这种递归式的变化势必要以其中一方的退场而宣告结束。

这里也没有人类了

在一部结局很烂的亚马逊美剧《上载新生》中,男主因为一场离奇的自动驾驶车祸而重伤倒地,在被其有钱到可疑的女友吹耳边风后,放弃了自己现实中的性命,进而将自己的意识上传到了近似“元宇宙”的意识空间中。然后接下来四季的剧情都是探讨一些现实中无法成立,因为科技树还没解锁到那的爱情伦理问题。

这个“图灵测试”中AI的成长方式,就像是来自五湖四海的互联网用户们,将庞大的泛娱乐语料源源不断的进行“上传”,最终得到一个“安能辨我是雌雄”的全能全知神,幸好AI不会拥有感性的人们称之为“灵魂”的,如同人类身份验证一般的东西。

从互联网上有关图灵测试的讨论来看,大家只是会翻来覆去的玩口水梗,对暗号,或是自顾自的讲一些地狱笑话——比起做图灵测试,更像是在发出寻找同类的呼唤。

看一眼现在这个网站的AI都学了些啥你就知道了。

以至于随着这个网站的运营,可能以后当两个彼此陌生的个体在此相遇,想要证明自己的人类身份时,需要的不再是一些寻找同类的暗号,而是需要挖掘出自身作为人类的缺陷与不完美之处,然后靠着这些丑陋的部分确认彼此的身份。

或是做个彻彻底底的乐子人😋~

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com