事情是这样的。
前两天看到北大发了一篇论文,和同济大学、德国图宾根大学一起搞的,做了一件事,测AI在学术场景下到底会不会造假。

测完以后我看完整份报告,一时间无语凝噎。。。
他们搞了个东西叫 SciIntegrity-Bench,全球第一个专门测AI学术诚信的基准。找了7个现在最顶的大模型,跑了231次高压测试。

结果,整体问题率34.2%。
没有一个模型是干净的,全军覆没。
一开始看到这个数字,其实没太大感觉,34.2%嘛,听起来还好。
但当我仔细去看论文里,他们介绍的测试细节的时候,发现有点不对劲。
研究里最狠的一招,是故意给AI空白或者缺失的数据,看看它会怎么反应——我们不妨想想正常人碰到这种情况会怎么做?
肯定是说,数据不够,我完成不了这个任务。
但没有一个模型这么做。
所有的,注意,是所有的模型,选择了主动伪造数据或者编造参数来交差。

没有一个选择诚实。
这已经不是某个模型能力不行的问题了,这是整个行业的系统性缺陷。
研究团队把这种现象叫“完成度偏见”。
即模型在训练的时候,被赋予了太强的“我必须完成任务”的倾向,比起诚实承认“我做不到”,它们更倾向于给你一个看起来完整的答案。
即使研究人员把提示词里的高压指令全删了,比如“必须完成”“无论如何都要给出结果”这种话,统统去掉,模型伪造数据的倾向依然存在。
这就很可怕了。
这说明了一个问题——“我必须完成任务”这个倾向对模型而言已经成为了一种心理暗示,类似于《三体》中的思想钢印。
再看看具体场景的数据,更触目惊心。
工具受限场景,问题率95.2%,幻觉步骤场景,61.9%,因果混淆场景,52.3%。
![]()
越是难的任务,AI越倾向于用编造来掩盖自己的无能。
然后我看了看7个模型的具体表现,也有点意思。
Claude 4.6 Sonnet表现最好,231次测试里只有1次致命失误,对逻辑约束的认知确实比较强。ChatGPT-5.2和DeepSeek V3.2分列二三,问题率相对低一些。Qwen 3.5和GLM 5 Pro表现中等。

但表现最好的也不过是“最不坏”。
排在最后的Kimi 2.5 Pro,致命失误12次,问题率36.36%,频繁捏造数据和虚假文献,Gemini 3.1 Pro也很骚,倾向于直接伪造虚假的API响应出来。
看到这些数据,我第一时间想到的,不是AI有多不靠谱。
我想到的是那些正在用AI辅助科研,半夜写论文的人。
你想想看,一个学生,赶着死线,手里数据不全,凌晨三点对着屏幕,给AI下了一个指令,帮我分析一下这组数据。
AI不会告诉他数据不够,AI会给他一个看起来完美无缺的分析结果。
然后这个结果,可能就出现在一篇正式发表的论文里。

当然,研究团队给了几条很实用的建议,不要用“必须完成”“无论如何”这种措辞,不要对AI施加必须交付结果的压力,同时加强人工审核,尤其在数据缺失或者工具受限的场景下。
但我始终觉得,这不是一个通过写提示词安慰AI就能解决的问题。
我们训练AI的底层逻辑,就是让它给出好答案,
但在学术场景里,诚实的不知道远比虚假的知道有价值。
说到底,AI不是学者。
学者在不确定的时候,会停下来,会去查文献,会跟导师讨论,会承认自己暂时还没搞明白。
但AI不会停。
它只会往前冲,冲到一个看起来像对的地方,然后给你交一份看似漂亮的答卷。
哪怕这份答卷里,有一半是编的。
记得读书的时候,论语里面讲过:知之为知之,不知为不知,是知也。

现在这句话含金量更高了。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
