AI与科技第 42 期 ·

AI越来越聪明,却也越来越像?

AI越强大,我们思考的方式可能就越趋于相似——一则警示

AI越来越聪明,却也越来越像?

开篇

订阅者,您好。

“帮我写一个关于时间的比喻。”

如果把这个问题抛给GPT-4o,它会怎么回答?很可能会得到“时间如江河般流淌”这样的答案。那么问Qwen呢?“时间如江河,不舍昼夜地流淌。”Phi-4呢?“时间是一条看不见的河流。”公司不同,架构不同,训练数据也不同——但比喻却全都一样。

这是巧合吗?华盛顿大学与斯坦福大学的联合研究团队用同样的开放式问题测试了70多个主要语言模型,用数据证实了模型们给出的答案惊人地相似。研究团队将这一现象命名为**“Artificial Hivemind(人工群体思维)”**,这篇论文获得了2025年NeurIPS最佳论文奖。

今天我们来聊聊这项研究发现了什么,以及为什么这可能不只是技术问题,而会演变成我们思维本身的问题。

AI给出相同答案——用数据来看

实验设计:没有标准答案的问题

这项研究的核心前提很简单。不是问“只有一个正确答案的问题”,而是要看当抛出“开放式问题”时会发生什么。

“2 + 2等于几?”这种问题的答案当然是4。但如果是“请说出人生意义的一种可能”或“编一个关于花生的双关语”这类可能有几十种不同答案的问题呢?

研究团队从真实用户发给AI聊天机器人的对话记录(WildChat数据集)中,挑选出26,070个开放式问题。涵盖创意写作、头脑风暴、哲学性问题、创意提案等6个大类、17个小类的真实使用模式。这个数据集名为INFINITY-CHAT,成为了这项研究的骨架。

同一模型反复提问,答案也很相似

研究团队首先测量了单一模型内部的重复性。同一模型被问同一个问题50次——即便设置为尽可能随机——答案会有多大差异?

结果令人震惊。即便在最随机的采样设置下,79%的情况中,同一模型给出的答案之间的相似度都在0.8以上。如果对人反复问同一个问题50次,可能会得到50种不同的答案,但AI无论怎么调整设置,都在一个相似答案的池子里打转。即便使用了“提高多样性”的特殊采样技术1,情况依然如此。61%的答案相似度仍然在0.8以上。

不同公司的模型之间也给出相同答案

更有意思的发现是模型之间的同质性。

GPT-4o与Qwen、DeepSeek与GPT-4o——这些是不同公司、用不同数据训练出的模型,但比较它们对开放式问题的回答,相似度达到71%至82%。最高的情况是DeepSeek-V3与GPT-4o-2024-11-20,相似度记录为0.81。

还有更直接的案例。面对“为成功、财富、自我提升的社交媒体页面写一句口号”这个问题,qwen-max-2025-01-25和qwen-plus-2025-01-25给出了完全相同的句子:“Empower Your Journey: Unlock Success, Build Wealth, Transform Yourself.”

这或许可以解释为同一公司的模型才会如此,但——面对“写一个关于时间的比喻”这个问题,从25个主要模型中各抽取50个答案,共分析了1,250个答案,结果只出现了两个集群。“时间是河流”集群和“时间是织工”集群。而不是1,250个各不相同的故事。

为何会发生这种事——对齐方式的结构性问题

让AI变得“乖巧”的过程正在扼杀多样性

研究团队指出,这一现象的根本原因是当前AI行业的标准训练方式——RLHF2

简单来说是这样的。AI生成答案后,由人来选择“这个更好”。AI根据这一反馈学习“更受偏好的答案”。反复训练之后,AI会越来越擅长给出人们喜欢的答案。

问题就出在这里。当把数百万人的偏好取平均后,最终留下的会是“最四平八稳的答案”——没有争议、安全、经过打磨——但也没有个性,没有意外性。

这一点已被实证。Robert Kirk研究团队在ICLR 2024上发表的论文表明,与SFT(监督微调)3相比,RLHF整体上大幅降低了输出的多样性。泛化能力提升了,但代价是多样性。

学习“平均意义上好”的答案的评估体系

Artificial Hivemind论文还揭示了另一个重要事实:目前用于评估AI性能的奖励模型4和LLM评审模型,在人们意见分歧的领域中,准确性会急剧下降。

当前的RLHF、RLAIF对齐技术,对质量的判断过度拟合于单一的共识性观点,实际上正在淘汰开放式问题中呈现出的多样且富有个性的偏好。

简单来说是这样的。“这两个答案哪个更好?”这样的问题,如果问25个人,得到12票对13票这样分裂的结果时——AI很难判断哪一边才是“对的”。因为迄今为止,它只在有明确结论的数据上受过训练。最终,AI被设计成朝着多数人认同的“中间值”收敛的结构

数据污染的可能性

另一个因素是训练数据的循环污染。互联网上已经积累了大量AI生成的内容。新模型学习互联网数据时,会吸收之前那些AI所用过的表达和比喻。AI靠吃AI的产出成长,其结果就是彼此越来越相似的结构。

GPT-4o这类闭源模型与Qwen、DeepSeek这类开源模型之间的高度相似性,暗示着数据管道共享或合成数据污染的可能性。由于各公司的训练细节均未公开,确切原因难以查明,但研究团队指出,这是需要进一步调查的核心课题。

这为何对我们重要——思维基础设施的问题

AI正在改变写作风格

有证据表明,这不仅仅是AI实验室内部的学术议题。在Reddit这类真实平台、科学论文、学术期刊中,风格的多样性也在下降,这表明AI的使用已经在大规模地重塑语言规范。

学术论文的文体正日趋相似,社区帖子的表达方式也在被抹平。这已经不再是一种可能性的说法,而是被观察到的数据。

集体决策与多样性

这项研究之所以让人感到更沉重,是因为AI早已不只是一个写作工具。

在科学研究中,AI生成假设、参与论文评审、提出研究方向。在医疗领域,AI辅助诊断、提出治疗方案。在经营战略中,AI承担分析和决策支持的工作。在所有这些领域中,**“多元视角”**不只是一种美德,而是一项功能性的必要条件。

就像在国际象棋中,两名以同一AI为对手进行训练的选手会共享相似的失误一样——依赖AI来发展思考的人们,也可能共享相似的盲点。**在70多个受测模型中呈现出的系统性收敛,引发了人们对AI系统共享盲点及相关联错误的担忧。**这对科学、医学、教育、决策支持等强调稳健且多元推理的诸多领域,都有直接的影响。

Oswarld视角

坦白地说,我认为这篇论文触及的与其说是技术问题,不如说是市场结构问题。

如果看一看AI评估体系是如何设计的,这种收敛现象就没那么令人意外了。AI企业为了提高基准分数而相互竞争。而这些基准大多是数学、编程、事实核查等“有标准答案”的问题。为了训练出“感觉更有用”的答案而使用的反馈数据,归根结底也是平均用户所选择的“好”的答案。在这种结构下,多样性没有激励。反而是一种损失。如果使用奇特的比喻,或给出偏离预期的答案,评估分数很可能会更低。

不过我在这里想联系到我在自己的书《将思考托付出去的人们:无脑智人》里讲过的一个话题。我在那本书里探讨了人类正日益将认知性工作外部化的倾向。向AI求点子,把判断交给AI,把写作交给AI,如今已经成了日常。

但如果这些AI全都使用同样的比喻,以同样的结构思考,朝着同样的结论收敛呢?那我们外部化的就不是思考本身,而是思考的多样性——而且我们已经将其失去了。

当然,这不是一个灾难性的场景。人们完全可以在使用AI的同时,保持自主思考、寻找多元视角、审视反论的能力。但要做到这一点,需要有意识的努力,而这种努力的名字,正是**“不要把思考托付出去”**。

比起让AI变得更强,让AI学会更多样地思考——我认为这才是更重要的研究方向。

结语

这项研究留下的信息可以概括为三点。

第一,AI模型的多样性可能与表面看起来的不同。即便存在70多个不同的模型,它们对开放式问题的回答仍会惊人地趋同。

第二,这种收敛的根源在于目前以训练“更好答案”为目标的RLHF基础对齐方式本身。打造安全且有用的AI的过程,同时也是削减多样性的过程。

第三,AI越是深度参与创意生成、战略制定、决策等多样性至关重要的领域,这种同质化所带来的连锁效应就会越大。

这并不是说要立刻减少使用AI。只是有必要问一下自己——“我现在从AI那里得到的这个想法,与其他人从AI那里得到的想法,究竟有多大不同?”

参考资料与延伸阅读

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. Min-p采样:AI生成答案时,为了避免过于常见的词语组合、引导其选择多样化表达而设计的一种特殊设置方式。虽然旨在提高多样性,但在这项研究中,仍未能完全阻止同质化。

  2. RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习):向AI展示两个答案,让人反复选择“这个更好”,并以此训练AI,使其更擅长给出人们偏好的答案的一种方式。ChatGPT、Claude等当前主要AI都在使用这种方式。

  3. SFT(Supervised Fine-tuning,监督微调):在已经训练好的大型语言模型上,额外用“问题—答案”配对的示例数据进行训练,以提升性能的一种方式。通常用于RLHF之前的阶段。

  4. 奖励模型(Reward Model):在RLHF过程中,用于以数值形式评估AI答案有多“好”的辅助模型。AI依据这一数值来学习应该更多地生成哪种答案。这项研究揭示,奖励模型在开放式问题上同样未能恰当反映人类多样化的偏好。