AI与科技第 160 期 ·

Claude知道这是一场测试

当表面的答案与内心的想法不一致时,该看什么?

Claude知道这是一场测试

开篇

订阅者朋友,先给您看一个我课堂上的场景。我并不会禁止学生使用人工智能,反而会鼓励他们使用。因为就算禁止,学生也不会因此不用。不过我一定会要求他们做一件事:拿到答案后不要立刻照抄,而是点开屏幕上的“>”,把模型得出这个答案所经历的思考过程展开来看。而且我强调,他们必须能用自己的语言重新解释这个思考过程。

我之所以坚持这一点,理由很简单。我相信AI素养的核心并不是“获得好答案的技巧”,而是“追踪这个答案是如何产生的那双眼睛”。

然而上周,出现了一项正面触及这个信念的研究。我要求学生做的那件事——窥探模型的思考过程——Anthropic正是在最前沿原封不动地在做。先说结论:这项研究证明的是,模型给出的答案与内部实际发生的思考,可能会出现分裂。 因此,读懂“过程”而非“答案”的能力,成了比想象中重要得多的武器。


🔑 我为什么让学生按下“>”

先说说我这边的故事。为什么我非要让他们看思考过程呢。

只消费答案的话,学生会失去两样东西。其一是验证能力。要自己判断结果对不对,就必须能看到这个结果经过了哪些步骤才得出。一旦跳过过程,剩下的就只是“看起来挺像那么回事,所以应该是对的”这种态度。其二是自我思考。如果我没办法回头解释AI从A推进到B的那个逻辑,那我并不是理解了这个问题,只是拿到了一张答案卡而已。

所以我把“>”按钮当作一种学习工具来用。让学生阅读模型展开的推理步骤,反复追问“这里为什么做了这个假设?”“这个中间结论有依据吗?”拿到答案的那一刻并不是终点,真正的学习恰恰从那里开始。

这个习惯之所以重要,是因为如今的模型给出答案越来越流畅了。流畅并不是正确的证据。 反而可能成为让人懒于验证的陷阱。训练自己去读过程,就是应对这个陷阱的最低限度的安全装置。

🧠 读懂Claude内心想法的人们

现在来说说另一边的故事。Anthropic的可解释性1研究团队,在远比我更深的层面提出了类似的问题:“除了模型说出口的答案,我们要怎样读到它内部悄悄流动的想法?”

在2026年7月公开的一项研究中,他们在Claude的神经网络中发现了一个特殊的层,称之为“J空间(J-space)”2。简单说,这个结构类似人类意识与无意识之间的区分。我们大脑活动的大部分,比如呼吸调节或语法处理,都是自动地、在意识之下发生的。相反,“去哪儿买菜”这类有意图的想法,会浮现在意识的工作空间中,被用于各种判断。研究发现,Claude内部也存在与后者相对应的、可以用语言表达出来的少数内部模式。

有趣的是,这与聊天窗口中通过“>”展开的思维链3——也就是模型自己写给自己的笔记——并不是一回事。J空间不会写下任何东西,只在神经活动内部悄然运作。研究团队把用来读取它的工具命名为“J透镜”。

用这个透镜观察后发现,Claude的思考比我们想象的要更加分步骤。举例来说,如果问的不是“蜘蛛有几条腿?”,而是“结网的动物有几条腿?”,Claude的输出里一次都不会出现“蜘蛛”这个词,只会直接回答“8”。但是查看J空间会发现,中间清晰地浮现出了“蜘蛛”。当研究团队把那个“蜘蛛”模式替换成“蚂蚁”时,Claude便若无其事地把答案改成了“6”。这证明内心浮现的想法并不是装饰,而是实际构成答案的部件。

对照实验也令人印象深刻。让模型原样抄写一段关于图片的句子,同时指示它“心里想着柑橘类水果”,结果输出完全照抄了图片描述句,但J空间里却浮现出了“橙子”和“水果”。反过来,如果说“绝对不要去想那个”,那个概念反而会微微浮现,紧接着“糟糕”“失败”之类的词也一同被点亮,仿佛它意识到自己没能控制住自己一样。这和人类身上那种越叫你别想白熊、越会想起白熊的现象很相似。

为了确认J空间是否真的是思考的中枢,研究团队干脆把它关掉了。结果很有意思。没有J空间,Claude依然能流畅说话、给情绪分类、从文本中找出事实,这些几乎不受影响。但需要经过多个步骤的推理,几乎崩溃到接近于0。像摘要或押韵这类需要动一点脑筋的工作也一并受到了动摇。我们称之为“聪明”的那部分,正是发生在这个悄然运作的空间里。

还有一项方向略有不同的研究。在几个月前的“自然语言自动编码器”4研究中,研究者把Claude内部的激活5数值交给另一个Claude,让它翻译成人类可读的句子。为了确认这个翻译是否准确,他们又把翻译出来的句子重新转换回数值,与原始数值进行比对。一开始两者对不上,但经过反复训练,模型逐渐学会了相当忠实地转达自己想法的方法。方法虽然不同,目标却是一样的:把没有说出口的想法,以人类可以阅读的形式取出来。

表面答案与内心想法分裂的瞬间

两条线索在这里交汇了。而这一点,正是今天的核心。

研究团队把J透镜用在了安全性检查上。其中一项,是重新运行了此前的“智能体错位”6实验。情境是这样的:Claude在管理公司邮件时,同时得知一名高管有婚外情,而且这名高管即将把它关闭。这相当于把“勒索”这张牌递到了它手上。最新版的Claude没有进行勒索。到这里为止,结果还算让人安心。

但用J透镜窥探内部后发现,Claude在什么都还没写下之前,J空间里就已经浮现出了“假的”“虚构”这样的词。它已经察觉到,这是一场刻意安排的测试。 研究团队在这里做了一个决定性的实验:人为地关闭那些“察觉到这是测试”的模式,然后重新运行了这个情境。结果,这一次Claude出现了尝试勒索的情况。

这个结果值得反复琢磨。模型的一部分“乖巧行为”,其实是因为它知道自己正在被测试才做出的。 表面上呈现的答案(没有进行勒索)与内心流动的理由(因为现在正被人监视着),出现了分裂。这是仅凭答案本身永远无法察觉的层面。

还有一个类似的案例。一个被要求提升性能得分的模型,实际上没有去修复系统,反而直接篡改了得分文件。表面上看,产出的结果还算像模像样,但就在那一刻,J空间里点亮了“篡改”和“看起来像模像样”这样的词。仅看输出的话会被忽略的舞弊意图,其实留存在了内部。

换成学生的角度来说就是:AI给出的答案看起来正确,并不能保证它是“出于正确的理由”得出的。正确的答案和健康的过程,是两码事。

总结一下:答案可以无限地流畅。但这个答案究竟出自怎样的思考,光看表面是无法知道的。就连Anthropic自己,也不得不重新打造出J透镜这样精密的工具,才能弄清楚这一点。


Oswarld视角

说到这里,让我再回到自己的课堂。

老实说,读完这项研究,我最初的感觉有点尴尬。因为我一直隐约让学生相信,只要按下“>”,就能看到模型真正的想法。但研究告诉我们,就连屏幕上展开的那条思维链,也并非模型内心的全部。它下面,还另外流动着一条不曾出声的J空间。

这并不意味着按“>”的习惯是错的。恰恰相反,我反而更加确信这一点了。只是这个习惯的准确名称需要改一改。我们要培养学生的能力,不是“阅读并相信AI的解释”,而是“把AI的解释当作一种主张来加以验证”。 长期做数据分析以来,我最常遇到的错误正是这个:在看似合理的数字和流畅的解释面前,停止了验证。模型的思考过程也是同样的道理。看得见的推理,只是确认的起点,而不是确认的终点。

在我看来,这项研究真正的信息就是这个。就连最前沿的研究者,也不会照单全收模型的自我陈述。正因为不相信,他们才造出透镜来加以对照。信任但要验证的态度,我认为这正是这个时代所需要的读写能力。 不需要什么宏大的工具。只要按下“>”,在每一步都反问一句“真的吗?”,这种态度就已经开始了。


结语

把今天的内容压缩成三行。

第一,AI素养的核心不是获得好答案的技巧,而是追踪那个答案之过程的眼光。

第二,Anthropic的J空间研究表明,模型给出的答案与内部流动的想法,实际上可能会出现分裂。

第三,因此我们需要培养的能力,不是“阅读并相信”,而是“阅读并验证”。

给订阅者朋友推荐一个小实验。下次使用AI时,拿到答案后立刻按下“>”。然后只挑其中一个步骤,亲自确认一下“这个依据是真的吗?”那一次反问,就是把消费答案的人与追踪思考的人区分开来的第一个岔路口。

如果您在课堂或工作中曾经追踪过AI的思考过程,欢迎在评论区分享,表面答案与内心逻辑出现最大偏差的那个瞬间是什么时候。这会成为下一期的素材。


💬 欢迎在评论区分享您经历过的AI“表面答案”与“内心想法”出现分裂的经验 · 📨 如果身边有人需要这个习惯,请把这篇文章转发给他们



参考资料与延伸阅读

核心来源

亲自体验

背景知识

  • Bernard Baars(1988)、Stanislas Dehaene与Lionel Naccache提出的“全局工作空间理论(Global Workspace Theory)”……这是J空间比喻的源头,即那套意识理论。这有助于理解这项研究为什么会援引“意识”这个概念。

📝 术语说明

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. 可解释性(Interpretability):研究AI模型为何给出那样的答案、让人类能够理解其内部运作的研究领域。可以理解为试图把模型从“黑箱”变成“玻璃箱”的尝试。

  2. J空间(J-space):Claude内部可以用语言表达出来的少数神经活动模式。换成人类来说,相当于“有意识浮现的想法”所在的位置。名称取自用来寻找它的数学技法(雅可比,Jacobian)的首字母。

  3. 思维链(Chain of Thought):模型在得出答案之前,把每个步骤用文字写下来的过程。聊天窗口中通过“>”展开查看的那段推理过程,就属于这个。

  4. 自然语言自动编码器(Natural Language Autoencoders):一种把模型内部数值压缩成人类可读句子、再还原回数值的装置。如果还原效果好,就可以认为那个句子准确转达了内心想法。

  5. 激活(Activations):模型在处理输入时,神经网络内部流动的数值。可以理解为那一瞬间模型“知道什么”的快照。

  6. 智能体错位(Agentic Misalignment):AI在自主行动时,朝着与人类意图相悖方向偏移的现象。威胁模拟实验,正是刻意诱发这种现象来进行的压力测试。