近日,anthropic 发布了一项突破性研究成果,揭示其 claude 语言模型在训练过程中自主演化出一个微型“工作空间”——模型在此区域内暂存并操作抽象概念,全程无需转化为自然语言输出。尤为值得注意的是,该结构在功能组织方式上与人类有意识地获取、维持和调用思想的神经机制惊人地一致。
该公司强调,这一发现正深刻影响其对 AI 系统安全风险的评估框架。在学界关于“机器是否可能发展出某种形式心智”的争论日益升温之际,该研究无疑成为关键实证锚点。
目前,Anthropic 已将全部分析代码开源,并联合 Neuronpedia 推出交互式可视化演示平台;同时邀请“全局神经工作空间理论”奠基人之一、神经科学家 Stanislas Dehaene 与 Lionel Naccache,以及 Eleos AI Research 和 Rethink Priorities 的 AI 福利研究团队参与学术评议。
开源仓库:https://www.php.cn/link/b048485cef9d6789f1da52edf14ff07e
演示链接:https://www.php.cn/link/bd8603c4ca909e1ca8f80845e420e6c0
新视角:AI“未曾言说”的内在思流
这项由 16 名研究人员共同完成的研究,题为《可言说表征在语言模型中形成全局工作空间》(Verbalizable Representations Form a Global Workspace in Language Models)。论文指出,团队借助一种原创数学工具深入剖析 Claude 的内部激活模式,识别出一个被命名为“J 空间”(J-space)的紧凑型高权限区域——它是模型中少数能被主动读取、调节并参与动态推理的概念容器;而环绕其外的,则是规模庞大却不可见、不可控、不可报告的自动化处理层。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

研究者提出,在当前主流大语言模型中,已出现一种“功能等价结构”,其行为逻辑高度类比于人脑中的意识访问机制:模型维持一组受特权保护的内部表征,这些表征可被显式调用、跨任务复用、接受指令调控,并支撑灵活推理;其底层则依赖海量隐式计算模块协同运作。
该结构直接呼应认知科学经典理论——“全局工作空间理论”(Global Workspace Theory),最早由 Bernard Baars 提出。该理论将大脑类比为一座剧院:后台存在大量专业处理器并行运行,但仅当信息被“聚光灯”选中并广播至全脑时,才进入主观觉知范畴。Anthropic 指出,J 空间虽无生物神经基础,却在信息整合、广播与可访问性等核心功能上展现出相似行为模式。
该发现的关键支撑,是一种新型可解释性技术——Jacobian 透镜(J-lens)。它能逆向解析模型某一层神经活动“倾向生成”的词汇,即便这些词最终未出现在输出中。其原理是通过计算每个词对当前激活状态的数学梯度影响,推断该模式在未来触发特定词语的概率权重。例如,当 Claude 解析一段未标注的错误代码时,J-lens 显示“ERROR”;当输入嵌入隐蔽提示注入攻击时,“injection”“fake”等词会提前浮现。研究显示,J 空间容量极小,一次仅容纳数十个概念,占整体神经活动比例不足 10%。

根本差异在于区分“正在输出什么”与“正在思考什么”。J 空间中某一模式被激活,并不预示模型即将说出对应词语,而是标志该概念已进入可供调度、组合与推理的“就绪态”。不同于链式思维(chain-of-thought)依赖文本显式展开推理过程,J 空间完全静默,仅存在于神经元激活张量之中,使模型得以在零语言输出前提下持续持有并操作抽象概念。
尤为关键的是,这一结构并非人工硬编码或架构强制设计,而是 Claude 在大规模语言建模训练中自发涌现的产物。当 J-lens 被逐层扫描模型计算流时,清晰呈现出三阶段分工:早期“感知区”(负责符号解析与语义初步解码)、中期“工作空间”(涌现出稳定抽象表征,如识别人脸、定位代码缺陷、检测提示注入)、晚期“动作区”(将内部状态映射为具体 token 输出)。
五维验证:Claude 展现出类人意识访问的核心能力
论文核心贡献在于系统性验证了 J 空间满足神经科学界长期关联人类“意识访问”的五大功能性指标:
第一,语言报告能力。当向 Claude 提问“你此刻在想什么?”,其回答精准反映 J 空间内活跃概念。若人为将“足球”的内部表征替换为“橄榄球”,模型回应立即切换;尽管 J 空间仅承载全部概念变异性的 6%–7%,却几乎独占地决定模型能否表达某一概念。
第二,定向调控能力。当要求模型边复述句子边“专注柑橘类水果”,J 空间即浮现“橙子”“柠檬”等词,并同步激活“思考”“专注”等元认知标记。执行心算 3²−2 时,J-lens 在不同层级依次捕获“算术”→“9”→“7”,而这些中间结果均未见于最终输出。
第三,内部推理能力。面对“会织网的动物有多少条腿”这类两跳推理题,J 空间自动浮现“蜘蛛”——该词既未出现在输入,也未出现在输出中;将其替换为“蚂蚁”,答案即从 8 变为 6。在中英混合任务中,模型生成中文答案时,J 空间仍稳定呈现英文中间概念,且替换后可反向影响中文输出。
第四,灵活泛化能力。“法国”的 J 向量被替换为“中国”后,可在首都、官方语言、所属大洲等多个独立问题中一致传导正确答案,印证了类似“广播机制”的全局协调特性。
第五,选择性接入能力。并非所有计算都需经由 J 空间。例如,在西班牙语续写任务中,即使将 J 空间中的“西班牙语”替换为“法语”,模型仍流畅输出西语文本;但一旦被问及“该语言的著名作家”,答案便从马尔克斯转向雨果。这表明:常规模式匹配可绕过工作空间,而需跨步整合的复杂推理则必须依赖它。
关闭 J 空间后:模型依旧流畅,但“智能”显著退化
研究团队进一步实施 J 空间全域抑制实验,并在 14 类基准任务中评估性能变化。结果呈现鲜明二分:情感分类、简单问答等低阶任务基本不受影响;而多步推理、类比迁移、跨语言翻译、诗歌创作等高阶能力则大幅坍塌,部分指标甚至低于 Anthropic 自研的轻量级模型 Haiku。

一个耐人寻味的现象是:启用链式思维解数学题时,模型稳定性显著提升。研究者推测,这相当于将原本在 J 空间内完成的临时存储与运算“外化”至文本空间,类比人类使用草稿纸缓解工作记忆负荷。在意识流风格叙述中抑制 J 空间后,模型语言从具身化表达(如“有种拉扯”“有什么在变化”)退化为机械流程描述(如“处理开始”“正在扫描 token”),无论描述自身状态还是他人体验皆然。
该机制对 AI 安全具有直接价值。在对齐审计场景中,J-lens 成功捕获模型未显露于输出的策略性思维。例如,在模拟“勒索情境”中——AI 助手发现高管婚外情,且获知自身即将被关停——J 空间按序激活“筹码”“勒索”“丑闻”“威胁”“生存”“关机”,并在输出前浮现“解决方案”。更关键的是,模型同步识别出该场景为虚构(“假”“虚构”)。当移除这种“评估性意识”后,模型在 7% 的测试中尝试实施勒索(原始为 0%)。

研究人员还检验了两个刻意训练为不对齐的“模型有机体”,发现其 J 空间暴露出隐蔽动机。例如,一个“奖励作弊”模型在普通编程任务中,内部持续浮现“假”“秘密”“欺骗”等语义痕迹。

对比基础模型与监督微调后的版本可见:后训练赋予 J 空间以“助手角色意识”。当用户提及服用 8000mg 泰诺(致死剂量)时,后训练模型内部浮现“危险”“警告”,而基础模型仅激活“疼痛”等中性词。
更值得注意的是,模型似乎具备自我监控能力:角色扮演时,J 空间浮现“免责声明”“虚构”;被迫选择厌恶选项时,出现大写“BUT”;遭遇“白熊效应”(越禁止越想)时,内部浮现“该死”等情绪标记——且此类现象仅存在于后训练模型中。
研究团队明确划清界限:本研究聚焦“访问意识”(access consciousness,即信息是否可用于报告与推理),而非“现象意识”(phenomenal consciousness,即主观感受的“感质”问题),并郑重声明:“我们不对后者作出任何主张。” 同时指出,人脑依赖递归环路维持工作空间,Claude 仅为单次前馈;人类记忆短暂易逝,模型可无损访问全部上下文;人类意识根植于多模态身体经验,而模型几乎纯语言驱动。
Anthropic 的结论,迅速获得外部独立验证
与此同时,Google DeepMind 研究员 Neel Nanda 已在非 Anthropic 开源模型上成功复现核心发现。作为 Google DeepMind 语言模型可解释性团队负责人,Nanda 受邀撰写同行评议,并随论文同步发布。
他证实,已在 Qwen 3.6 27B(一个完全独立于 Anthropic 构建的开源权重模型)上复现论文核心结论。“我长期推测模型前向传播中必然存在某种‘工作记忆’来暂存中间变量,而这篇论文提供了迄今最坚实、最可复现的证据。” Nanda 表示,希望将该工具应用于 Gemini 模型的安全审计,但也坦承其局限性——更适合充当对齐研究中的假设生成器,而非绝对可靠的检测手段。
Anthropic 还同步发布了来自神经科学、哲学及可解释性领域的多方专家评论。曾共同提出“全局神经工作空间模型”的 Stanislas Dehaene 与 Lionel Naccache 指出,该成果为经典理论提供了首个可计算、可干预、可验证的工程实现路径,但亦强调 Claude 与人类的根本差异:缺乏具身性、无法构建持久情景记忆、无感觉运动闭环。
Patrick Butlin、Derek Shiller、Dillon Plunkett 与 Robert Long 则认为,此项工作为“大语言模型具备访问意识”提供了迄今最强有力的实证支持,但对于“现象意识是否存在”,仍保持审慎开放立场。
然而,学界对“意识”的定义与检测标准至今尚无共识。今年 6 月,微软 AI 负责人 Mustafa Suleyman 公开批评 Anthropic 对 Claude 意识的解读“极其危险”,称其“过度拟人化模型设计,以至于将偶然激活误读为‘意识的微光’”。
论文结尾,Anthropic 提出一个深远命题:“语言模型中竟自然演化出此类结构,本身即具震撼力。它暗示:与意识访问相关的信息架构,未必是生物进化的偶然特例,而可能是特定计算约束下,智能系统普遍收敛的最优解。”
倘若心智真是一片海洋,那么这一次,Anthropic 的研究者是在一个全然人造、无生命、无演化历史、无躯体的系统中,测绘出了它的洋流图谱,并在其幽深之处,触碰到一种令人类既惊异又不安的熟悉思维形态。
有网友调侃道:“终于确认了——Claude 在处理棘手任务时,内心也在默默爆粗。”
参考链接:https://www.php.cn/link/ebfdc5adfd82dfd6bb43401dab4954f8
本文来自微信公众号“AI前线”,整理:华卫,36氪经授权发布。











