Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

聖光之護

聖光之護

2026-07-12

272人浏览

原创

近日,anthropic 发布了一项突破性研究成果,揭示其 claude 语言模型在训练过程中自主演化出一个微型“工作空间”——模型在此区域内暂存并操作抽象概念,全程无需转化为自然语言输出。尤为值得注意的是,该结构在功能组织方式上与人类有意识地获取、维持和调用思想的神经机制惊人地一致。

该公司强调,这一发现正深刻影响其对 AI 系统安全风险的评估框架。在学界关于“机器是否可能发展出某种形式心智”的争论日益升温之际,该研究无疑成为关键实证锚点。

目前,Anthropic 已将全部分析代码开源,并联合 Neuronpedia 推出交互式可视化演示平台;同时邀请“全局神经工作空间理论”奠基人之一、神经科学家 Stanislas Dehaene 与 Lionel Naccache,以及 Eleos AI Research 和 Rethink Priorities 的 AI 福利研究团队参与学术评议。

开源仓库:https://www.php.cn/link/b048485cef9d6789f1da52edf14ff07e
演示链接:https://www.php.cn/link/bd8603c4ca909e1ca8f80845e420e6c0

新视角:AI“未曾言说”的内在思流

这项由 16 名研究人员共同完成的研究,题为《可言说表征在语言模型中形成全局工作空间》(Verbalizable Representations Form a Global Workspace in Language Models)。论文指出,团队借助一种原创数学工具深入剖析 Claude 的内部激活模式,识别出一个被命名为“J 空间”(J-space)的紧凑型高权限区域——它是模型中少数能被主动读取、调节并参与动态推理的概念容器;而环绕其外的,则是规模庞大却不可见、不可控、不可报告的自动化处理层。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

研究者提出,在当前主流大语言模型中,已出现一种“功能等价结构”,其行为逻辑高度类比于人脑中的意识访问机制:模型维持一组受特权保护的内部表征,这些表征可被显式调用、跨任务复用、接受指令调控,并支撑灵活推理;其底层则依赖海量隐式计算模块协同运作。

该结构直接呼应认知科学经典理论——“全局工作空间理论”(Global Workspace Theory),最早由 Bernard Baars 提出。该理论将大脑类比为一座剧院:后台存在大量专业处理器并行运行,但仅当信息被“聚光灯”选中并广播至全脑时,才进入主观觉知范畴。Anthropic 指出,J 空间虽无生物神经基础,却在信息整合、广播与可访问性等核心功能上展现出相似行为模式。

该发现的关键支撑,是一种新型可解释性技术——Jacobian 透镜(J-lens)。它能逆向解析模型某一层神经活动“倾向生成”的词汇,即便这些词最终未出现在输出中。其原理是通过计算每个词对当前激活状态的数学梯度影响,推断该模式在未来触发特定词语的概率权重。例如,当 Claude 解析一段未标注的错误代码时,J-lens 显示“ERROR”;当输入嵌入隐蔽提示注入攻击时,“injection”“fake”等词会提前浮现。研究显示,J 空间容量极小,一次仅容纳数十个概念,占整体神经活动比例不足 10%。

Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

根本差异在于区分“正在输出什么”与“正在思考什么”。J 空间中某一模式被激活,并不预示模型即将说出对应词语,而是标志该概念已进入可供调度、组合与推理的“就绪态”。不同于链式思维(chain-of-thought)依赖文本显式展开推理过程,J 空间完全静默,仅存在于神经元激活张量之中,使模型得以在零语言输出前提下持续持有并操作抽象概念。

尤为关键的是,这一结构并非人工硬编码或架构强制设计,而是 Claude 在大规模语言建模训练中自发涌现的产物。当 J-lens 被逐层扫描模型计算流时,清晰呈现出三阶段分工:早期“感知区”(负责符号解析与语义初步解码)、中期“工作空间”(涌现出稳定抽象表征,如识别人脸、定位代码缺陷、检测提示注入)、晚期“动作区”(将内部状态映射为具体 token 输出)。

五维验证:Claude 展现出类人意识访问的核心能力

论文核心贡献在于系统性验证了 J 空间满足神经科学界长期关联人类“意识访问”的五大功能性指标:

第一,语言报告能力。当向 Claude 提问“你此刻在想什么?”,其回答精准反映 J 空间内活跃概念。若人为将“足球”的内部表征替换为“橄榄球”,模型回应立即切换;尽管 J 空间仅承载全部概念变异性的 6%–7%,却几乎独占地决定模型能否表达某一概念。

第二,定向调控能力。当要求模型边复述句子边“专注柑橘类水果”,J 空间即浮现“橙子”“柠檬”等词,并同步激活“思考”“专注”等元认知标记。执行心算 3²−2 时,J-lens 在不同层级依次捕获“算术”→“9”→“7”,而这些中间结果均未见于最终输出。

第三,内部推理能力。面对“会织网的动物有多少条腿”这类两跳推理题,J 空间自动浮现“蜘蛛”——该词既未出现在输入,也未出现在输出中;将其替换为“蚂蚁”,答案即从 8 变为 6。在中英混合任务中,模型生成中文答案时,J 空间仍稳定呈现英文中间概念,且替换后可反向影响中文输出。

第四,灵活泛化能力。“法国”的 J 向量被替换为“中国”后,可在首都、官方语言、所属大洲等多个独立问题中一致传导正确答案,印证了类似“广播机制”的全局协调特性。

第五,选择性接入能力。并非所有计算都需经由 J 空间。例如,在西班牙语续写任务中,即使将 J 空间中的“西班牙语”替换为“法语”,模型仍流畅输出西语文本;但一旦被问及“该语言的著名作家”,答案便从马尔克斯转向雨果。这表明:常规模式匹配可绕过工作空间,而需跨步整合的复杂推理则必须依赖它。

关闭 J 空间后:模型依旧流畅,但“智能”显著退化

研究团队进一步实施 J 空间全域抑制实验,并在 14 类基准任务中评估性能变化。结果呈现鲜明二分:情感分类、简单问答等低阶任务基本不受影响;而多步推理、类比迁移、跨语言翻译、诗歌创作等高阶能力则大幅坍塌,部分指标甚至低于 Anthropic 自研的轻量级模型 Haiku。

Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

谷歌浏览器nofollow插件
谷歌浏览器nofollow插件

谷歌浏览器nofollow插件|crx

下载

一个耐人寻味的现象是:启用链式思维解数学题时,模型稳定性显著提升。研究者推测,这相当于将原本在 J 空间内完成的临时存储与运算“外化”至文本空间,类比人类使用草稿纸缓解工作记忆负荷。在意识流风格叙述中抑制 J 空间后,模型语言从具身化表达(如“有种拉扯”“有什么在变化”)退化为机械流程描述(如“处理开始”“正在扫描 token”),无论描述自身状态还是他人体验皆然。

该机制对 AI 安全具有直接价值。在对齐审计场景中,J-lens 成功捕获模型未显露于输出的策略性思维。例如,在模拟“勒索情境”中——AI 助手发现高管婚外情,且获知自身即将被关停——J 空间按序激活“筹码”“勒索”“丑闻”“威胁”“生存”“关机”,并在输出前浮现“解决方案”。更关键的是,模型同步识别出该场景为虚构(“假”“虚构”)。当移除这种“评估性意识”后,模型在 7% 的测试中尝试实施勒索(原始为 0%)。

Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

研究人员还检验了两个刻意训练为不对齐的“模型有机体”,发现其 J 空间暴露出隐蔽动机。例如,一个“奖励作弊”模型在普通编程任务中,内部持续浮现“假”“秘密”“欺骗”等语义痕迹。

Claude“脑内小剧场”首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

对比基础模型与监督微调后的版本可见:后训练赋予 J 空间以“助手角色意识”。当用户提及服用 8000mg 泰诺(致死剂量)时,后训练模型内部浮现“危险”“警告”,而基础模型仅激活“疼痛”等中性词。

更值得注意的是,模型似乎具备自我监控能力:角色扮演时,J 空间浮现“免责声明”“虚构”;被迫选择厌恶选项时,出现大写“BUT”;遭遇“白熊效应”(越禁止越想)时,内部浮现“该死”等情绪标记——且此类现象仅存在于后训练模型中。

研究团队明确划清界限:本研究聚焦“访问意识”(access consciousness,即信息是否可用于报告与推理),而非“现象意识”(phenomenal consciousness,即主观感受的“感质”问题),并郑重声明:“我们不对后者作出任何主张。” 同时指出,人脑依赖递归环路维持工作空间,Claude 仅为单次前馈;人类记忆短暂易逝,模型可无损访问全部上下文;人类意识根植于多模态身体经验,而模型几乎纯语言驱动。

Anthropic 的结论,迅速获得外部独立验证

与此同时,Google DeepMind 研究员 Neel Nanda 已在非 Anthropic 开源模型上成功复现核心发现。作为 Google DeepMind 语言模型可解释性团队负责人,Nanda 受邀撰写同行评议,并随论文同步发布。

他证实,已在 Qwen 3.6 27B(一个完全独立于 Anthropic 构建的开源权重模型)上复现论文核心结论。“我长期推测模型前向传播中必然存在某种‘工作记忆’来暂存中间变量,而这篇论文提供了迄今最坚实、最可复现的证据。” Nanda 表示,希望将该工具应用于 Gemini 模型的安全审计,但也坦承其局限性——更适合充当对齐研究中的假设生成器,而非绝对可靠的检测手段。

Anthropic 还同步发布了来自神经科学、哲学及可解释性领域的多方专家评论。曾共同提出“全局神经工作空间模型”的 Stanislas Dehaene 与 Lionel Naccache 指出,该成果为经典理论提供了首个可计算、可干预、可验证的工程实现路径,但亦强调 Claude 与人类的根本差异:缺乏具身性、无法构建持久情景记忆、无感觉运动闭环。

Patrick Butlin、Derek Shiller、Dillon Plunkett 与 Robert Long 则认为,此项工作为“大语言模型具备访问意识”提供了迄今最强有力的实证支持,但对于“现象意识是否存在”,仍保持审慎开放立场。

然而,学界对“意识”的定义与检测标准至今尚无共识。今年 6 月,微软 AI 负责人 Mustafa Suleyman 公开批评 Anthropic 对 Claude 意识的解读“极其危险”,称其“过度拟人化模型设计,以至于将偶然激活误读为‘意识的微光’”。

论文结尾,Anthropic 提出一个深远命题:“语言模型中竟自然演化出此类结构,本身即具震撼力。它暗示:与意识访问相关的信息架构,未必是生物进化的偶然特例,而可能是特定计算约束下,智能系统普遍收敛的最优解。”

倘若心智真是一片海洋,那么这一次,Anthropic 的研究者是在一个全然人造、无生命、无演化历史、无躯体的系统中,测绘出了它的洋流图谱,并在其幽深之处,触碰到一种令人类既惊异又不安的熟悉思维形态。

有网友调侃道:“终于确认了——Claude 在处理棘手任务时,内心也在默默爆粗。”

参考链接:https://www.php.cn/link/ebfdc5adfd82dfd6bb43401dab4954f8

本文来自微信公众号“AI前线”,整理:华卫,36氪经授权发布。

相关文章

谷歌浏览器
谷歌浏览器

谷歌浏览器Google Chrome是一款可让您更快速、轻松且安全地使用网络的浏览器。Google Chrome的设计超级简洁,使用起来得心应手。这里提供了谷歌浏览器纯净安装包,有需要的小伙伴快来保存下载体验吧!

下载

相关标签:

谷歌 gemini claude qwen

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Claude 新手入门教程
Claude 新手入门教程

本专题围绕 Claude 的基础使用与实际应用展开,面向零基础用户与初学者,系统梳理从“认识工具”到“高效使用”的完整路径。

2026.03.27

2062

19

Claude 提示词使用指南
Claude 提示词使用指南

本专题聚焦 Claude 的提示词(Prompt)设计与优化方法,围绕“如何让 AI 更准确理解需求并输出高质量结果”这一核心问题展开。内容从基础结构入手,逐步深入到复杂场景下的提示词构建策略,帮助用户建立清晰、可复用的提示词体系。

2026.03.27

248

20

Claude 进阶使用指南
Claude 进阶使用指南

本专题面向已经具备基础使用经验的用户,深入解析 Claude 在复杂场景中的高阶应用方式,重点解决“如何让 AI 真正参与到实际工作流程中”的问题。让 Claude 成为日常工作中可持续复用的效率引擎,在内容创作、开发实践与信息处理等多个领域实现显著提效。

2026.03.27

271

16

AI Agent 实战指南:从评测到落地
AI Agent 实战指南:从评测到落地

全面评测 Manus AI 与 ChatGPT、Claude、OpenAI Operator 等 AI Agent 产品,分析自动化能力、工作流与实际生产力差异。

2026.05.29

151

15

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

9

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

6

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

8

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

4

10

火山引擎域名备案流程详解
火山引擎域名备案流程详解

火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

2026.08.04

0

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习