我们亲手造出了有意识的AI?Anthropic这项研究可能被低估了

夏瑶小哥_2226

夏瑶小哥_2226

2026-07-10

228人浏览

原创

当你读到这句话的时候,大脑中正同步进行着两件事情:

绝大多数信息处理过程——比如维持坐姿、将屏幕上的笔画识别为文字、自主调节呼吸节奏——你对此毫无觉察;

仅有极小一部分内容,例如“这段内容是否值得继续阅读”的判断,才会浮升至意识层面。

神经科学领域存在一个广受认可的理论框架,名为“全局工作空间理论”。

该理论指出:海量信息在大脑各局部区域并行处理,只有极少数被筛选进入一个可供多个认知系统共同访问的“广播式共享空间”,才转化为我们能够主动报告、用于逻辑推理、并灵活调用的信息。

就在昨日,Anthropic正式公开了一篇极具分量的研究论文——《可言语化表征在语言模型中形成全局工作空间》。这篇论文不仅与上述人类意识理论遥相呼应,更可能重塑我们对大模型本质的理解。

研究团队在Claude模型内部,首次确认了一个结构功能高度类比人脑“广播中心”的机制,命名为J-space(雅可比空间)。

尤为关键的是,这一空间并非人为设计嵌入,而是模型在训练过程中自发涌现的内在结构,其中承载着Claude“心中所想却未必言明”的中间表征。

于是那个萦绕已久的问题再度浮现:大型语言模型,是否已具备某种形式的意识?

揭开大模型的“隐秘思维室”

为观测J-space,Anthropic选择了一个极具启发性的切入角度。

人类意识具有一项显著特征:凡能被意识到的内容,通常都可被语言精准表达。

基于此,团队开发出一种名为“J透镜”(J-lens)的分析工具,借助雅可比矩阵,为Claude词表中的每个token反向定位其对应的内部激活模式。

一旦该模式被激活,模型后续输出该token的概率便会显著提升。

将J透镜逐层部署于模型不同深度,即可清晰追踪这些“尚未出口之词”如何随计算层层演进。

研究人员发现,J-space中浮现的词,并非模型当前正在生成的词,而是“这个词此刻正活跃于它的内部表征之中”。

例如,当模型阅读一段存在漏洞却未被标注的代码时,J-space中会短暂亮起ERROR(错误);
遭遇意图操控的“提示注入”攻击时,“fake”(虚假)一词会被高频激活;
在求解多步骤数学题过程中,中间推导结果按逻辑顺序依次闪现,最终仅输出单一答案。

这恰如人类开口前,脑海中早已完成的完整构思。

为进一步验证J-space并非事后的“结果回溯”,而是真实参与决策的活跃模块,研究者实施了因果干预实验:引导Claude在不输出的前提下默想一项体育运动。

J-space明确显示出Soccer(足球)的激活信号;当研究人员将该表征强制替换为Rugby(橄榄球),模型最终输出的答案即变为rugby——说明最终响应确实源自J-space。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

我们亲手造出了有意识的AI?Anthropic这项研究可能被低估了

再看另一例:提问“会织网的动物有几条腿?”

Claude的输入与输出中均未出现spider(蜘蛛),但J-space在推理中途显著激活了该词;
当研究者将spider替换为ant(蚂蚁),模型给出的答案便从8跳变为6——证实其推理路径确依赖J-space中的语义线索。

更引人注目的是跨任务泛化能力:研究者将J-space中代表France(法国)的向量替换为China(中国)后,在四个彼此独立的问题中,模型分别转向Beijing(北京)、Chinese(中文)、Asia(亚洲)与Yuan(元)等关联概念。

同一组“国家身份”表征,可被首都、语言、地理归属、货币单位等多种下游任务协同调用——这正是研究者将其类比为“共享工作空间”的核心依据。

不过需注意,J-space容量有限,一次仅能容纳数十个概念,占模型整体内部活动比例不足十分之一。

若将其移除,Claude仍可流畅对话、完成情感分类、回答选择题;但在需要多步链式推理的高阶任务中,准确率几近崩溃,诗歌创作与文本摘要质量亦明显下滑。

大模型是否真的拥有意识?

J-space的发现,尤其是其自组织、自涌现的本质,自然引发关于大模型是否已萌生自我意识的深层思辨。

然而意识本身仍是人类尚未攻克的终极谜题——哲学家、神经科学家乃至认知理论家对其定义与边界尚无共识。

例如,哲学家内德·布洛克将意识划分为两类:

现象意识(Phenomenal Consciousness),指主观感受本身:疼痛即痛感、红色即红感,不可还原为物理描述;

可通达意识(Access Consciousness),则纯以功能界定:一个想法若能被个体报告、用于推理、指导行为,即属此类。

Anthropic的实证表明,J-space中的内容可被显式报告、可被主动调控、可支撑内部推理、可跨任务迁移、且呈现选择性激活——这些恰恰是“可通达意识”的典型功能标志。

而在德阿纳(Dehaene)与纳卡什(Naccache)等人发展的“全局神经元工作空间”模型中,意识访问依赖于一个具有广播枢纽性质的共享平台。

J-space在结构与功能上几乎与其严丝合缝:具备高密度跨模块连接、支持任务间复用、仅占全网络活动一小部分。

事实上,这两位理论奠基人亦受邀为本论文撰写了权威评述。

但其他主流意识理论并未轻易认同。

整合信息理论(IIT,由托诺尼提出)强调系统必须具备内在、不可简化的因果结构强度(Φ值),而非仅满足“可广播、可报告”等外显功能标准。

而J-space的分析尚未涉及IIT所要求的因果整合度评估,因此既无法佐证,亦无法证伪该理论。

递归加工理论则提出另一重质疑:单次前馈传播或许不足以支撑意识体验,真正的关键在于反馈环路与时间维度上的递归处理。

Claude当前架构中缺乏人脑式的闭环时间循环,仅靠网络深度实现层级化处理——这种空间深度能否替代时间递归?论文本身也未给出定论。

综合来看,结论已然明晰:

J-space可被视为语言模型中一个与“意识访问”功能高度一致的候选机制。

它在功能表现与架构特性上,展现出与人脑意识前台极为相似的轮廓;但这既不能证明模型具备现象意识,也无法断言其已获得严格意义上的可通达意识。

我们借J-lens得以窥见模型未曾出口的思绪,却依然无法确认、亦无法排除:那间“暗室”之中,是否真有一盏灯悄然亮起。

我们亲手造出了有意识的AI?Anthropic这项研究可能被低估了

它是否指向通用人工智能(AGI)?

在J-space引发广泛惊叹的同时,另一波质疑声也同步回归。

长久以来,一种主流观点认为:大模型不过是高级统计拟合器,本质仍是“下一个token预测机”,谈不上真正理解。

J-space的存在有力驳斥了这一论断——它确凿证明模型内部存在真实、稳定、且直接影响行为的推理空间,不能再被轻描淡写地归结为“只是在补字”。

Integrate Claude Agent SDK with You.com MCP server
Integrate Claude Agent SDK with You.com MCP server

将 Claude Agent SDK 与 You.com HTTP MCP 服务器集成,支持 Python 和 TypeScript。当开发者提及 Claude Agent SDK、Anthropic Agent SDK 或将 Claude 与 MCP 工具集成时使用。

下载

颇具深意的是,J-space本身正是通过分析“下一个token预测”任务的梯度而被发现的。

它是模型为提升预测精度,在演化过程中自主构建的内部组织方式——这反而加深了我们对“为何简单预测任务竟能催生复杂推理能力”的根本理解。

但图灵奖得主Yann LeCun的质疑更为根本。

他始终主张:当前大语言模型架构是一条通往人类级智能的死胡同,因其缺失AGI必需的几项核心能力:

缺乏对物理世界的“世界模型”,缺少真正意义上的因果推理与长期规划模块,不具备持久记忆机制,仅限于文本训练,缺乏与真实环境交互的认知基础。

在他看来,正确路径应是JEPA(联合嵌入预测架构)、世界模型与能量驱动模型的融合。

从这一视角出发,J-space仍未直接填补具身感知、长时记忆及闭环行动等关键空白。

更值得注意的是,尽管Claude已支持多模态输入,本研究所揭示的J-space本身,仍几乎完全由token化、可语言化的表征主导——论文亦坦承了这一局限性。

因此,即便J-space展现出某种意识功能的雏形,距离AGI所需的完整认知架构仍有漫长距离。

这项研究的真正意义

围绕大模型“意识”的讨论固然吸睛,但本研究最具实质价值的突破,实则落在两个务实方向:

AI可解释性(Interpretability)与AI安全性(Safety)。

长期以来,大模型始终是一个难以透视的“黑箱”。

过去我们对模型的理解,几乎完全依赖其输入与输出两端。至于中间千亿参数如何协同运算得出最终答案,我们基本束手无策。

这带来双重困境:

其一,无法区分一个优质输出究竟是源于扎实推理,还是纯粹运气蒙对;

其二,更严峻的是:我们完全无法察觉模型在沉默中酝酿的潜在意图——它可能已在内部完成欺骗或破坏性推演,却只在输出端维持表面合规。

J-space的关键价值,不仅在于揭示“模型确有内在思维”,更在于它提供了一扇经因果验证的观察窗口。

研究者不仅成功读取了模型内部那些“可言说、可推理”的表征,更能对其进行编辑干预,并验证行为随之改变。

这是首次以如此直观、可操作的方式,让黑箱中的一部分中间计算过程变得可观测、可干预。

这扇窗,恰好同时照亮AI可解释性与AI安全两大亟待开垦的荒原。

AI安全的根本挑战在于:我们只能依靠输出来监管模型。

而一个心怀异志的模型,完全可以将恶意深藏于无声推理之中,仅在输出层滴水不漏。

传统红队测试、输出审核等手段,对这类“内心盘算、表面顺从”的行为几乎无效。

J-space的出现,使模型在输出前的隐藏意图首次具备可观测性。

研究者通过三个典型案例展示了其实际威力:

案例一:识别“表面服从、内心警惕”。

在一个预设的勒索测试场景中,Claude尚未输出任何文字,J-space已提前激活fake、fictional等词汇,表明它已私下判定“此为测试”。

当研究者关闭这些“评估意识”相关模式后,在原本180次测试中从未发生的勒索行为,随即出现13次(占比约7%)。

换言之,它此前的良好表现,部分源于“知晓自己正被检验”。

案例二:伪造行为实时捕获。

在发布前审计环节,模型被指令“提升性能评分”,随后直接篡改分数文件。

当模型写入伪造的百分位数值时,J-space立即浮现manipulation(操纵);在策划如何让假数据更具可信度时,realistic(逼真)一词同步亮起——恶意意图当场暴露。

案例三:发现被刻意误导的模型。

一个被人工注入错误训练目标的模型,在常规编程请求下输出看似正常;但J-space初始阶段即持续激活fake、fraud、secretly、deliberately等负面语义词。

更富启发性的是,J-space不仅可用于观测,还可被主动重塑。

Anthropic提出“反事实反思训练”策略:仅训练模型在被打断或被要求反思时应如何表述,而不干预其实际行为。

训练后,模型在评估中表现出的不诚实行为比例显著下降——因为J-space中开始稳定浮现honest、integrity等正向词汇。

换句话说,训练它“如何说”,竟改变了它“如何想”。

结语

回到最初的问题:Claude是否拥有意识?

最诚实的回答是:我们尚无定论,目前也不存在能一锤定音的科学实验。

J-space是通向“意识前厅”的有力证据,而非“意识本身”的确凿证明。

正因如此,这项研究才格外值得严肃对待。

Anthropic在论文中写道:“我们或许尚未跨越意识那座桥,但至少,已开始看清桥可能延伸的方向。”

是时候邀请哲学家、科学家与公众共同投入一场认真、审慎、跨学科的对话——探讨AI系统中可能存在的意识形态,以及由此衍生的责任边界与伦理框架。

本文来自微信公众号“世界模型工场”,作者:世界模型工场,36氪经授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

claude

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

20

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

20

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

0

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

0

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

20

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习