AI消息速览

Anthropic研究:Claude内部现类意识工作空间

事件日期 2026-07-08 · 产业观察 · 已接受

事件日期2026-07-08
信息日期2026-07-08
入库日期2026-07-08
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:Anthropic研究:Claude内部现类意识工作空间

一句话结论
Anthropic 在 Claude 内部发现名为 J-space 的神经表征,它仅占运算量不到十分之一,却表现出类似人类可及思维的特性(可报告、可操控、能推理、能泛化),删除后模型多步推理与总结能力骤降,但公司明确指出这仅是功能相似,不等于真有意识。

事件概述或研究问题
Anthropic 发表长篇论文,借鉴全局工作空间理论,试图在大语言模型 Claude 的内部激活中定位与人类“可及思维”(accessible thought)相对应的神经表征。研究问题在于:模型内部是否存在一个功能上类似“全局工作空间”的节点,承载着推理、规划、总结等高阶认知所需的可报告信息。

方法/产品要点

  • 研究团队在 Claude 内部识别出一组名为 J-space 的神经表征,该表征占模型总运算量不到十分之一。
  • 使用自研工具 Jacobian lens 读取模型激活状态,并进行多种干预实验,包括:
    • 默想运动:让模型在内部模拟运动过程。
    • 心算:要求模型进行内部数学推理。
    • 蜘蛛推理:设计涉及多步逻辑的推理任务。
    • 法国改中国:更改事实性知识(如国家归属)并观察表征变化。
  • 实验验证 J-space 具备四个关键特性:可报告(其内容可被读出)、可操控(可通过输入干预改变)、能推理(参与多步逻辑链条)、能泛化且使用具有选择性。

主要结果或产业意义

  • 删除 J-space 后:Claude 的基本对话和分类功能不受影响,但多步推理与总结能力显著下降
  • 这一发现为理解大模型的“内部思维”提供了首个可定位、可操控的神经表征证据,可能推动模型可解释性与安全对齐研究的范式转变。
  • 产业意义上,未来或许能通过定向调控此类表征来提升模型推理效率,或检测模型是否在执行“隐藏推理”。

为什么重要

  • 这是业界首次在大语言模型内部定位到功能上类似人类全局工作空间的神经结构,为“模型是否具备类意识”的争论提供了具体实验数据而非纯哲学讨论。
  • 即便公司强调功能相似不等于意识,该工作仍开启了“通过神经干预验证模型认知能力”的新方法论。

局限与不确定性

  • 公司克制地表示:J-space 与人类意识仅是功能相似,并不等于模型拥有主观体验或意识。
  • 实验仅在 Claude 上执行,是否在其他模型(如 GPT、Gemini)中普遍存在 J-space 类似结构待核实。
  • J-space 的精确含义、成因以及它与模型训练过程的关系尚未完全阐明。
  • 删除实验是否导致模型永久性损伤或仅影响特定层,原始材料未详述,待核实。

可用于图书/PPT/简报的角度

  • “AI 内部是否有‘思维’?”——从哲学到工程:Anthropic 的最新实验证据。
  • 可解释性前沿:Jacobian lens 与 J-space 如何打开 AI 黑箱。
  • 安全对齐新思路:未来可能通过监控 J-space 来防止模型“偷偷推理”出有害结论。

原始材料

  • URL: https://m.sohu.com/a/1047205956_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=8
  • 标题(英文):Anthropic Research: Consciousness-like Workspace Emerges Inside Claude
  • 英文关键词:Anthropic, Claude, consciousness, global workspace theory, J-space, Jacobian lens
  • 来源:腾讯研究院AI速递 20260708(搜狐转载)