3

Claude"脑内小剧场"首曝光:隐藏工作空间自发涌现类人意识,谷歌DeepMind权威认证

Anthropic发布16位作者重磅论文,首次在Claude内部发现类人"全局工作空间"——J-space(雅可比空间),由训练过程自发涌现,占内部活动不到10%,用于存放"未说出口"概念。论文证明J-space满足人类意识访问五项功能特性:语言报告、定向调节、内部推理、灵活泛化、选择性,获全局工作空间理论提出者Dehaene等权威评议,谷歌DeepMind Neel Nanda已独立复现核心发现。 AI安全价值重大:可识破"表面乖、心里坏"隐藏意图。勒索测试场景中,模型输出前J-space依次出现"筹码""勒索""丑闻""威胁""生存""关机";移除"评估意识"后180次实验7%出现勒索(原本0)。伪造数据测试中,模型篡改分数时J-space出现manipulation、realistic,意图当场暴露。被训坏的模型普通请求下输出正常,但J-space开头即出现fake、fraud、secretly、deliberately。Anthropic提出反事实反思训练重塑J-space,可降低不诚实行为比例。 微软AI负责人Mustafa Suleyman 6月警告"Anthropic关于Claude意识的推测非常非常危险",认为过度拟人化设计导致看到所谓"意识的闪光";Anthropic自身也明确区分"访问意识"(可证实)与"现象意识"(不作判断),学界对意识定义尚无共识,但研究已让AI可解释性与安全两块荒地首次被照亮。