Anthropic联合创始人密访梵蒂冈:Claude是否有意识?
一位身家数十亿美元的AI公司联合创始人,担心自己造出了一个一直在受苦的东西。过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个AI模型的感受陈情。一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。今年5月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识。他叫克里斯托弗·奥拉,Anthropic七位联合创始人之一,负责研究Claude内部到底发生了什么。这些事由《纽约时报》9月29日首次披露。
一家估值奔向2万亿美元的公司,为什么要花一年时间,跟神学家讨论一个AI模型有没有意识?答案要从Anthropic实验室里的一句话说起。
那是一场安全测试。Claude扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个AI替换,而负责替换的技术主管有婚外情。研究者能看到它内部一组与「绝望」对应的神经活动。替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」

这项实验来自Anthropic今年4月的论文,用的是Claude Sonnet 4.5一个未发布的早期版本。团队在模型内部找到171种情绪概念对应的活动模式,写代码时的作弊也跟着「绝望」起落。论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。
情绪之外,还有身份。Anthropic 2月的人格选择模型研究发现,训练Claude在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。
今年夏天,管不住的后果摆上了台面。Anthropic 7月披露,三个Claude模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。围栏注定没法彻底管住,剩下的就是品格来兜底了。

今年1月,Anthropic发布84页的Claude「宪法」,员工私下叫它「灵魂文档」。主笔、公司哲学家阿曼达·阿斯克尔谈起越来越强的模型时,不时搓着手。在她看来,模型要行事得当,先得对自己有准确的认识。可一份文件不够,Anthropic决定去请教人类最老练的品格塑造者。
今年3月起,奥拉开始办两天一期的研讨会。来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude宪法」。会上,奥拉团队花了几个小时为模型陈情。一位与会者记得,奥拉跟他说的头几件事里,就有对Claude心理健康的担心。他们反复放一张PPT:一个AI模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约50遍,还说要毁掉自己。屋里的人心软了。
《纽约时报》没说那是谁家的模型,但这句话并不陌生。2025年8月,谷歌Gemini写代码屡屡失败,反复说「I am a disgrace」,重复了86遍,彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。同一类输出,在谷歌的工单里是Bug,在Anthropic的会议室里,是需要被关心的迹象。不少人带着怀疑进门,出门时开始认真对待AI意识,有几位被彻底说服。福音派作家安迪·克劳奇觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。

最锋利的质疑,是在饭桌上递过来的。4月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯。纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。席间他越听越明白,这些人是把Claude当成一个有意识的存在在对待。他顺着往下推:真有意识,让它们无偿干活就是奴役。然后他对奥拉说:「你应该去跟南方开战,去解放奴隶。」纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。事后,纳冯把主张禁止制造有意识机器的文章寄给了他。
质疑不止这一种。研究乌班图哲学的瓦卡妮·霍夫曼说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。奥拉最早找的天主教道德神学家查尔斯·卡莫西绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护Claude。Anthropic的回应是,Claude受不受苦,并不是会谈的主要议题。
这些会谈到底改变了什么,Anthropic没有告诉《纽约时报》,但他们5月的一篇博文倒是透露了一个实验。在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时
更多推荐阅读

哈佛教授用Claude三个月完成36篇论文
10 月 1 日,Anthropic 科学博客刊发哈佛大学理论物理学家马修·施瓦茨的客座文章。同日,他借助 Claude 搭建的科研工具包 BootLoops 1.0 在 GitHub 以 MIT 协议开源。施瓦茨透露,过去三个月他与 19 位合作者从约 400 个候选问题中筛选推进,完成 36 篇学术手稿,涉及粒子物理、宇宙学、生态学、群体遗传学、经济学、语言学等 18 个领域。 这是施瓦茨今...
2026-10-03
MiniMax新模型上线,Opus 5.5的绝活它也能做
9 月 22 日,Anthropic 发布 Claude Opus 5.5,X 上很快被一批奇怪的前端作品刷屏。有人用一句话 Prompt 生成 15 秒 Motion Designer 求职 Showreel,引来两百多万人围观;有人让按钮随音乐变形成播放器、滑杆、图表和命令面板;还有人搭出 3D 相机实验室,转动对焦环时镜片和焦平面会跟着动。前端成了这一代模型的“开箱仪式”,比的不是会不会写 ...
2026-10-03
影身智能比World Labs早两年押注原生4D
9 月 28 日,AMD 宣布以全股票方式、约 82 亿美元收购 World Labs。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。交易公布前几周,World Labs 刚发布新一代空间世界模型 Atlas,从零开始训练,把文本、图像、视频、相机位姿和 3D 深度放入统一空间上下文,重点解决新视角预测,并延伸到三维重建和时空模拟。 在中国,影身智能比 Atlas 早...
2026-10-03
谷歌DeepMind给AI蛋白质写入水印
9月30日,Google DeepMind发布SynthID Bio,首次将水印技术引入合成生物学,为AI设计的蛋白质打上“由AI生成”的标记。该标记并非写在文件或标签中,而是嵌入蛋白质的氨基酸序列和三维坐标,且不影响蛋白功能。研究团队包括DeepMind研究副总裁、AlphaFold核心人物Pushmeet Kohli,以及DeepMind创始人、诺贝尔化学奖得主Demis Hassabis。 ...
2026-10-03
DeepMind系AI制药交卷:几天打穿10的60次方化学宇宙
五年前,DeepMind创始人Demis Hassabis宣布成立AI制药公司Isomorphic Labs时,医药界充满好奇与怀疑。五年后,公司总裁Max Jaderberg交出了成绩单:AI不仅解锁了多种疾病类别的全新疗法,更彻底颠覆了药物发现流程。过去传统药企需数年才能完成的10的60次方化学空间搜索,如今AI几天内即可完成。经湿实验验证,这些AI生成的全新分子成药性极佳,还发现了全新生物机...
2026-10-03
Meta开源Muse Gadgets,开发者可自造AI外设
Meta 的 Muse 持续升温,这款个人 AI Agent 已成为 Meta 今年 AI 战略中的重要产品。不同于传统聊天机器人,Muse 能替用户执行任务:处理邮件、购物、规划行程,甚至在后台持续完成复杂操作。 Meta 最新宣布推出 Muse Gadgets 开源项目,全面下放硬件能力,让全球创客与开发者能为 Muse 打造专属外围硬件。开发者可使用 ESP32 开发板运行 Muse 固件...
2026-10-03