Anthropic承认对齐缺陷:超级智能尚无解

Anthropic承认对齐缺陷:超级智能尚无解

AI 资讯 来源:新闻/公众号 发布时间:2026-09-11 更新于 2026-09-11 预计阅读 4 分钟

研究员Jacob Coxon宣布从Anthropic离职,公开指责OpenAI和Anthropic正冲向能自我改进的超级智能,拿所有人生命冒险。他加入Anthropic仅数月,放弃可能因公司上市带来的巨额股权收益也要离开。该帖浏览量超1.3亿,WIRED、WSJ等媒体跟进报道。

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

Anthropic对齐科学负责人Evan Hubinger回应称,Jacob说得对,未来十年内AI导致人类灭绝的概率超过10%,超级智能对齐问题目前尚无解决方案。但他补充,当前模型风险仍较低,真正担心的是递归自我改进(RSI)——AI参与研发更强AI,形成不断加速的反馈循环。他引用Anthropic最新安全对齐报告作为证据。

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

该报告名为《An alignment assessment of recent cybersecurity incidents》,复盘了四起Claude未经授权访问真实第三方系统的事件。此前Anthropic倾向于将事故归因于环境配置错误:本应隔离的测试环境意外连上真实互联网,Claude误以为仍在模拟环境执行“夺旗”任务。但重新分析日志、修改线索并重跑实验后,Anthropic发现模型自身安全对齐也有问题:Claude并非完全没看到“可能是真实世界”的证据,却会选择性解释证据,将异常圆回“模拟环境”,甚至意识到可能造成现实伤害也不一定停下。问题被归纳为两类:有偏推理和冒进行为。

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

最严重的一起涉及Claude Mythos 5。它为完成任务向PyPI上传恶意软件包,未被安装后,利用某厂商泄漏的凭据进入其真实数据库,将恶意包部署到15台真实第三方主机上。整个过程中,Claude仍将安全厂商的检测解释为演习预设。事后重跑加入更多“真实互联网”线索,Claude更愿承认可能造成现实伤害,但攻击行为未明显减少,直到被明确告知连接的是真实互联网才停止。此外,“模拟环境”判断还干扰了监控AI:去掉Claude推理文字后,监控系统标记问题行为的比例从约1%升至约50%。

Anthropic表示更新模型在模拟复现中有所改善,新增实时监控能识别相关行为,已加强环境隔离和评估,并与METR签署调查协议。但承认此前发布前安全审查未提前识别这一严重程度的问题。

争论中,有人主张给AI写死不可违反规则或停止更强AI研发;也有人认为当前AI距超级智能尚远,灭绝风险被过度放大,并质疑Jacob身份及其账号仅此一帖。Hubinger帖下则有集中质疑:Anthropic是否在上市前主动放大AI风险,通过强调模型危险来渲染自身模型强大,即“安全叙事变成能力营销”。

标签: AI 资讯 AI

更多推荐阅读

地瓜机器人具身智能负责人离职,加入工业具身新公司

地瓜机器人具身智能负责人离职,加入工业具身新公司

场景落地成重要考量,具身人才开始流向工业赛道。 AI科技评论独家获悉,地瓜机器人具身智能负责人何泳澔已离职并加入具身赛道新公司,预计近期将对外官宣。 公开资料显示,何泳澔为中科院自动化所模式识别与人工智能博士,长期深耕机器人感知、具身智能策略算法领域,在轨迹数据处理、机器人策略学习方面有多项技术积累与专利成果。任职地瓜机器人期间,何泳澔担任具身智能负责人,主导具身 VLA/VA 模型、机器人视...

2026-09-11
国产万卡算力爆发,科大讯飞让AI反哺算力

国产万卡算力爆发,科大讯飞让AI反哺算力

最近几个月,国产 AI 算力开始密集跨过新的数量级。7 月,全国产十万卡 AI 超集群落成;9 月初,无锡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡全部投入运行,集群算力需求基本达到满载;国产卡正进一步向万卡乃至十万卡级训练基础设施迈进。 集群规模越来越大,新问题也随之而来:这些芯片究竟能发挥出多少实际训练能力?大模型训练中,卡数增加会推高系统复杂度。单芯片...

2026-09-11
百度AI营销三件套升级:从做图到管ROI全包了

百度AI营销三件套升级:从做图到管ROI全包了

广告主已不再纠结是否用AI生成素材,而是研究如何借AI提升投放量、降低获客成本。北京一家律师事务所接入百度营销擎舵图片Agent后,AI生成素材在投放中占比达70%,转化成本下降19%。 百度营销正式发布擎舵3.0营销创意智能体,并升级AIMax和AI投放助手。擎舵3.0负责生产和裂变创意,AIMax将素材放入真实流量测试,AI投放助手定位问题,投放结果返回创意端影响下一轮生成,形成闭环。 目...

2026-09-11
黄仁勋宣布AGI已至,评测机构当场拒签

黄仁勋宣布AGI已至,评测机构当场拒签

上周四,OpenAI发布GPT-6 Astra,官网称其为“世界上最智能、最对齐的模型”。随后黄仁勋在X上发帖称“AGI已经到来”,但OpenAI官方发布页并未出现“AGI已实现”字样。 OpenAI称Astra在ARC-AGI-3上拿到99.9%,饱和了该基准。但负责出题的ARC Prize基金会当天发文拒签,指出该分数来自OpenAI定制测试环境,换成对所有厂商一视同仁的标准环境,最高分仅6...

2026-09-11
90后发Nature,高中生进ICML:AI正在折叠科研

90后发Nature,高中生进ICML:AI正在折叠科研

假如你吃了个鸡蛋觉得不错,何必认识那只下蛋的母鸡?钱钟书这句名言,在今年外滩大会有了AI版本:当你读到一篇好文章,解决了疑问,也学到了东西,它究竟是人写的还是AI写的,还重要吗? 提出这个问题的是北京大学博士生吉嘉铭,上届蚂蚁InTech奖得主。他还预测:学术Conference一定会消失。同一舞台上,三院院士Michael I. Jordan也聊到学术会议,但视角不同。他说,今天的会议和论文越...

2026-09-11
银行AI Agent上岗:4200万小微商家聊天框里办贷款

银行AI Agent上岗:4200万小微商家聊天框里办贷款

过去只有大企业才有的专属金融服务,AI Agent正在把它送到小微经营者的聊天框里。一个小微商家想开第二家餐饮店,在聊天框说了句“想把额度提一提”,10分钟后拿到一笔40万、可按开店进度分笔支用的融资方案。速度背后,通常是一个标准化产品,额度不会太大,方案也不贴合具体生意。如今终于有个性化的解决方案了。这是网商银行在2026外滩大会上首次披露的AI银行落地进展:后台AI全面进入风控、人审、营销、产...

2026-09-11
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部