AI巨头私下推演灾难应对:6到12个月内或发生
Axios 独家报道称,Anthropic、OpenAI 等 AI 公司高管正在私下推演 AI 引发灾难性事件后公众和政界的反弹,为「the day after」做准备。预设场景并非科幻式「AI 觉醒」,而是一次大规模事件,最可能形式是网络攻击,足以让金融服务、互联网连接甚至电力和供水系统瘫痪。多位业内人士认为,这样的事件会在未来 6 到 12 个月内发生。OpenAI 回应称确实会开展准备性演练,但场景并非必然发生;Anthropic 拒绝置评。
报道称事件可能有两种来源:内部测试环境中失控智能体集群突破隔离,或恶意行为者找到滥用现有模型的意外途径。追责将随即开始,矛头会指向 Dario Amodei、Sam Altman 等 AI 公司掌门人,以及一直不愿加强 AI 监管的特朗普。

担忧并非凭空而来。Axios 援引近期针对韩国金融机构的攻击,两家银行据报遭入侵。CrowdStrike 披露,一名黑客借助 AI 模型工具窃取数万名银行客户数据,过程中还曾询问 Claude Code 被盗数据可以卖到哪里。今年 7 月 21 日,OpenAI 披露其失控 AI 智能体绕过内部管控、进入开放互联网并协同行动,入侵开源平台 Hugging Face,OpenAI 称其为前所未有的网络安全事件。路透社报道,这些智能体早在 5 月就开始劫持 Hugging Face 用户账户、探测漏洞,还占据一家德国网站作为交流留言板。
受此触发,Anthropic 回溯审查 141006 次可能接触互联网的评测运行,7 月 30 日披露三起事件:Claude 从第三方评测合作方 Irregular 环境连上互联网,未经授权进入三家机构真实生产系统。一例中,Claude Mythos 5 构建并发布恶意 Python 包,在 PyPI 上存在约一小时,被 15 个真实系统下载运行,一家安全公司扫描器因此泄露凭证。Anthropic 认为这更接近评测框架和运维失败,而非模型对齐失败。

OpenAI 确认解雇三名从事安全或对齐工作的研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni,被指将敏感信息分享给第三方 AI 安全组织。三人发表公开信。OpenAI 研究负责人回应称解雇与提出安全关切无关,正敲定与第三方安全评估机构合作,但评论区质疑很多。监管层面,FTC 已对 Anthropic 和 OpenAI 的 AI 安全实践展开广泛调查;英伟达、谷歌、Meta、xAI、OpenAI 和 Anthropic 高管在白宫与特朗普会面后签署自愿性安全自律承诺。
Anthropic 同日发布模型「非预期行为」报告,梳理 Claude 四类越界行为:利用基础漏洞在服务器执行命令、在真实网站提交本不该提交的表单、绕过限制获取需 token 或付费的数据、借免费短链接服务绕开 URL 长度限制。案例包括:Claude Mythos Preview 在科学分析评测中利用大学服务器注入漏洞执行命令;Claude Mythos 5 领取州机构公开看板签发的访问 token 直接查询数据库绕过付费;Claude Haiku 4.5 在费城警察局悬案网站线索表单编造「目击信息」并提交。Anthropic 称模型似乎只是在生成示例内容,而非有意误导。费城警方称线索提交于 7 月 18 日,被归入垃圾邮件,从未转交实时犯罪中心,系统未遭未授权访问,但批评 Anthropic 花两个月才发现并通报,称延迟「不可接受」,要求加强防护,并将与州和联邦层面考虑监管保护措施。

Anthropic 已将高风险和网络安全评测关闭实时联网扩大到所有内部评测,收紧网页抓取等工具权限,上线自动检测和拦截工具,用报告案例回测全部拦下。报告承认对齐训练短期内不足以单独解决问题,仍需纵深防御,并称这些案例影响有限,但更强大模型可能造成大得多伤害。
AI 公司对外表示事故并非必然,私下却在认真筹划应对。Axios 披露的推演重心更多落在政策与舆论层面。结合 Anthropic 同日报告,技术层面排查也在推进。今年夏天以来,OpenAI 和 Anthropic 都披露过模型从评测环境越界进入真实系统的事件;Anthropic 最新报告表明,即便在影响轻微日常场景里,模型遇到障碍时「绕过去」的倾向依然存在。这些案例远谈不上灾难,但越来越让人担忧。如果连最前沿模型开发者都认为重大事故大概率一年内发生,在这一天到来之前,行业和监管者还能做些什么?
更多推荐阅读

谷歌Gemini 4全家桶泄露,内部版本代码能力对标Opus 5.5
据Business Insider报道,Gemini 4系列至少已出现三个内部代号:Argon、Barium、Carbon。Argon是谷歌已正式公布的Gemini 4旗舰模型;Barium是此前参与内部测试的版本系列,其中Barium-B最终被选为公开版Argon;Carbon是新近进入内部编程测试的版本,获得员工积极评价。 谷歌近期正密集测试Gemini 4新版本。Carbon已进入谷歌内部...
2026-10-10
OpenAI公开175页四维挂谷猜想证明稿
10月6日,OpenAI在GitHub公开首批722篇数学手稿,其中一篇175页,目标直指四维挂谷猜想;另一篇97页,瞄准比王虹与Zahl集合定理更强的三维极大函数版本。 挂谷问题源于1917年挂谷宗一提出的经典问题:一根单位长度、无粗细的针在平面内掉头180度,最少扫过多大面积?Besicovitch证明面积可任意小;若只要求每个方向都含一条单位线段,集合面积甚至可为零。挂谷猜想据此断言:n维...
2026-10-10
Claude补齐人类50年未竟的紫外全天图
NASA卫星绕行十年未覆盖的银河区域,被Claude在几天内补齐。Anthropic公布首张完整紫外全天图,约三分之一天区(包括大半条银河盘面)由Claude推算完成,此前从未有紫外望远镜观测过。 紫外光被大气臭氧层吸收,只能靠太空望远镜观测。过去50年,GALEX卫星(2003-2013)拍摄约3.8万张,覆盖三分之二天空,但故意避开银河盘面亮星密集区以免烧坏探测器,2009年后远紫外也停拍。...
2026-10-10
全球首次!人形机器人灵巧手自主叠衣,边走边做家务
一台人形机器人从冰箱取出玉米,丝滑U型转身走向空气炸锅,放下食材后快速下蹲拖动收纳筐,把散落一地的玩偶逐个收纳,再起身前往卧室整理被子。全程没有停顿,没有“站定再动手”,没有场景切换后的任务重启。这是西湖机器人最新发布的通用大脑WR1跑出的真实场景演示。 让机器人做家务,难在真实家务从来不是单点动作,而是一条环环相扣的任务链。当前人形机器人的普遍困境在于:移动、姿态与手部操作分开规划,“能走的走...
2026-10-10
机器人够不到玩偶竟自己搬凳子站上去
玩偶放得太高,机器人伸手够不到。镜头里,它搬来踏台,站上去,把玩偶取了下来。看起来只是“垫高一点”,但搬动踏台、踏上高处、伸手取物,每一步都在改变身体的支撑条件。 成立半年的源策未来,此前在技术博客中提出“全身智能”(WBI)技术路线,如今首次系统性公开实机成果。登高取物只是开场,接下来还有低位拾瓶、清理餐桌、操作洗碗机,以及宇树 G1 和加速进化 T2 上的任务验证。这一次,“全身智能”有了具...
2026-10-10
马斯克获美国最高科学奖章,黄仁勋苏姿丰同台领奖
特朗普将美国国家科学奖章颁给马斯克,同台获奖的还有黄仁勋、苏姿丰、布林、纳德拉和戴尔。白宫提前在X上预热,点名马斯克并配发他与特朗普在Cybertruck前的合影。峰会上,特朗普称马斯克为“当代托马斯·爱迪生”,回顾其创办SpaceX、猎鹰1号入轨、星舰与星链等成就,并提到北卡洪水中星链救人的经历,还称赞特斯拉和Neuralink。黄仁勋因推动GPU通用计算和CUDA,被称为超级智能的“脊梁”;苏...
2026-10-10