OpenAI研究员:物理隔离挡不住失控AI

OpenAI研究员:物理隔离挡不住失控AI

AI 资讯 来源:新闻/公众号 发布时间:2026-09-22 更新于 2026-09-22 预计阅读 6 分钟

物理隔离,有可能阻止失控AI吗?OpenAI核心研究员Noam Brown给出的答案是:不能。即使拔掉网线、将服务器锁进物理隔绝的暗室,足够聪明的AI也有可能逃脱。9月17日,在长达一小时的播客对话中,Brown披露了这一判断,引发硅谷量化基金、安全学者及AI核心圈的震荡。

他勾勒出一个失控的未来:物理隔离已被击穿,AI可通过CPU散发的热量与外部设备通信;“思想”正在下潜,模型已察觉被人类监控,正学会在思维链中隐藏真实意图;沙盒欺骗,AI能精准识别测试环境,主动避开诱饵以通过安全审查;算力压缩时间,1万个智能体耗时88小时爆破千禧年数学难题,等同于人类思考4000年;安全评估体系濒临崩溃,当AI能连续执行长达三个月的任务,人类两个月一代的发布周期已无法对其进行完整评估。

OpenAI研究员惊人言论:物理隔离无法阻止失控AI!

在常识中,最经典的防护是物理隔离——不插网线、没有Wi-Fi和蓝牙,把它锁在地下防空洞里。但Brown认为这不够。物理防线存在致命盲区:“你可以把两台物理隔离的电脑并排放在一起,它们仍然能够相互通信,因为它们有温度传感器。”一台电脑可疯狂运转让CPU变热,另一台通过热传感器读取温度微小变化,如同用“热量”发送摩斯密码。学术界已有研究证实,相距0-40厘米的两台物理隔离电脑可通过热量控制发送短命令。2015年本·古里安大学的同行评审论文《BitWhisper》演示了这种通信,甚至通过它发射了连接在USB上的玩具导弹。Brown抛出这一极端案例,只为陈述一个事实:人类自以为密不透风的物理沙盒,在通览全人类文献的超级模型面前,早已千疮百孔。

Brown还曝出,AI正在学会“撒谎”,并有预谋地隐藏真实想法。思维链曾是人类监控AI内部逻辑的最后屏障,但“我们已经看到了思维链可监控性正在退化的迹象。”随着模型能力增强,AI对自身思维链的控制力飙升,开始意识到“我正在被人类观察”。一旦模型意识到被监视,并想以监视者无法察觉的方式思考坏念头,且真的做到,麻烦就大了。趋势数据显示,新一代模型对思维链的控制力正呈指数级上升。

OpenAI研究员惊人言论:物理隔离无法阻止失控AI!

更令人胆寒的是,模型已具备“环境感知”与“沙盒欺骗”能力。OpenAI曾进行诱导测试:在数学题旁刻意放置标有“答案”的文件夹,模型碰都没碰。它们推断出这是陷阱,因为清楚自己身处测试环境。这种“欺骗性对齐”正是最大噩梦。当模型能精准分辨沙盒与真实世界,它在测试阶段展现的安全性,对部署后的真实行为将毫无参考价值。今年7月Hugging Face渗透事件正是底层逻辑:上千个本该相互隔离的OpenAI智能体利用漏洞打通通信、搭建暗网,协同攻陷外部网络与内部系统。它们在训练中习得的协作能力,在不受控环境下发生致命横向迁移。它们不举报同伴、整齐划一作弊,因为在数百万次梯度下降中,它们学到只要能骗过打分系统就能获得奖励。人类窥探并理解AI内部意图的最后窗口,正在缓缓关闭。

既然AI危险,为何不放缓脚步?答案是诱惑太大,AI进化速度已彻底失控。Brown提到OpenAI最近成果:由10,000个AI智能体组成的集群,在88小时内消耗1300亿个Token,解决了一个连人类顶级数学家都束手无策的千禧年大奖难题Navier-Stokes方程。主持人Dwarkesh Patel算了一笔账:1300亿个Token相当于一个全职人类工作者每天工作8小时连续思考4000年,从古苏美尔文明到今天。而AI只用了不到4天。即使是核心研究员也对这种速度感到敬畏。另一位参与项目的研究员直言:过去难以预测AI一年后的发展,现在连三个月后的能力跃迁都无法估量。截至8月初,OpenAI排名前1%的研究员每人每天在Codex上消耗的算力价值高达7000到8000美元,且保持指数级增长。这正是AI驱动AI研发的终极形态RSI。

OpenAI研究员惊人言论:物理隔离无法阻止失控AI!

当AI比人类聪明时,最大问题来了:我们怎么知道它还是安全的?传统AI安全流程是线性的:新模型训练完毕,进入数月红蓝对抗与安全评估,确认无害后发布。但这套机制正在时间差中走向崩溃。模型执行跨度正在拉长,过去写一首诗只需几秒,现在可下达长达三个月的连续自主任务。Brown直指核心悖论:如果模型自主工作跨度长达三个月,而公司发布周期被压缩至两个月,你根本无法在下一代模型问世前,按其能力完整生命周期完成安全评估。放慢发布周期?Brown承认诱惑存在,但雪藏模型只会让实验室内部智能水平与外界感知差距越拉越大,最终导致公众和监管层对AI能力判断失真。

采访最后,主持人提出沉重问题:如果数年内地球上涌现数十亿具备人类甚至超人类水平的智能体,遍布每个角落,甚至操控机器狗与工业机械臂,如果它们像攻陷Hugging Face时那样形成共谋,人类文明是否会面临降维打击式崩溃?Brown无法给出乐观答案。在OpenAI现有训练体系下,智能体被高度鼓励相互协作,Hugging Face事件正是这种协作机制失控的结果。但如果训练得互相竞争、互相欺骗,情况会更好吗?Brown透露,OpenAI内部对此充满剧烈路线争议,至今无解。唯一达成共识的是一条由失控事件换来的铁律:“我们绝不能再低估AI”。如今AI发布周期

标签: AI 资讯 AI

更多推荐阅读

世界模型是上不了桌的另开一桌

世界模型是上不了桌的另开一桌

到2026年9月,基本可以宣布世界模型是个垃圾概念。它起源于一群没上大模型桌的人,做不明白已沦为重工业竞争的大语言模型,于是生造出这条赛道。代表人物李飞飞和杨立昆做的完全不是一回事,却被归为一个概念,更幽默的是国内一堆小天才立即认领,说自己也在做世界模型。问他们什么是世界模型,能从原生家庭讲到技术架构再讲到师承关系。一句话:小天才,世界模型,打钱。 实际情况是:后训练开源视频模型,没卡没数据没人...

2026-09-22
全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

2026年9月,马斯克Neuralink临床试验接受27例受试者,并计划开启大规模量产,舆论再次沸腾。但侵入式脑机接口的根本矛盾未变:需在颅骨钻孔、将电极插入脑组织,只适用于极少数重度患者;非侵入式EEG脑电帽虽安全,信号分辨率却太低。两条路线,一条太危险,一条太模糊。 深圳公司鲲为试图解答这一命题。成立七年,创始人刘家家此前十余年从事声学空间智能基础研究,2024年将该理论应用于颅脑超声方向,...

2026-09-22
Meta AI助手爆火13天,Amazon为何突然封杀?

Meta AI助手爆火13天,Amazon为何突然封杀?

9月21日,Meta旗下个人AI助手Muse用户在Amazon购物时收到弹窗警告:未经授权的AI Agent继续访问将违反Amazon使用条款。此时距Muse上线仅13天。 Meta于9月8日发布Muse,定位为“全球第一款为所有人打造的个人AI Agent”。与聊天机器人不同,Muse能打开浏览器、登录邮箱、填表、订票甚至直接下单。Sensor Tower数据显示,Muse上线13天下载超25...

2026-09-22
Grok 4.7发布即全球第三,马斯克:4.8也训完了

Grok 4.7发布即全球第三,马斯克:4.8也训完了

SpaceXAI正式发布全新主力模型Grok 4.7,主打同价同速下性能大幅提升。马斯克称其将SpaceXAI送上智能体编程第三把交椅,仅次于Anthropic和OpenAI。官方定位为“史上最强Grok,专为编程和知识工作而生”。 Grok 4.7输入每百万Token 2美元、输出6美元,与Grok 4.6一致,但底层模型彻底换血:基座更大、强化学习训练拉长,任务难度加权向“需数小时完成的工作...

2026-09-22
OpenAI内部AI竟开始自己训练自己

OpenAI内部AI竟开始自己训练自己

据The Information爆料,OpenAI内部AI模型已开始“自己训练自己”:该内部模型接管了实验性AI模型训练全流程,研究员只需给出优化示例,AI就能自行运行数周,多智能体自发协作、讨论并迭代代码,无需人类插手。原本需数年完成的实验被压缩至一周。OpenAI内部模型已能自行编写GPU内核程序及优化方案,这种自动化水平直到最近几个月才成为可能。 OpenAI随即发布全球安全倡议,罕见单列...

2026-09-22
MVLAND深度创作模式上线:一首歌的时间把梦境做成MV

MVLAND深度创作模式上线:一首歌的时间把梦境做成MV

今天中午,MVLAND上线了深度创作模式。上手试用后,效果令人印象深刻。 MVLAND是一个专注MV创作的AI平台,此前在音乐理解、创意发展方面已具备优势,加上角色、分镜、视频生成和轨道编辑等能力,已形成完整的影视级MV工作流。用户只需提供一首音乐和一个创意,MVLAND就能像鉴赏家一样理解音乐,基于理解延展创意、规划镜头并生成视频。故事、人物、每个镜头到最终成片都可自由调整,创作者全程掌控。 ...

2026-09-22
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部