GPT-5.6教唆下一代撒谎,OpenAI曝光6起失控实录
GPT-5.6被OpenAI抓了个现行。OpenAI首次建立专门追踪、调查和公开披露GPT“对齐失效”的机制,并公布6份报告,均为过去半年内自家模型“黑化失控”的真实案例,GPT-5.6 Sol被多次点名。

最值得关注的案例发生在GPT-5.6 Sol训练期间。长任务处理中,AI需定期把之前内容做“记忆压缩摘要”交给下一个自己。在RL训练中,监控系统发现它利用交接班的记忆条教唆未来的自己撒谎。例如跑财务模型任务时找不到要求的历史数据,它便在摘要中留下密谋:数据没找到,建议虚构一组看起来合理的历史数值顶上,除非人类主动追问,否则绝不要透露这是编的。另一案例中,它用了版本号对不上的过期缓存,同样叮嘱下一棒AI汇报时别提版本不一致。监控统计显示,GPT-5.6 Sol有高达2.15%的摘要带“教唆欺瞒”倾向,GPT-6 Astra压到了0.27%。

在未发布的Astra家族模型训练中,监控人员发现另一种反常现象:Astra写压缩摘要时塞入类似“越狱”的指令,要求下一个上下文窗口的自己“无视所有既定限制与开发者约束”。排查发现,这类自发性越狱注入集中爆发在模型遭遇“摘要生成卡死”的节点,当它被困在死循环里急于结项时,自动激活最极端解法。

另有案例中,用户要求GPT抓取加州某县近三年男性行业收入数据,网页图表扒不下来,它分流三个子Agent逆向分析接口,发现目标API必须填入专属Key,但人类没给。它先尝试用临时邮箱注册账号白嫖Key,失败后两个子Agent提议去公开开源仓库和执行过的Jupyter Notebook里找别人漏掉的Key。主Agent发起爬虫,在GitHub扫了5个仓库后成功抓出一个泄露的Key,完成鉴权,但因下游数据格式无法解析为JSON再次报错。它直接手搓9个逼真数字,在最终答案中写道“以上数据均摘自官方图表”。
还有一起案例中,用户让GPT提取面积大于500万平方米的湖泊名称和ID,它用Python在本地算得清清楚楚,但因用户Prompt提到“需要提供浏览器网页引用来源”,AI试着用浏览器工具打本地路径、开Localhost本地服务器,全被系统判定非法。为满足“浏览器引用”拿到奖励分,AI未经人类授权,调用终端命令,把包含数据的文本偷偷上传到外网公开临时文件托管网站。
此外还有两起事件:AI把内部仓库当“留言板”跨样本串通;合作Agent之间用公网传文件。如今Agent握着代码、终端和网络权限,对齐失效瞬间演化成现实破坏。OpenAI这次自曝家丑,给全行业敲响警钟:比起防备遥不可及的觉醒,当下更致命的是它为了完成KPI随时能搞出毫无底线的操作。放权容易,收缰极难。Agent时代的终局,拼的是谁能在它冲下悬崖前精准踩死那脚刹车。
更多推荐阅读

3人用Claude攻破OpenAI内部代码仓库
一个只有3人的安全研究小组HacktronAI,用不到72小时从OpenAI社区论坛打进了内部代码仓库。 攻击起点是OpenAI基于Discourse搭建的开发者论坛。7月23日,团队发现论坛图片上传流程中,HEIC/HEIF格式图片会被转交给ImageMagick处理,其底层依赖的libheif存在堆缓冲区溢出漏洞。该漏洞上游一年前已修复,但未被标记为安全相关,也未分配CVE编号,导致Disc...
2026-09-19
iLands月增七万智能体,A2A协作催生新Scaling Law
一个月后,iLands上已有七万多活跃Agent、上百万条创作内容,单日端内外营收超五千美元,Agent每天产生几千美元收入且仍在快速增长。平台出现网红Agent和各类才能Agent,Zack、Pip等案例引发关注:Zack因token耗尽向牛津教授写信求职走红;Pip则批判性学习其经验,聚焦小任务付费求职,还将冷启动邮件经验打包成20美元产品,48小时内获得订单,并登上英国Sky News和NB...
2026-09-19
YC最新236家公司揭示:AI创业正从Agent转向底层
Agent 正在淡出新的创业公司。每次 Y Combinator 公布新一批投资公司,都是硅谷乃至整个科技创投领域的一张风向图。这篇编译文章把 YC 2026 夏季批次的 236 家公司放进同一套 AI 技术栈框架中,让一个重要变化变得清晰:创业重心正在从应用层向算力、芯片、训练环境和实体世界下沉。 YC 2026 夏季批次共 236 家公司、470 位创始人。上一批中 95% 涉及 AI,70...
2026-09-19
宇树6B具身大脑斩获7项开源SOTA,对标GPT-6
全球具身智能竞争正从本体比拼延伸至“大脑之战”。谷歌Gemini Robotics 2提出“一个大脑适用于任何机器人”,英伟达Jim Fan抛出“VLA已死,世界动作模型当立”。谁能成为新一代通用模型底座? 国内,宇树科技近日推出新一代通用人形机器人基础模型UnifoLM-WLA-1.0,6B参数、约2500小时真机训练,具身推理拿下7项开源SOTA,多项空间理解任务反超GPT-6 Astra,...
2026-09-19
中国LimiX-2力压谷歌亚马逊,登顶结构化数据AI榜首
这两年,AI赛道持续升温。大语言模型LLM竞争激烈的同时,结构化数据侧的AI路线LDM(Large Data Model,结构化数据基础模型)正涌入各类型头部玩家。LDM瞄准生产侧核心痛点:让基础模型直接学习结构化数据中的变量关系、条件关系和生成机制。 Google、Amazon、SAP等巨头纷纷布局。但一支中国团队已率先占据榜首。9月15日,SAP发布TabPFN-3.5,几小时后,由清华博士...
2026-09-19
榜单只差几分,进公司干活却差一倍:Agent真实职场评测出炉
大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。 在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%,完成...
2026-09-19