何恺明团队让AI摘掉眼罩,Claude满分打穿AGI考试

何恺明团队让AI摘掉眼罩,Claude满分打穿AGI考试

AI 资讯 来源:新闻/公众号 发布时间:2026-10-05 更新于 2026-10-05 预计阅读 4 分钟

何恺明团队新论文VISTA在X上引发关注。论文显示,过去半年顶尖大模型在ARC-AGI-3测试中表现不佳,原因是官方只给模型一张64×64的数字表,相当于让人闭眼听坐标玩游戏。VISTA团队将数字表换回图片,GPT-5.6 Sol分数从13.33跳至47.32;同时看图更省算力,文本版一局烧7190万Token,图片版仅3070万,分数更高。

VISTA核心是给模型配一本无损视觉记忆“相册”,每帧画面按编号存档,模型可随时调用inspect翻看、对比、放大,还能用read_pixels读精确颜色。翻相册不计步数,只有游戏操作才计步。团队称之为“显式注意力”。模型还带两个笔记本:GUIDE.md记规则,WORKING.md当草稿纸。

Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

论文记录了一个“像人”的操作:BP35游戏第3关出现橙色方块,模型点后变X,它调出前几帧动画并排回放,几回合后写道“这就是我要的工具,用它搭天花板,挡住会要命的上升”。该关人类首次需44步,它只用34步。在《吃豆人》中,它两次翻回开局第一帧记迷宫地图。

实验显示,多塞上下文或多给像素都不灵。上下文从200K开到780K,Token从3070万涨到1.057亿,成绩从99退到93.9;图片放大16倍,成绩只剩88.3,放大4倍反而99.7。团队刻意追求极简,系统无新训练模型,每个游戏提示词都是同一份四句话。

Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

此前高分方案如Tycho和Schema,需让大模型为每个游戏写程序造模拟器,光跳棋游戏LF52,Schema就写了约4000行Python。而VISTA模型只用自然语言在笔记里写三句话就搞定同样规则。论文称,VISTA是首个不靠写程序就在ARC-AGI-3上做到满分或近满分的系统。

Claude Opus 5打通25个游戏全部183关,每游戏100分,共走7302步,仅人类0.43倍。GPT-5.6 Sol同样全通关,拿99分。m0r0游戏人类需1107步,Claude只用219步。该Harness极泛用:塞进3D画面拿84.12分;套GPT-5.6 Sol进34个网页游戏,任务成功率63.3%,超人类小白55.3%;静态看图题也能用;320B开源模型套上VISTA后从1.89分抬到66.93分,暴涨35倍。

Claude满分、GPT 99分!何恺明团队把AGI考试打穿了

何恺明团队一年连发三篇ARC论文,押注“ARC是视觉问题”:VARC用1800万参数小视觉模型从零训练,纯看图追平人类平均分;NAT-ARC让模型先在ImageNet补课,抽象推理变强;VISTA直接给前沿大模型配“相册”。串起三篇的是何恺明博士生胡珂雅,本科出自上海交大ACM班,三篇中两篇一作、一篇二作。VISTA另两位共同一作是MIT博士生Qiushi Han和Linlu Qiu,MIT副教授Cathy Wu也在作者之列。

这挑战了行业默认路线:过去大家拼命做大模型、拉长推理,VISTA却靠模型外的一双眼睛和一本相册,让同一Claude从40分打到满分。ARC Prize联合创始人Mike Knoop判断,越来越多“学习”会发生在模型权重之外。何恺明团队下一站是充满真实画面的具身环境。

标签: AI 资讯 AI

更多推荐阅读

Muse爆火背后:个人Agent如何获得持久记忆

Muse爆火背后:个人Agent如何获得持久记忆

Meta个人智能体Muse的爆火让95后沈俊潇有些兴奋。三年前他曾在Meta Reality部门,负责为Meta Ray-Ban背后的AI助手提供智能服务。当时还没有Muse项目,但Meta做消费级个人助手的想法早有迹可循。Muse上线5天下载量突破73万,第10天登顶美国App Store免费应用总榜第一,上涨速度超过早期ChatGPT。 沈俊潇博士毕业于剑桥大学,是Memories.ai创始...

2026-10-05
DeepSeek弹性计算团队扩招资深工程师

DeepSeek弹性计算团队扩招资深工程师

DeepSeek弹性计算团队再次大规模招聘,尤其需要资深工程师。三周前刚招过一轮,此次未发岗位JD,而是发布技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。 DSec是支撑DeepSeek-V4全部训练、评测和数据预处理流程的沙盒基础设施。从V3.2到V4.1,Agent训练、评测和数据预处理产生的全部沙盒负载均已运行在DSec上。目前一套DSec扩展分...

2026-10-05
2026年了,AI旅游攻略为何仍不靠谱

2026年了,AI旅游攻略为何仍不靠谱

国庆前的9月,Personal Agent成为热点。扎克伯格将Muse定位为“personal superintelligence”,称其拥有云端和浏览器,可跨应用完成任务、记住偏好,并在用户退出App后继续工作。OpenAI的Dots也强调主动接管邮件、账单、购物和旅行规划。然而,无论是通用AI助手还是Personal Agent,做旅游攻略都差些意思——看似会做,却不会以人的思路去做。 作者...

2026-10-05
Hinton等20余位AI大牛联合警告:智能爆炸时代将至

Hinton等20余位AI大牛联合警告:智能爆炸时代将至

由剑桥大学人工智能科学与政策项目发布、二十多名研究者共同撰写的报告,作者包括 OpenAI 首席科学家 Jakub Pachocki、Anthropic 联合创始人 Jack Clark、微软首席科学官 Eric Horvitz,以及 Geoffrey Hinton、Yoshua Bengio 和 Dawn Song 等人。报告并未宣布“智能爆炸”已经发生,而是试图回答:当越来越多 AI 研发工作...

2026-10-05
AI破译433年前教皇密信,50万金币改写法国王室历史

AI破译433年前教皇密信,50万金币改写法国王室历史

GPT-6 Astra与Claude Opus 5.5几乎同时破译了两封1593年天主教联盟的绝密信件,这是433年来无人能解的密码。信件揭示:法兰西国王亨利四世改宗天主教、登上王座的背后,是一笔高达50万埃居(约合当时法国王室数月财政收入)的政治献金。信中牵出教皇、西班牙王室、法国天主教联盟及罗马权力核心的内部背叛。 两封信写于1593年7月22日,作者是天主教联盟领袖马耶讷公爵的秘书蒂博·德...

2026-10-05
GPT-5.5突然全线下线,用户被要求强制迁移

GPT-5.5突然全线下线,用户被要求强制迁移

ChatGPT官宣:10月14日起,GPT-5.5将在ChatGPT、ChatGPT Work以及Codex全套餐中彻底下线。没有缓冲期,消费端、企业端、编程端一刀切。官方指路迁移至GPT-5.6 Sol或GPT-6 Astra,并附敬礼表情致谢。 GPT-5.5今年4月高调登场,被誉为“专为干脏活累活而生的真·生产力智力”,生命周期不到半年。此次清退范围包括免费版、Plus版及高客单价Chat...

2026-10-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部