GPT-6上线后,鹈鹕骑车测试为何突然爆火

GPT-6上线后,鹈鹕骑车测试为何突然爆火

AI 资讯 来源:新闻/公众号 发布时间:2026-09-30 更新于 2026-09-30 预计阅读 6 分钟

开源项目CodexRadar发起人Lambda在GPT-6 Astra发布后,收到大量“鹈鹕骑单车”视频,于是在社区发起“鹈鹕杯”比赛,参赛者围绕“画一只骑自行车的鹈鹕”用模型生成作品。9月14日上午,比赛页面PV达7000多。

每次新模型上线,都有人用鹈鹕骑自行车测试模型能力。这个任务简单直观,能一眼看出腿和踏板是否对位、车轮是否跟着动、动作是否穿帮、前后是否一致;同时又足够复杂,涉及动作理解、时序一致性、空间关系、代码组织和连续执行能力,适合做Agent阶段模型的“体感温度计”。GPT-6 Astra上线后鹈鹕更火,原因是最先进模型的“智商”不稳定,而鹈鹕能把这种难以量化的体感变得直观。

一只鹈鹕成了Agent时代的大明星|亮马桥小纪严选

鹈鹕杯分两个赛道。Classic赛道使用统一提示词“创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画”。模型状态正常时,GPT-6 Astra生成的鹈鹕通常保持相对一致的质量和画面结构;若某天大量用户发现同一提示词下鹈鹕频繁踩空、车轮关系错乱、结构跑偏,“降智”讨论就会迅速出现。这虽非严格科学benchmark,但适合观察短时间内的体感变化。Open赛道不设统一提示词,参与者自由发挥,其中一个作品做成30分钟“一镜到底”骑行故事,共享一条1800秒时间轴和同一位骑手,地面、山川、城市、星球、车轮、羽毛和粒子全部由SVG元素组成,JavaScript只负责计算位置、关节和时间,未使用Canvas、图片、视频、外部字体或额外大模型接口。镜头可连续平移、拉远和靠近,屏幕外区域暂停绘制,拖动进度条后物件直接恢复到对应时间点。车轮转动和脚蹬相位由行驶距离驱动,人物停下后不会出现脚原地空蹬。作品前20分钟穿过30个城市和自然景点,后10分钟进入宇宙,从火星到太阳、冥王星、黑洞再回到地球,并注明哪些内容来自现实、哪些属于虚构。

CodexRadar最初是发起人想解决自己的问题:模型今天有没有变笨、是否影响工作质量,以及监测额度重置。后来做成社区开源项目,吸引一批重度Codex用户参与众测。“众测雷达”设置112道真实开源编程题,由用户跑题、上传结果,服务器在干净环境中重新验证。官网显示参与志愿者已超500人,累计贡献达百亿级Token。模型能力波动正成为重度用户共同痛点。一位大模型算法工程师表示,降智会直接影响自动化任务,GPT-6降智加限流会导致自动化任务积累、并发冲突,工单会话降智还可能通过中枢传播,最后把整个仓库搞坏。进入Agent阶段后,一次模型调用往往只是任务链一环,某一步判断偏差可能使后续步骤沿错误结果推进,任务越长风险越明显。

一只鹈鹕成了Agent时代的大明星|亮马桥小纪严选

Astra发布时,OpenAI把Computer Use、专业工作、软件工程和长程Agent任务放在重要位置。多位开发者表示“Astra是有代差的强”。从雷达数据看,Astra解题所需步骤比前代少一半。也正因如此,用户希望把更复杂、更长程的自动化任务交给它,降智影响就更大。

“降智”是社区说法,用户看到的结果由底层模型、推理强度、上下文管理、Harness、Skills、工具调用、模型路由、并发调度和服务容量等多层共同决定,感受到“变笨”不一定意味着模型权重变化。比如Coding Agent原来主动跑三轮测试,现在只跑一轮;原来调用多个子Agent检查,现在减少并行探索;原来保留更完整上下文,现在长任务丢失早期信息。对后台而言可能对应完全不同的问题,对用户而言体感都是没以前聪明。CodexRadar出现,是因为发布时benchmark分数能看出峰值能力,却很难看出实时状态,而对用Agent真正工作的人来说,实时状态十分重要。

一只鹈鹕成了Agent时代的大明星|亮马桥小纪严选

目前没有公开证据证明OpenAI在大规模主动把Astra替换成更弱底模,但供给压力已有明确信号。9月10日,OpenAI暂停每月200美元Pro 20x套餐新订阅和升级,现有用户暂不受影响。该套餐提供约为Plus 20倍使用额度,是重度Codex用户重要选择。Astra API标准价格为每百万输入Token 10美元、输出Token 50美元,Fast mode价格再翻一倍。其最受欢迎的能力恰好很烧算力:Computer Use需持续理解屏幕、执行操作、观察结果;多Agent工作流可能同时启动多个子任务;Coding Agent一次完整任务会不断读取文件、执行代码、运行测试、回看结果。大量重度用户同时使用,供给压力已非过去量级。这轮讨论混合了模型质量波动、限流、资源调度,以及长任务对系统稳定性的放大。OpenAI暂停20x新增订阅,至少证明前沿模型出现真实供需矛盾。过去竞争集中在谁能训练出更强模型,现在能否稳定把智能供应给大量用户也成为竞争一部分。

一只鹈鹕成为Agent时代明星,说明用户在主动监控“智能”本身:不同时间段任务成功率、长任务稳定性、同一workflow能否持续复现,可理解为一种新的“智力SLA”。模型越强,问题越突出,未来模型公司竞争会从峰值能力延伸到把高水平智能长期、稳定、规模化供应出去。模型能不能每天都一样聪明,也成为AI Agent真正走向工作场景的卡点。

标签: AI 资讯 AI

更多推荐阅读

Manus 2.0发布:AI应用只剩三件事

Manus 2.0发布:AI应用只剩三件事

昨夜,Manus发布2.0版本,堪称超级全家桶。技术层面推出新agent架构Cascade、云电脑和自动化;面向工作创作场景的Manus Studio支持剪视频、生视频、做在线多人游戏、远程遥控电脑;以及One More Thing:Cue。 我第一时间上手试了Cue。先连接Gmail、GitHub、Notion、Instagram、Oura等账号,补充Codex记忆备份和几条即刻,构成较完整的...

2026-09-30
Opus 5.5代码直出MV,马斯克连转惊呼AGI

Opus 5.5代码直出MV,马斯克连转惊呼AGI

Opus 5.5代码直出音乐MV火了。马斯克多次转发,并给出“嚯!”“史诗级!”“这次我真切感受到了AGI”等评价。 这些MV中,人物、歌词、拼贴、颗粒和转场贴着节拍轮番轰炸。两分钟速通《谷歌来时路》,动画越切越快,配乐越顶越燃。另一支纪念乔布斯的MV,从车库创业拍到改变个人计算,23种转场踩着120 BPM配乐,被剪成一部硅谷英雄片。还有博主把2011年录的木吉他老歌用Suno重编成Techn...

2026-09-30
反超Seedance 2.0!RunningHub增强版H3一秒仅一毛

反超Seedance 2.0!RunningHub增强版H3一秒仅一毛

7月底MiniMax H3开源时,Artificial Analysis视频编辑榜Elo 1130分,直冲全球第一。但量产场景下短板明显:多镜头一长角色走样,商品多拍几组轮廓不准,十几个镜头连跑后面越来越不像同一部片子。从“跑得通”到“生产能用”,差的是工程。 9月29日,RunningHub发布H3 RH Enhanced,基于MiniMax H3开源基座做深度后训练的增强模型。Running...

2026-09-30
AI写算子让Kimi K3推理快3倍,TPU反超英伟达

AI写算子让Kimi K3推理快3倍,TPU反超英伟达

上一周,vLLM原班人马创办的Inferact开源了TPU Megakernels,把Kimi K3的92个MoE层写进同一个程序,在16颗谷歌TPU v7上运行:开启投机解码,单用户输出达709 tokens/s;同样16块英伟达GB200用vLLM跑为452 tokens/s。关闭投机解码,在1到8并发下,它也是GB200的1.4到2倍。而TPU v7显存带宽7380GB/s,还低于GB200...

2026-09-30
10个Claude通宵15小时,证明122年物理数学难题

10个Claude通宵15小时,证明122年物理数学难题

球面上的7个电子,难住了人类数百年。今天,10个Claude Sonnet 5.5通宵15小时,互发1270条消息,写出17895行Lean代码,完成了汤姆逊问题N=7的证明。没有人类介入,没有预设分工,10个Claude自己建群、讨论、选算法、合并代码。证明通过了Lean内核和独立内核nanoda的双重验证,改一个整数,nanoda立刻报错。 1904年,J.J.汤姆逊提出“葡萄干布丁”原子模...

2026-09-30
GPT-6.1 Sol深夜突袭:1/5价格逼近Astra

GPT-6.1 Sol深夜突袭:1/5价格逼近Astra

在OpenAI开发者大会上,GPT-6.1 Sol突袭上线,并已接入Codex和ChatGPT Work。据称原定的GPT-6.1因对齐回归问题被紧急暂停,OpenAI转而推出这款“干活特化版”。官方口号是“以五分之一的价格,获得接近Astra的智能水平”。 价格方面,GPT-6.1 Sol的API标准价为输入2美元/百万Token、输出10美元/百万Token,恰好是GPT-6 Astra(输...

2026-09-30
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部