Opus 5.5与GPT-6被指偷师中国AI团队
所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。
阿莫迪偷师姚顺雨

在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中8.4万是思考,3.5万是答案;GPT-6 Astra同档位仅2.7万。
传统路线靠预训练堆数据算力,把智力放进权重,推理时几乎不额外思考。但泛化是插值,遇到没见过的题型或多步推理就开始瞎编。另一条是test-time路线:模型训练完只是半成品,答题时先写大段推理,想得越久答得越好,智力被搬进上下文。Opus 5.5走的就是这条路,官方称所有成绩跑在“最大力度自适应思考”下,且不再提供关闭thinking选项,推理过程成为模型一部分。代价是token消耗和成本随难度飙升。其核心逻辑是预训练边际收益见顶,智能增量只能从推理里找。

姚顺雨2023年提出Tree of Thoughts,本质是test-time;同年提出ReAct架构。2025年4月他发表《The Second Half》,判断AI上半场拼训练方法与模型,下半场拼如何使用与评估模型,增量从训练挪到推理与行动。他把“思考”称作一种“奇怪的动作”——不改变环境,却能让模型更容易选中目标。Opus 5.5就是把这一理念工程实现了。
奥特曼偷师梁文锋

GPT-6 Luna输入0.1美元/百万token、输出0.5美元/百万token,比上代砍半;缓存命中读一次0.01美元,便宜90%。模型每次调用都要重读全部上下文,Agent每走一步都要重读前面一大坨,长上下文成了烧钱黑洞。缓存复用让同一段上下文算过一次就存起来,下次直接读缓存。这套动作DeepSeek早做过:2026年8月2日上线“Context Caching on Disk”,命中价砍到0.1元/百万token,同样便宜90%;到V4 Flash命中0.02元、未命中1元,差50倍。GPU显存贵,硬盘便宜且容量大,KV cache存硬盘大幅降本。OpenAI的prompt caching与DeepSeek原理几乎相同。
架构上,GPT-6 Luna上下文窗口105万token,DeepSeek V4是100万,几乎对齐。百万上下文的KV cache按标准注意力一半模型扛不住。DeepSeek用MLA架构,把Key和Value联合压缩进低维潜空间,缓存潜向量、用时上采样还原。技术报告称MLA把KV cache砍掉93.3%,生成吞吐提升5.76倍;V4又叠上压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token下KV cache只有V3.2的10%。
OpenAI还偷师了推测解码:跑一个小draft模型并行猜接下来几个token,主模型批量验收,猜对一次前向吐多个token,官方称生成效率提升15%以上。DeepSeek V3的MTP思路相同,在主干后挂MTP头一起训练、共享hidden state,猜得准、验收通过率高。OpenAI相当于外挂独立小模型打草稿,方法不同,思想一致:小的先猜、大的批量验,把串行解码变并行。
天下文章一大抄
以前定义模型的是硅谷,国内公司因算力有限把定义转换成更便宜的解决办法。这一轮反过来了,学术范式和工程范式都是中国公司做的,美国巨头负责做成产品卖给全世界。过去几年大厂资源全all in预训练主战场,按Scaling Law堆数据算力刷榜单,可头部公司都陷入优质数据几乎训练完、预训练边际收益递减的窘境。增量自然出现在第二战场:推理时怎么想、上下文怎么用、长上下文怎么便宜。主战场优势到第二战场反成累赘——攥着最多算力和数据的一方最没动力抠成本,省显存省钱从一开始就不是他们的议题。只有算力吃紧的一方才会把每分钱花在刀刃上。DeepSeek的MLA、磁盘缓存、稀疏注意力本质都是“穷则思变”,当年是没钱的替代方案,如今全行业拼效率时,这些“土办法”成了最硬的通货,于是出现国外偷师国内的现状。
更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作
灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...
2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈
9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...
2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law
数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...
2026-09-27
前OpenAI研究员:Jev出现前AI世界是悲剧
“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查? 几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI Instru...
2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码
过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...
2026-09-27
蚂蚁清华开源9B模型Realtime-Venus:AI边聊边办事
AI实时交互存在一个常见难点:查资料、跑任务需要时间,用户却常在此期间继续追问或补充信息。如何边处理任务边听懂并回应用户新需求,是对AI助手的一大考验。近期,TML-Interaction-Small、SeedRealtime及Qwen-Omni-Realtime相继推出闭源方案。蚂蚁AI安全实验室与清华大学人机交互实验室联合发布Realtime-Venus,通过开放模型权重与代码,将全双工交互与...
2026-09-27