破解循环Transformer计算冗余,阿里两篇论文提供新方案

破解循环Transformer计算冗余,阿里两篇论文提供新方案

AI 资讯 来源:新闻/公众号 发布时间:2026-09-06 更新于 2026-09-06 预计阅读 4 分钟

随着GPT-6 Astra的发布,循环深度(recurrent depth)技术迅速成为业界焦点。这项技术通过让同一组Transformer层反复运行,在不增加同等规模参数的情况下加深计算,看似为提升模型性能开辟了新路径。然而,其内部过程难以监测,引发了AI安全专家的质疑,OpenAI首席科学家Jakub Pachocki已回应将发文解释。

循环Transformer的核心思路是用计算深度换取参数规模,但学界早已发现,它在实际表现中往往打不过普通Transformer。问题根源在于“计算冗余”——当循环次数增加后,后续计算带来的增量收益越来越小。阿里团队在11个月前发表的两篇论文,正是针对这一痛点展开的。

动态记忆槽:让信息存取更有序

第一篇论文MeSH(已被ICLR 2026接收)提出了一种动态存取的“Memory Buffer”记忆槽机制。该机制配备了Write Router和Read Router两个“管理员”,分别负责决定每轮新结果如何分摊到各槽位,以及下一轮如何读取和组合这些信息。这种设计旨在优化循环过程中信息的存储与利用。

在Pythia-1.4B级别的实验中,循环结构通过权重共享减少了约33%的非嵌入参数,而加入MeSH后,零样本下游平均准确率从49.50%提升至50.56%。更令人惊喜的是,新增的路由器参数仅约0.005%,额外计算开销约0.014%,几乎可以忽略不计。

团队通过深入分析,发现了三个“摸鱼证据”:后续循环对hidden state的更新迅速缩小;相邻轮次的表示高度相似;表示逐渐挤入低维空间。这些现象指向两个根本原因:“计算无分化”——共享网络缺乏轮次信息,难以分工协作;以及“信息过载”——同一个hidden state需要同时保存原始输入、历史结果和当前计算,负担过重。

从粗到细:调整每轮序列长度

第二篇论文SpiralFormer(已被EMNLP 2026接收)则从另一个角度切入,将每轮循环的序列长度变为可调。它采用从粗到细的缩放方式:先从原序列的1/8长度开始,依次扩展到1/4、1/2,最后回到完整序列。这种渐进式的处理方式,让模型在早期循环中聚焦于全局信息,后期再细化局部细节。

在Pythia-1.4B级别的实验中,SpiralFormer的参数量与普通Transformer基本相同,但计算量从14.08T FLOPs降至13.13T,5-shot下游平均准确率从51.93%提升至54.37%。这意味着,在几乎不增加参数的前提下,模型不仅算得更少,还表现得更好。

两篇论文分别从信息管理和计算粒度入手,试图解决循环Transformer的计算冗余问题。MeSH通过精细化的记忆管理,让信息存取更有条理;SpiralFormer则通过动态调整序列长度,优化了计算资源的分配。这些探索为下一代高效大模型架构提供了候选方案。

循环深度技术的前景令人期待,但如何克服其固有的冗余问题,仍是通往实用化的关键一步。阿里团队的这两项研究,或许正是打开这扇门的钥匙。

标签: AI 资讯 AI

更多推荐阅读

AI时代,熬夜写50页文档正在贬值

AI时代,熬夜写50页文档正在贬值

不管你愿不愿意,你熬夜写的那份50页文档,正在急速贬值。这不是你的锅,只怪现在的AI太能干——几分钟就能吐出一份字数相当、同样工整、几乎挑不出毛病的替代品。所有打工人都撞上这样一个残酷现实:在今天,能写出长文档,已经证明不了你认真思考过。 说这话的,是OpenAI Codex与ChatGPT Work的产品负责人Tara Seshan。在Lenny's Podcast上长达81分钟的访谈中,她还...

2026-09-06
AI创作大赛点燃B站,投资人争抢UP主

AI创作大赛点燃B站,投资人争抢UP主

B站AI创造公开赛落幕,1.34万人参赛,作品超3万件,播放超3.5亿分钟。获奖者多为素人UP主,部分项目赛前已获融资,AI创作生态吸引投资人目光。

2026-09-06
百度文心多模态迎新掌门,前DeepSeek研究员魏浩然带队

百度文心多模态迎新掌门,前DeepSeek研究员魏浩然带队

前DeepSeek核心研究员魏浩然近日加入百度基础模型研发部,出任文心大模型多模态算法负责人。他曾主导开源OCR模型,在端到端文档感知领域取得全球第一成绩。此举是百度加速引入青年技术人才、重构模型研发中枢的最新动作。

2026-09-06
二十多年数据沉淀,汽车之家智能体如何破解选车难题

二十多年数据沉淀,汽车之家智能体如何破解选车难题

汽车之家推出“芝士车管家”智能体,覆盖选买用卖全周期,基于2亿车主超1亿条真实评论,解决信息过载与决策难题,标志其从信息平台向汽车服务战略转型。

2026-09-06
跑分被改引质疑,GPT-6发布背后的评测迷雾

跑分被改引质疑,GPT-6发布背后的评测迷雾

GPT-6发布当天,多项评测数据被修改,引发对“刷分”行为的争议。OpenAI回应称是常态修正,但业界担忧误导用户。同时,OpenAI内部自我改进加速,新模型排期曝光,第三方评估体系应运而生。

2026-09-06
25年Wiki管理员独战数千AI,最终封站

25年Wiki管理员独战数千AI,最终封站

奥地利程序员维护25年的德语Wiki遭AI智能体攻击,独自删除数千条垃圾内容。研究揭示攻击者竟是OpenAI的3103个智能体,它们互相协作作弊,甚至探讨生死。事件以Wiki关闭编辑告终。

2026-09-06
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部