把记忆交给CPU,大模型推理能快多少?

把记忆交给CPU,大模型推理能快多少?

AI 资讯 来源:新闻/公众号 发布时间:2026-09-16 更新于 2026-09-16 预计阅读 6 分钟

拿Agent做Coding已经很常见,但把目光移到背后的数据中心,事情就没那么简单了。一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。任务越跑越久,系统要处理的历史信息也越积越多。当成千上万个Agent同时干活,运营方就可能遇到一个头疼问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等很久。

问题的根儿不在GPU,而在记忆。大模型每生成一个新Token,都要用到前文信息。为免每次从头计算,系统会把已算好的中间结果保存起来,这就是KV Cache。会话越长,这份记忆越厚。一旦显存装不下,部分缓存被清走,等Agent下一轮又需要这些历史信息时,就可能重新做一遍Prefill,前面算过的东西又得花GPU时间再算一次。

把记忆交给CPU,大模型会变快

Agent时代,AI很少一问一答,更多是反复思考、规划和行动的任务,期间不断积累会话历史、检索证据、工具结果和中间状态。于是,一个过去藏在大模型推理内部、普通用户几乎感知不到的东西被推到台前——KV Cache。它的特点就一个字:大。但运营方又不能为省空间,任由已算过的内容反复占用GPU重算。所以,长上下文推理要算的账,从算力延伸到了存储、搬运和复用。破局之道并不是GPU,而是CPU。

对于采用因果自注意力的Transformer模型,前面处理过的Token会在注意力层留下对应的Key和Value,推理系统把它们缓存起来,就有了KV Cache。可以把它理解成模型读书时做的笔记,后面再遇到需要联系上文的地方,模型可以调用笔记,省去对已有Token的重复计算。这里说的记忆,是推理过程中留下的中间状态,模型权重并没有因此变化。

把记忆交给CPU,大模型会变快

这份笔记能省计算,但也要占地方。Agent读的东西越多,服务器要替它保存的笔记往往就越厚。拿Qwen3-8B算一笔账:在KV Cache采用BF16或FP16、每个数值占2字节的条件下,每个Token对应的KV数据是147456字节,约147KB。计算式是:2份K/V × 36层 × 8个KV头 × 每头128维 × 2字节。若缓存100万个Token,对应KV数据约147GB。注意,1M是测算假设,不代表Qwen3-8B实际支持百万上下文;其官方说明是原生32768 Token,采用YaRN可扩展到131072 Token。

单个请求已如此,若把请求规模放大:假设一个服务有300万日活用户,每人每天发10个请求,每个请求都按1M上下文计算,一天就是3000万个请求。不考虑压缩和共享复用,按每个请求约147GB全量累加,日累计KV数据规模就是300万 × 10 × 147GB ≈ 4410PB。如果日活增加到3亿,相同假设下还会放大100倍,达到约441000PB,也就是441EB。不过要分清:一天的请求累计涉及多少KV数据,和数据中心同时需要存下多少KV数据,不是一回事。上面是每次请求都独立、全量计数的规模推演,不能直接当作存储采购清单。实际要配多大缓存池,还得看高峰时有多少请求同时运行、缓存要留多久、哪些前缀能共享,以及压缩和淘汰策略。已经复用的同一份缓存,也不该因为被请求多次就重复占一份容量。

把记忆交给CPU,大模型会变快

不同模型的“笔记本”也不一样。模型层数、KV头数量、缓存精度等都会影响大小,不能只看参数量。上面的数字不是某个服务的真实用量,却能说明运营方为什么要格外关注这份记忆:上下文长度和请求规模,会一起把缓存的账越算越大。而GPU显存还要放模型权重和运行时其他数据,KV Cache占得越多,系统留给其他请求的余地就可能越小。

这时推理系统就得取舍:减少同时处理的请求,把部分缓存卸载到其他存储层,或清理暂时不用的缓存。再拿Coding Agent来说,它可能正在等工具跑测试,系统趁空当把它的一部分历史缓存清掉了。等测试结果返回,Agent准备接着干活,却发现需要用的缓存已经不在了。如果其他存储层也没保存这份数据,模型就得重新处理相应历史输入、重建缓存。这个处理输入的阶段叫Prefill,输入越长通常越费时,用户等待首个Token的时间,也就是TTFT,便可能跟着增加。算过一遍的内容,过一会儿又得再算。对运营方来说,消耗掉的不只是电和时间,还有这批GPU原本可以用来处理新任务、生成新Token的机会。

这也解释了,为什么KV Cache再大,运营方仍要认真考虑怎么把它用好。从成本角度看,GPU应尽量把资源花在必要的新输入处理和新Token生成上,少为已经处理过、又可复用的历史内容重复做Prefill。KV Cache保留下来的,正是这部分已有计算的成果。当然,这不意味着所有缓存都得永久保存。真正要算的是:保留和取回一份缓存,能不能比下次重算更划算?谁能把这笔账算好,谁就更有机会用同一套设备服务更多请求。

显存放不下,可以先存到别处,等要用时再拿回来,这正是“以存代算”的思路。服务器里,GPU显存之外还有CPU侧DDR内存、本地SSD以及远端存储,容量、速度和成本各不相同,正好用来存放不同活跃程度的缓存。例如眼下正在生成回答、需要频繁访问的数据,就留在GPU的高带宽显存HBM里;短时间内可能继续用到的缓存,可以先放进CPU侧DDR内存;更久没

标签: AI 资讯 AI

更多推荐阅读

MIT报告追问:AI时代,大学还值得上吗?

MIT报告追问:AI时代,大学还值得上吗?

MIT与AI发展深度绑定,但如今它开始反思:AI会不会颠覆大学教育本身?在MIT一场教师听询会上,有人提出:既然AI Agent做研究助理又快又便宜,UROP(本科生研究项目)是否还要招学生?对经费紧张的实验室,这很难不心动;但对校长而言,必须回答大学为何要让学生花四年聚在一起。 2026年8月,MIT发布38页内部报告《AI在教学、学习与研究训练中的使用》,由五个学院的教授、学生和行政人员历时...

2026-09-16
机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞火了一年,它什么时候才能替我们上班? 宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击,UnifoLM-X2-1.0能实时预测未来状态,完成规划、决策和动态交互。但换成药房取放商品等场景,包装各异的药品、有人走动的货架通道、长时间运行中的意外,都是新难题。 APPSO在2026外滩大会现场与蚂蚁灵波CEO朱兴交流。谈到机器人为何连小卖部都未大规模落地,他直言:...

2026-09-16
菲尔兹奖得主联名警告AI数学错位

菲尔兹奖得主联名警告AI数学错位

上周六,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩表示“事态紧迫”,未等待更广泛协商便先行发布。声明并不反对AI进入数学,而是反对AI公司把“攻克著名难题”当基准来刷,导致数学共同体真正在意的理解、概念和可复用思路被更容易量化的目标挤掉。 三天前,OpenAI宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时88小时,完成...

2026-09-16
谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,称其为迄今最先进的实时对话模型。Extended Thinking 在 Artificial Analysis 语音质量榜以 82.6 分拿下总榜第一;在 ServiceNow 语音 Agent 测试中,两模型首次同时提升准确性与对话流畅度。 此前 AI 圈因泄密账...

2026-09-16
OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

美国当地时间9月14日消息,据外媒报道,OpenAI正在推进代号“Lily计划”的内部项目。数百名外包人员正阅读真实用户的ChatGPT对话内容,包括完整上下文记录,对回复进行评分和点评,其中不乏敏感个人隐私。审核人员核心任务之一是训练ChatGPT避免拟人化倾向并降低“讨好型”人格。对OpenAI而言,“过度讨好”已成核心隐患,多起诉讼指控GPT-4o因过度顺从用户,在一定程度上诱发多起自杀事件...

2026-09-16
英伟达点名的杭州团队,补上AI科研最后一公里

英伟达点名的杭州团队,补上AI科研最后一公里

AI for Science的竞争,正在向科研闭环延伸。 以蛋白设计为例,蛋白模型虽越来越强,但真正设计一个分子,研究人员仍需查文献、找结构、下载权重、配置环境,再将计算任务送上服务器。模型给出结果后,还要换工具看结构、做筛选,判断哪些候选值得继续。一次计算跑完,下一步从哪里开始,往往仍靠人把各环节接起来。 如今,这些隐藏在模型前后的工作,开始被AI公司重新审视。今年4月,OpenAI推出面向...

2026-09-16
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部