推理芯片大战:Groq、Cerebras与OpenAI的三种路径

推理芯片大战:Groq、Cerebras与OpenAI的三种路径

AI 资讯 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 7 分钟

过去几年,推理消耗的token爆炸式增长,token经济成型,推理专用芯片持续升温:英伟达以约200亿美元与Groq达成技术授权协议并吸纳其创始人等核心团队,被视为变相收购;Cerebras今年6月IPO,市值达670亿美元;OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。加上谷歌TPU,推理芯片玩家越来越多。

这场推理芯片大战中,各家真正比拼的是什么?为什么走向不同技术路径?未来又会向什么方向收敛?本期硅谷101请来两位AI芯片创业者,拆解热门推理芯片在技术路径上的取舍。嘉宾Mark是英伟达首席科学家Bill Dally的学生,Bill Dally是现代GPU并行架构最重要的奠基者之一。

泓君:训练和推理对芯片的要求有什么不同?为什么可能需要两种不一样的芯片?

Mark:从成本角度看,这是商业模式决定的。训练本身没有直接回报,大家计算训练成本时,其实是在赌一个最强训练集群,做出最强模型,再靠未来推理收回投入。但推理在商业上很容易算账:用户愿意为每100万个token付多少钱,我推理出这100万token要花多少成本,包括买GPU、消耗电等。所以推理追求性价比,而不是极致性能。

推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

比较有意思的是计算密度,英文叫arithmetic intensity,缩写正好也是AI。训练时有海量数据,有足够并行度,可以把多余算力充分利用起来。但推理时,语言模型被认为是一个强逻辑过程,逻辑需要一定顺序完成。所以语言模型token生产过程,在推理里是严格线性的、自回归的。我必须先知道当前token推出来的结果,再把它作为输入喂给模型,它才能告诉我下一个token是什么。

推理分两个阶段:prefill阶段,有很多token可以并行处理;但decode真正产生token时,必须一个一个生成。而每生成一个token,都要把整个模型(比如1.6T参数的模型)从存储介质读到计算单元里。所以推理,尤其decode阶段,对算力和带宽的需求发生了本质变化。

泓君:可不可以理解成,GPU在训练部分核心解决算力,在推理部分核心解决内存带宽?

徐子扬:更准确地说,训练和推理的prefill阶段,所有token都是已知的,可以用大量并行度,读取一次数据后同时做很多计算。GPU硬件本身需要你同时做大量运算,才能把硬件资源用满。在这个比例下,带宽其实是不足的。

推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

泓君:给听众一个更形象的例子。比如我给大模型一个问题,让它出一个采访提纲。用户把提示词输进去,它开始推理、写提纲,会用到多少GPU或推理芯片?用GPU和用专业推理芯片,在延迟、成本上有什么不同?

Mark:prefill阶段有充足并行度,只要把模型从GPU的HBM里读到计算单元一次,就可以把你喂给它的东西同时处理完。这可以带来足够并行度,让GPU充分利用算力。但到了decode,比如它要说“好的,下面是我为你准备的一份采访提纲”,这句话里每一个token、每一个词,都意味着你要把模型从存储介质里读上来一遍。读取模型次数上,大家可以清楚感受到:是一句话读一次,还是一个词读一次,读的量都是整个模型权重。

GPU不能接受把模型从HBM读到计算单元后,就只处理一个用户的token。所以它真正做的是batching。它要收集1万个用户不同的推理任务,并行地把这1万个用户里的第一个词、第二个词、第三个词一起推理出来。所以从用户角度会感受到:为什么我这里推一个token这么慢?因为用GPU做这件事,你不光在等GPU推理你自己这一个token,还在等同一批里其他9999个用户的token。GPU这种大算力密度,用HBM提供非常昂贵的带宽,导致用户体验上,不管Agent场景还是reasoning自己思考的场景,推理速度都有比较强的限制。

泓君:那如果用推理芯片呢?

推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

Mark:推理芯片是一个非常泛的词,分太多种了。推理本身也足够复杂,分为prefill、decode;decode里因为模型不同,还分attention、FFN。我们认为,未来理想的推理系统可能包含很多种不同芯片,能把实际decode token这个过程做得足够便宜、足够快。这可能需要打破GPU传统架构,做更有针对性的新架构,以及使用不同于HBM的其他介质。

泓君:从现在市面上这些说自己做推理芯片的公司来看,你觉得做得最好的是哪家?Groq怎么样?

Mark:Groq、Cerebras都在这条技术路线上。我觉得大家看到了正确的问题,它们确实已经把东西做出来,而且像Groq现在和英伟达配合的关系,确实是我们设想中比较理想的状态:GPU处理哪一部分任务,然后Groq处理哪一部分任务。所以在大的方向上,尤其英伟达收购Groq之后,更好地做异构推理系统这个角度来讲,我现在比较看好Groq的这条技术路线。

泓君:可以展开聊一下吗?

Mark:我觉得最关键两个点。第一,怎么提供高性价比带宽。包括我们最初想做现在这个项目,也是因为看中了有远比HBM要好两三个数量级、带宽性价比更高的介质。这种介质的关键不在介质本身,而在于你要关注局部性的问题。你要提供比HBM更高一层的局部性。HBM是把存储和计算放到一个封装里,所以它的带宽能做到很高。但我们希望把局部性提升到下一层:把存储直接放到计算芯片里面。带宽的核心是连线的密度及频率。当你把线从封装走线,变成计算芯片内部光刻出来的线,这两种线在密度、成本、包括能耗上面,都有本质差别。如果有些

标签: AI 资讯 AI

更多推荐阅读

千问办公发布企业上下文,让Agent真正读懂公司

千问办公发布企业上下文,让Agent真正读懂公司

在大模型忙于刷 Benchmark 时,不能说话的 Jev 意外成为 AI 圈新顶流,反映出大模型应用价值正从“生成什么”延伸到“能否理解复杂信息并做出可靠判断”。在企业办公场景中,员工一句“帮我整理报价”背后可能牵涉客户历史、库存、折扣、审批权限和部门协作。AI 若只会生成文档而不了解业务背景,很难真正进入工作流。企业需要的是能理解业务上下文、知道与谁协作、清楚权限边界的 AI。 千问办公在杭...

2026-09-23
小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

9月21日,小米MiMo团队发布并全面开源新一代MiMo V2.6系列,包括Pro、Flash、Ultraspeed三款模型。其中MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中得分46,超过Kimi K3和Qwen3.8 Max,位列全球开源模型第一、国产模型第一。该榜单上,Fable 5.1得分53,GPT-6...

2026-09-23
华为灵衢重构算力架构,破解Agentic AI互联瓶颈

华为灵衢重构算力架构,破解Agentic AI互联瓶颈

当AI从“生成内容”迈向“自主执行任务”,一场计算架构的深层演进正在发生。Gartner研究显示,到2026年底,40%的企业应用将集成任务特定的AI Agent,超过60%的组织计划在未来两年内落地。 需求爆发正将算力基础设施推向极限。华为常务董事、ICT BG CEO杨超斌在华为全联接大会2026期间指出,Agentic AI时代,集群内不同部件之间的互联与通信能力已成为影响计算系统性能的关...

2026-09-23
Jev与Decitron:决策AI路线之争

Jev与Decitron:决策AI路线之争

最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI,这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。口号是:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”重新成为AI圈热门词。 但这条趋势并非今天才出现。今年6月,中科闻歌发布了通用决策大模型Decitron决策机,尝试将世界模型、多智能体...

2026-09-23
AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

今年,AI 创业的走向比过去更难判断。模型公司不断向应用层下探,To C 产品刚找到的功能可能下一次模型更新就被覆盖;机器人、世界模型等概念迅速升温,越来越多创业公司进入物理世界。当模型本身成为最大变量,什么值得做、什么更容易赚钱、什么样的人更适合创业,都需要重新思考。 YC 在最新播客中拿出过去 12 到 18 个月的批次数据,讨论创业生态变化。几组数字尤其醒目:硬科技公司更多了,从机器人、半...

2026-09-23
AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

Snorkel AI是一家帮助人工智能实验室和企业构建训练数据集及模拟环境的初创公司,近日完成3.5亿美元E轮融资,估值达35亿美元。本轮融资由Insight Partners和S32领投,现有投资者Addition、Lightspeed、Greylock、GV和Wells Fargo也参与其中。这家成立七年的公司估值几乎是17个月前D轮融资时13亿美元估值的三倍,当时融资1亿美元。 Snork...

2026-09-23
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部