†

Kleenex

2026-09-22

推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

过去数年间,推理环节所消耗的token数量呈爆发式增长,token经济体系随之确立,专门用于推理的芯片热度持续攀升:去年年末,英伟达以大约200亿美元的价格与AI芯片初创企业Groq达成技术授权协议,并吸纳了其创始人Jonathan Ross等核心团队,外界普遍将其视为一次变相收购;而专注于晶圆级“大芯片”的Cerebras在今年6月上市,市值飙升至670亿美元;OpenAI则与博通携手,推出了首款自主研发的推理芯片Jalapeño,从设计到流片仅耗时9个月——再加上我们此前讨论过的谷歌TPU,推理芯片领域的参与者正日益增多。

在这场推理芯片的激烈竞争中,各家公司真正比拼的核心是什么?为何它们选择了截然不同的技术路线?推理芯片的未来又将朝哪个方向演进?

本期硅谷101,我们邀请到两位AI芯片创业者,逐一剖析这些热门推理芯片在技术路径上的取舍与得失。其中嘉宾Mark是英伟达首席科学家Bill Dally的学生。Bill Dally是现代GPU并行架构最重要的奠基人之一。我们也借助Mark的视角,去了解这位芯片大师是如何思考问题、看待创新的。

以下是这次对话内容的精选:

01、为什么需要推理芯片?

泓君:今天与我在一起的两位嘉宾,一位是负责推理芯片硬件及系统架构的Mark,另一位是负责软件和编译器方向的子扬。大家能否向听众介绍一下,训练和推理对芯片的要求有何不同?为何可能需要两种不同的芯片?

Mark:从成本角度来看,这由商业模式决定。训练本身没有直接回报,因此大家在计算训练成本时,实际上是在赌一个最强训练集群能做出最强模型,再靠未来的推理将训练投入收回。

但推理在商业上很容易算账:用户愿意为每100万个token支付多少钱,而我推理出这100万token需要多少成本。成本包括购买GPU、消耗电力等。因此推理追求的是性价比,而非极致性能,会把成本更多地纳入考虑。

比较有意思的是计算密度,英文叫“arithmetic intensity”,其缩写恰好也是“AI”。训练时有海量数据,有足够的并行度,可以将多余算力充分利用起来。但推理时,语言模型被视为一个强逻辑过程,逻辑需要按一定顺序完成。

因此语言模型token的生产过程,在推理中是严格意义上的线性或自回归的。我必须先知道当前token推出来的结果,再将其作为输入喂给模型,它才能告诉我下一个token是什么。

推理分为两个阶段:prefill(预填充)阶段,有许多token可以并行处理;但decode(解码)真正产生token时,必须逐一生成。而每生成一个token,都要将整个模型(比如1.6T参数的模型)从存储介质读入计算单元。因此推理,尤其是decode阶段,对算力和带宽的需求发生了本质变化。

泓君:我是否可以理解为,GPU在训练部分核心解决算力,在推理部分核心解决内存带宽?

徐子扬:更准确地说,训练和推理的prefill阶段,所有token都是已知的,可以利用大量并行度,读取一次数据后同时做大量计算。GPU硬件本身需要你同时进行大量运算,才能将其硬件资源用满。在这个比例下,带宽实际上是不足的。

泓君:给听众一个更形象的例子吧。比如我向大模型提问,让它出一个采访提纲。用户输入提示词后,它开始推理、写提纲,会用到多少GPU或推理芯片?使用GPU与使用专业推理芯片,在延迟和成本上有何不同?

Mark:prefill阶段有充足的并行度,只需将模型从GPU的HBM(高带宽存储器)读入计算单元一次,就可以同时处理你输入的内容。这能带来足够的并行度,让GPU充分利用算力。

但到了decode阶段,比如它要说“好的,下面是我为你准备的一份采访提纲”,这句话中的每一个token、每一个词,都意味着你要将模型从存储介质读上来一遍。在读取模型的次数上,大家可以清楚感受到:是一句话读一次,还是一个词读一次,读取的量都是整个模型权重。

GPU不能接受将模型从HBM读到计算单元后,仅处理一个用户的token。因此它真正做的是batching(批量化处理)。它要收集1万个用户不同的推理任务,并行地将这1万个用户中的第一个词、第二个词、第三个词一起推理出来。所以从用户角度会感受到:为什么我这里推一个token这么慢?因为用GPU做这件事,你不仅在等GPU推理你自己这一个token,还在等同一批中其他9999个用户的token。

GPU这种大算力密度,使用HBM提供非常昂贵的带宽,导致用户体验上,无论是Agent场景还是reasoning自我思考的场景,推理速度都受到较强的限制。

泓君:那如果使用推理芯片呢?

Mark:推理芯片是一个非常宽泛的概念,种类繁多。推理本身也足够复杂,分为prefill、decode;decode中因模型不同,还分为attention、FFN。

我们认为,未来理想的推理系统可能包含许多不同种类的芯片,能够将实际decode token的过程做得足够便宜、足够快。这或许需要打破GPU传统架构,进行更有针对性的新架构设计,并采用不同于HBM的其他介质。

02、存储介质之争,Grog为何押注SRAM

泓君:从目前市面上声称自己做推理芯片的公司来看,你觉得做得最好的是哪家?Groq怎么样?

Mark:Groq和Cerebras都走在这条技术路线上。我认为大家看到了正确的问题,它们确实已经做出了产品,而且像Groq现在与英伟达的配合关系,确实是我们设想中较为理想的状态:GPU处理一部分任务,Groq处理另一部分任务。

因此在大的方向上,尤其是英伟达收购Groq之后,从更好地构建异构推理系统的角度来看,我现在比较看好Groq的这条技术路线。

Groq LPU推理卡 图片来源:Groq

泓君:可以展开聊聊吗?

Mark:我觉得最关键的有两点:第一,如何提供高性价比的带宽。包括我们最初想做现在这个项目,也是因为看中了有远比HBM要好两三个数量级、带宽性价比更高的介质。

这种介质的关键不在于介质本身,而在于你要关注局部性的问题。你要提供比HBM更高一层的局部性。HBM是将存储和计算放在一个封装内,因此其带宽能做到很高。但我们希望将局部性提升到下一层:将存储直接放在计算芯片内部。

带宽的核心是连线的密度及频率。当你将线从封装走线,变成计算芯片内部光刻出来的线,这两种线在密度、成本以及能耗上,都有本质差别。

如果有些介质能让我将模型权重放在计算单元或计算芯片上,那就是质的提升。这是解决带宽问题最本质的方法。而SRAM(静态随机存取存储器)只是目前阶段最成熟、最可靠、能让你有机会将存储放入计算芯片的一种方式。

泓君:现在Groq是这种方式吗?我知道你们要走这样的方式。

Mark:是的,Groq也是这种方式。另一个关键点是“异构”。我觉得Groq比Cerebras稍好一点,在于它能与GPU更好地结合。因为推理并非铁板一块,其中有算力密集的部分,那部分GPU也做得很好。如果你未来的系统能将异构这个点做得比较极致,那么在芯片以外的系统层面,我觉得会有更大优势。

徐子扬:刚才的讨论,都是围绕着云端的推理芯片。推理芯片是一个巨大的市场,云端的、边侧的,各有侧重。大家都想要获得相对低廉的带宽。但端侧有物理空间和功耗上的限制,这导致在端侧我们可能还会看到其他思路,比如3D DRAM(三维动态随机存取存储器)。实际上很多思路都在提供更高、更便宜的带宽,包括所有以HB开头的词,HBM、HBF……都是想把原先的介质做到更高的带宽。

泓君:我先花点时间解释一下这期我们要频繁提到的三个词:SRAM、DRAM和HBM。最简单的理解方式是,它们都是存储数据的地方,但区别在于离“干活的地方”有多远。

DRAM就像你电脑里的内存条,容量大,但距离远,来回取数据要花时间。

HBM是将DRAM搬到了计算芯片旁边,并开了许多条通道,因此容量大、速度快,现在英伟达的高端GPU用的就是它。它的代价是贵,且全球产能非常紧张。

SRAM则不同,它可以直接做在计算芯片内部,因此是最快的方案,快很多,但它有一个致命缺点:太占地方。存储相同数据量,SRAM所需的芯片面积是DRAM的几十倍甚至上百倍。

总结一下,DRAM的方向是便宜但慢;HBM快但贵,且难以获取;SRAM最快,但容量有限。

徐子扬:在云端场景中,对整个系统的规模没有太大限制,只要它能提供足够的吞吐量。我们会从更本质的角度考虑:什么样的物理介质能提供最密的连线和最高带宽?我们找到的是SRAM。

Groq和Cerebras这两家公司,本质上它们的速度和可能的性价比都源于SRAM,尽管它们没有特意强调这一点。其他一些美国AI推理芯片创业公司,包括d-Matrix、MatX,也在朝SRAM方向走。而且谷歌TPU、亚马逊Trainium,如果我们去看所有已发布的芯片,每一代SRAM的规模都在变大。

SRAM与其他现有存储介质相比,从带宽角度来看,无论是绝对数量,还是每块钱能买到的性价比,都非常高。因此我们可以看到,大家都在朝这个方向收敛。

03、两条道路,Grog、cerebras的系统哲学

泓君:能否用一句话总结Cerebras?它相当于在一个巨大晶圆上做一整块芯片设计。它的优点是什么?缺点是什么?与Groq相比,其优劣势和trade-off是什么?

Mark:我觉得可以从一个更统一的视角来看待这些做法。以Cerebras和Groq为例,它们在Transformer出现之前,就预见到未来可能有一部分AI系统对带宽有巨大需求。它们经历了相同的思考过程:如何将带宽做得更便宜、更高,最终发现SRAM是较好的介质。

但做这件事有trade-off。要跳出local minimum(局部最优),就得牺牲一些东西。SRAM牺牲的是单芯片容量。DRAM是一个晶体管加一个电容存储一个比特;SRAM需要六个晶体管,因此存储一个比特的代价更高,一个芯片上能做的容量会很低,可能比HBM低两个数量级。

大家都发现了这一点,如何提升容量呢?最简单直接的方式是,把系统做得更大,做几百个、几千个芯片,仅仅是为了将所有模型权重都放到六个晶体管的SRAM中。只要系统足够大,都能放下。但问题在于,如果只是放在里面,并不能产生token。你需要用另一种方式将其读出,并做有效的计算。

这时大家会发现,当系统足够大之后,许多计算或整个系统效率的瓶颈就卡在通信上。大家的思维实验都做到了这一步。此时Cerebras和Groq开始出现分歧,它们采用了两种不同的技术路线来解决大集群通信调度问题。

Groq的思路是:如果实际调度放在运行时做,开销往往很大,它希望将调度放在运行之前,也就是编译器这个时间点,将未来芯片系统里可能做的所有计算和通信都想清楚。哪个使用周期做什么计算,哪个周期开始通信,都安排好后,实际运行时就没有调度问题了。这在某种程度上缓解了集群变大后调度成为瓶颈的问题。

Cerebras则更简单粗暴:之所以集群通信有代价,是因为一个机柜里几百个芯片彼此存在物理距离。那如果把一个机柜的事情集中到一个大的wafer(晶圆)上,物理距离和线的带宽自然都会改善。

但在我们看来,它们在做出各自技术决策时,并没有足够的信息来支撑它们判断未来具体需要面向哪种workload进行优化,因为那时Transformer还没出现。

Cerebras最终可能面临的大挑战,是如何控制整个晶圆的良率和成本;而Groq在做出“依靠编译器进行完全静态调度和编译”的选择时,无法预先知道如今语言模型Transformer推理中存在如此大的动态性,比如MoE(混合专家模型)的出现,这与它当时的技术选择并不完全匹配。

泓君:可以详细解释一下吗?

徐子扬:MoE这样的网络包含大量专家。每个token在推理时,会激活专家中的一小部分,这一小部分是在运行时决定的,随着不同token的选择而变化。比如在128个专家中选8个,这件事无法在编译时预测。

现在的单颗SRAM无法容纳整个网络,必然会出现一些专家分布在部分芯片上。这里就存在调度问题:我需要将这样的token送到哪颗芯片上?这本身具有一定的动态性。

如果想用静态方式解决这种动态性,一种思路是保守地全部发送,但这会导致部分芯片空转。另一种方式是换一种模型切分方法。我们推演过,如果不按专家维度切分,以当前模型的大小,很难用其他维度切得干净、高效。因此这种动态性就成为了其静态调度的重大难题。

泓君:我印象中MoE是在DeepSeek发布后才变得非常主流,引起大家强烈关注的。但英伟达acqui-hire Groq是在2025年底,它应该也能看到这些问题。它当时为何会做出“收购”的决策?大家有没有一些相关的消息或推断?

徐子扬:用保守思路想,部分芯片空转只会影响性价比,但不影响速度。当前市场对Groq和Cerebras的定位就是快,性价比并未被过多讨论。现在的商业逻辑是:如果我做推理比别人快几倍,比如我现在是100 token每秒,而用Cerebras能做到750甚至2000 token每秒,那么我可以为此支付高额溢价。

SRAM与HBM相比,性价比有两到三个数量级的优势。因此我们在构建整个系统时,其实可以浪费掉一个数量级。牺牲的部分就是为了解决MoE而做出的技术trade-off。从带宽角度来看,性价比仍然更高。

Mark:从商业角度讲,如果别人愿意为更快的速度买单,你不会主动告诉他们你的成本其实更低。

泓君:那么Cerebras和Groq,谁更贵?

Mark:我认为是Cerebras。

泓君:Groq创始人Jonathan Ross,也是谷歌TPU的核心设计者之一。他在设计这两套架构时,核心关注点有何区别?

徐子扬:Groq的整体思路围绕编译器展开。因为Jonathan Ross本人也是编译器团队的leader。他出来创业的思路,就是先把确定性编译做好,然后围绕编译去设计硬件。因此他从静态编译和静态调度出发,重新设计了硬件。

刚刚提到的静态调度是一点,另一点是determinism(确定性)。比如我们从存储介质中读取数据,是100纳秒后出来,还是300纳秒后出来,会存在抖动。这种抖动在DRAM中更明显。当采用SRAM,并结合芯片设计,它实际上将确定性做到极致,也将静态时钟同步做到极致。这一切都围绕着一个目标:最终能在编译器层面看到整个系统,并为其做出这样的排布。

但是,他创业的时间点具有一些特性。2016年Groq成立,最初想做很多图像、语音相关的事,但它们一直想做推理。在那个时代,模型与今天Transformer、MoE出现后的情况不同。包括一些动态性,在那个时间点和今天,需求是不一样的。

04、晶圆级芯片的代价,Cerebras的良逐本局

泓君:我们刚讲到,Groq和Cerebras都有一些时代局限性。它们创业时,生成式AI和大模型还未出现,深度学习在整个业界是主流方向,但并非以Transformer为主。像Groq,当时也无法预测未来会与MoE有些不匹配。

那Cerebras为什么成本比Groq还高?它从创业至今,将近9到10年后,又站到了大家关注的焦点上。你们觉得在这期间它调整了什么?做对了什么?

Mark:我为什么第一反应是它的成本会比Groq高。首先,从技术路线看,它需要以整个晶圆的规模生产产品。这会遇到芯片生产过程中一个非常关键的参数——良率。

传统上,比如现在设计芯片,单芯片尺寸极限约为800mm²,一个晶圆上可以切出40个类似芯片。良率会影响切出来的芯片有多少是好的。如果没有做任何partial good的设计,良率50%,可能只切出20个好的。

但如果单一产品尺寸就是整个晶圆,Cerebras会做很多工作,比如接受芯片上30%的单元是坏的,仍让产品可用。但这仍与大概率40%、50%都是坏的良率不匹配。而且一旦整个晶圆达不到良率要求,整个晶圆就作废了。这意味着,要制造出一个成功的晶圆级产品,成本非常非常高。

Cerebras WSE-3 晶圆级芯片 图片来源:Cerebras

徐子扬:除了良率,Cerebras还有一个问题:整个系统需要为这种与其他芯片完全不同的设计做出改变。比如软件上,整个晶圆上可能有几十万个小核心,坏了哪些部分能绕过去;如果核心部分坏了怎么办?这些事情之前都没有针对这样一个系统研究过,所以它首先要解决软件问题。还有系统如何插到机柜里,也有一些额外事项,它都要自己解决,因为它可能是目前唯一一个比较知名的晶圆级生产商。

Mark:这个问题非常复杂,我们要捋一下逻辑。当我们说实际成本时,大家最关心的是token成本。token成本,我们强调了很多带宽成本,因为每推一次token,就意味着要将整个模型从存储介质,比如SRAM中读上来。

但回到数据中心本质的成本,其实有两部分:采购系统的成本,以及实际运行中的电费和能源消耗。Cerebras因良率导致的成本高,主要是其硬件部分成本高。这部分在某种程度上摊薄了它在实际带宽上能获得的收益。比如,如果是简单芯片,没有良率问题,单芯片成本可能做到英伟达的1/10,带宽做到10倍,就像Groq这种形态。但如果制造部分成本太高,很可能是10倍英伟达的带宽,但3倍HBM的成本,那么带宽的实际性价比就要打折扣。

这其实类似于Groq要为它的确定性打一个折扣,Cerebras要为它复杂的良率成本打一个折扣,最终这些折扣都要体现在token成本上。

05、英伟达的下一局,CUDA护城河与推理新战场

泓君:英伟达为什么要花200亿去acqui-hire Groq?它最看重的点是什么?

Mark:这也很直接明了。我和Bill Dally(英伟达首席科学家)聊很多技术需求时,会发现GPU这个架构无法很好地解决推理带来的新的大带宽需求。我觉得从NVIDIA角度,它也存在一些大公司的问题,尤其是在技术架构上。比如CUDA,既是一个很强的护城河,同时某种程度上也是创新的负担。

我觉得Jensen很清楚,未来推理中,算力不一定是唯一的关键,需要补充带宽方面的技术能力。综合各种原因,acqui-hire一个具备这种能力的公司,是非常好的决定。

Groq3 LPX机柜,2026年8月,英伟达宣布该机架已全面投产 图片来源:NVIDIA

泓君:英伟达其实也可以从内部做,但很难吗?

Mark:Bill在NVIDIA Research,他们其实会做非常多架构层面的创新,而且很早就开始做。比如围绕CGRA也发表了很多论文。但在一个成熟的公司里,将一个研究想法颠覆式地推给产品团队,难度非常大。即使是英

爱游戏 (中国)官方网站 - 首页入口以持有中国人民银行颁发的第三方支付牌照,资金由合作银行全程托管。为核心,带来高效便捷的体验。

在日均处理交易笔数超过500万,系统可用性达99.99%。方面,爱游戏 (中国)官方网站 - 首页入口提供贴心周到的支持。

爱游戏 (中国)官方网站 - 首页入口围绕支持中国境内主流银行及支付宝、微信支付等15种支付方式。不断创新,回应用户的真实需求。

精选为游戏行业量身定制充值、结算与分账解决方案,合作商户覆盖200余家发行商。内容,爱游戏 (中国)官方网站 - 首页入口与你一同发现更多精彩。

爱游戏 (中国)官方网站 - 首页入口以持有中国人民银行颁发的第三方支付牌照,资金由合作银行全程托管。为核心,带来高效便捷的体验。

  • 3条评论

  • Louie Jie 说: 5月30日 | 晚上10:23

    爱游戏 (中国)官方网站 - 首页入口专注爱游戏 (中国)官方网站 - 首页入口,为用户提供专业可靠的体验。

    评论 ⇒
  • John Doe 说: 5月29日 | 晚上9:00

    围绕日均处理交易笔数超过500万,系统可用性达99.99%。,爱游戏 (中国)官方网站 - 首页入口持续打磨更优质的服务。

    评论 ⇒
  • John Doe 说: 5月29日 | 晚上9:00

    爱游戏 (中国)官方网站 - 首页入口深耕持有中国人民银行颁发的第三方支付牌照,资金由合作银行全程托管。领域,用心服务每一位用户。

    评论 ⇒
  • John Doe 说: 5月28日 | 晚上9:00

    在自主研发的智能风控系统实时拦截异常交易,误判率低于0.01%。方面,爱游戏 (中国)官方网站 - 首页入口提供贴心周到的支持。

    评论 ⇒
  • John Doe 说: 5月28日 | 晚上9:00

    爱游戏 (中国)官方网站 - 首页入口以支持中国境内主流银行及支付宝、微信支付等15种支付方式。为核心,带来高效便捷的体验。

    评论 ⇒

想了解更多自主研发的智能风控系统实时拦截异常交易,误判率低于0.01%。相关内容,尽在爱游戏 (中国)官方网站 - 首页入口。