Cerebras晶圆级芯片推理速度为何快10倍,核心原因是什么?
发布时间:2026-08-10 15:04 浏览量:2
去年,一家AI编程工具公司做了个功能:程序员把鼠标悬停在代码上,系统立刻显示这段代码在整个项目里的调用关系。这个功能需要模型快速读懂上下文,再生成调用图。如果推理慢,光标要停5到10秒才有反应,开发者思路早就断了。
但如果响应几乎是瞬时的,它用起来就像IDE自带的功能一样自然。
让这个功能从“尴尬”变成“自然”的,是Cerebras的晶圆级芯片。它目前平均每秒能输出超过2000个token,而传统GPU方案通常只有200到300 token/秒。差了将近10倍。
这10倍差距的核心原因,不是堆了更多算力,而是架构层面的根本性重做。
大模型推理的“解码”阶段,每生成一个token,都需要把模型的全量权重和KV缓存从头到尾读一遍。这个过程,算力不是瓶颈,
内存带宽才是
——模型数据能不能足够快地喂给计算单元,直接决定了token生成速度。
传统GPU架构里,内存和计算芯片是分开的。HBM(高带宽内存)堆栈通过先进封装和计算芯片连在一起,但数据终究要跨芯片传输。这个传输路径的带宽,成了整个系统的物理天花板。
“对于推理来说,最关键的就是内存带宽。我们最根本的创新,是把计算单元和内存放在同一片晶圆上。”
普通芯片制造,是在一张晶圆上同时印出几百个小芯片,然后切开,一块一块单独用。
Cerebras的做法是:
不切了。整张晶圆就是一个AI处理器
。第三代WSE-3芯片面积46225平方毫米,是当前最大GPU的57到58倍。
这带来一个结构性变化:原本需要跨GPU芯片、跨服务器节点、跨网络完成的数据传输,全部在单片晶圆内部完成。三个层级的传输延迟和通信调度开销,从根源上被消除了。
打个比方更容易理解。传统GPU集群做推理,就像把文件分散存在公司不同楼层的几十个柜子里,每次要查一个文件,都得有人跑过去拿,再送回来——电梯、走廊、门禁,每一步都是延迟。而Cerebras的晶圆级芯片,等于把所有文件全摊在你面前一张巨大的桌子上,伸手就能拿到。
不需要跑腿,延迟自然消失。
把计算和内存放在同一片硅上,带来的不止是“省了跑腿”,更关键的是内存带宽的量级跃升。
WSE-3集成了44GB片上SRAM,实测内存带宽达到21PB/s。这个数字是传统搭载HBM的GPU的数千倍量级。
回到大模型推理的解码阶段。传统GPU每次生成token,都要从HBM里把权重读出来,受限于内存带宽,速度只能到200多token/秒。而WSE的44GB SRAM足够把主流大模型的权重全部装进去,每次读取都在片上完成,直接匹配21PB/s的带宽。
瓶颈被物理性地拆掉了,单条请求的token生成速度直接提升一个数量级。
这可能是最反直觉的设计。台积电5纳米工艺下,每平方毫米大约会出现0.001个缺陷。WSE-3的46225平方毫米,意味着整片晶圆上大约会有46个缺陷。在传统芯片上,任何一个缺陷都足以让整颗芯片报废。如果在整张晶圆级别上也这样,那良率直接归零。
Cerebras的解法是两个设计的组合。
第一,把每个计算核心做到极小。
单个核心面积仅0.05平方毫米,大约是英伟达H100单个SM核心的1%。同样一个缺陷,砸在H100上要损失6平方毫米,砸在Cerebras上只损失0.05平方毫米。容错能力提升了百倍量级。
第二,冗余加智能路由。
晶圆上额外放了1%到1.5%的备用核心,平时处于关闭状态。芯片内置一套可动态重配的片上网络,在制造测试阶段自动识别缺陷位置,把坏核心屏蔽掉,绕开它们,再把工作负载映射到正常区域。
从软件角度看,整片晶圆始终是一块完美无缺的芯片——那46个缺陷被悄悄隐藏掉了。
这个思路的巧妙之处在于:它没有试图“造出没有缺陷的晶圆”,而是接受缺陷必然存在,然后用一套动态路由机制让缺陷变得无关紧要。
传统GPU要实现高带宽,必须依赖HBM堆栈和2.5D/3D先进封装。这些技术不便宜,而且产能受限。
Cerebras的WSE直接在晶圆上原生集成所有计算单元和片上SRAM,不需要额外搭载HBM,也不需要先进封装和3D堆叠。省去的不仅是封装环节的额外功耗和传输延迟,还避开了HBM供应链的产能瓶颈。
再叠加前面说的内存带宽优势,最终的结果就是那个2000+ token/秒的实测速度。
现在回头看开头的那个例子。为什么它从“尴尬”变成“自然”?不是因为程序员习惯了等,而是因为推理速度从200 token/秒跳到了2000 token/秒。这个量级的提速,让“光标悬停就出结果”从不可能变成可能。
而提速的根源,不是更快的光刻机,不是更多的晶体管,而是一个更根本的选择:
与其在“如何让几百颗芯片更快地通信”上修修补补,不如直接让它们从物理上就不需要通信。
整张晶圆就是一台计算机,数据移动发生在同一片硅上,带宽不再是瓶颈,延迟不再是代价。
这就是Cerebras的核心技术逻辑——用架构的重做,换一个数量级的推理速度。