就在刚刚,SemiAnalysis发布了谷歌第七代TPU Ironwood的首份第三方推理性能测算。在完全对等的模型负载下,TPU的每美元性能最高领先英伟达B200达50%,对B300的领先幅度更是逼近翻倍的96%!外部TCO口径下每百万token成本 vs 交互速度换算成业界最敏感的每百万Token成本,差距触目惊心。TPU仅需0.181美元,B200为0.222美元,B300则高达0.276美元。今年4月,黄仁勋在Dwarkesh播客上宣称TPU与Trainium都不敢来跑分。他甚至公开鼓励挑战者使用InferenceMAX来证明其所谓的推理成本优势。在那期播客中,黄仁勋对TPU的战略藐视可以归结为三次断言。第一句,他表示极度渴望看到对手证明TPU的成本优势,并认定这在逻辑上根本无法成立。同款开源模型,FP8对FP8,输入8k输出1k,B200与B300跑的是和TPU完全一致的负载。
在每秒100 Token的单用户吞吐基准下,TPU比B200便宜19%,比B300便宜34%。若将中位响应时间卡在20秒,TPU成本为0.098美元,B200是0.106美元,B300则飙升至0.132美元。B200并未在所有指标上落败。在30秒响应时间的狭窄区间内它依然维持着微弱的抵抗。但随着延迟要求放宽,TPU重新接管了制高点。第二句,他声称从第一性原理来看,TPU的优势完全没有道理。物理测试并未推翻他的底层推演,黄仁勋只是算错了商业世界的算盘。在原始吞吐曲线的大部分区间内,TPU的物理性能确实不及GPU。但TPU的每小时租赁成本呈现出断崖式的低廉。5%的物理吞吐优势叠加极低的单位时间租金,瞬间转化为50%的每美元性价比优势。若按谷歌内部每颗芯片一小时1.03美元的底线成本核算,这一优势将被放大至77%乃至130%。黄仁勋计算的是单颗芯片榨出的绝对算力,而商业客户衡量的是每一张钞票能买到的实际产出。第三句,他断定Anthropic只是特例,失去Anthropic的支撑TPU将彻底丧失增长引擎。Anthropic确实吞下了超过100万颗TPU,其中约40万颗直接买断,60万颗通过谷歌云租赁。到2029年它将超越DeepMind成为全球最大的TPU单一用户。谷歌自去年起便开放了芯片直售,不再死守云端租赁这一单一城池。就连DeepMind内部的研究员,如今也需要在拥挤的队列中抢夺算力资源。黄仁勋4月敢那么说,是因为TPU在外面从来没有标过价。对此,SemiAnalysis在底层逻辑上揭示了谷歌截然不同的工程哲学——谷歌从不单一追求芯片的物理峰值,而是将计算Die、芯片间互联以及底层编译器铸造成一个闭环系统,在每一处接缝中压榨成本。
芯片层面,Ironwood被物理拆解为两个独立的计算Die,每颗内嵌2个TensorCore与4个SparseCore。其HBM容量达到了上一代Trillium的6倍。这个数直接决定KV Cache能放多大、Batch能开多大。它更是第一代原生支持FP8运算的TPU,彻底告别了此前数代的软件模拟妥协。矩阵单元采用256×256的脉动阵列,每周期完成65536次乘加运算,计算吞吐量直接飙升至v5架构的4倍。
这条路线到第八代走得更绝:谷歌第一次把训练和推理拆成8t、8i两颗芯片,8i的片上SRAM扩到384MB、是上代3倍,专门把推理模型的KV Cache留在片上。网络互联方面,芯片之间直接通过谷歌自研的ICI总线进行数据交互,彻底绕开主机CPU、PCIe与通用网卡。其拓扑结构呈3D Torus形态,每颗芯片物理链接6个相邻节点,64颗组建为一个机架级立方体,再通过光学电路交换机一路拼接至9216颗芯片的超级矩阵。任何一条光纤链路发生故障,系统都能利用光学反射镜在数秒内完成重路由,不需要人工干预。到TPU 8i,3D Torus会换成Boardfly拓扑,千颗芯片规模下最大跳数从16砍到7,MoE路由和多轮Agent里每一跳堆出来的尾延迟直接减半。
Google,TPU 8i的Boardfly拓扑
为了让TorchTPU栈上的第一个模型顺利起跑,谷歌、Inferact与RadixArk联手投入了数百个工程小时。深入剥离海量的代码提交记录,可以萃取出三项具备决定性意义的优化。第一是KV Cache页数翻倍,大幅削减首Token延迟。TPU向量单元每次处理的Tile在最后一维被硬件锁死为128个Lane,维度不足便会被强制补零。
旧有的注意力内核沿着头维度打包KV,导致单KV头的模型有一半计算资源被无效的补零操作吞噬。现在,谷歌将Token转移至128 Lane的维度,可用KV页从5141暴涨至10283。在并发128时吞吐量提升16.5%,中位首Token延迟骤降95%,推理请求彻底免除了排队等待KV空间的痛苦。分页注意力机制依靠双缓冲来掩盖HBM延迟,即计算当前数据时同步预取下一块数据。旧的启发式算法将计算块和读取块均锁定为16k个Token,导致VMEM没有任何多余空间用于预取操作。现在,研发团队将读取块维持在16k,计算块砍至4k,解码吞吐量从每秒64.9k Token跃升至96.3k。Ironwood每颗芯片配备的4个SparseCore原本专属于Embedding查表等稀疏计算。谷歌将ReduceScatter和MoE的Token重排任务全部转移至SparseCore,从而释放TensorCore的计算资源使其专注核心矩阵乘法。SparseCore上的ReduceScatter三阶段在8k输入1k输出的负载下吞吐量提升4.1%至14.2%,在1k输入8k输出且并发512时吞吐暴增26.1%。数百个这样微小却致命的代码优化层层累加,最终铸就了这压倒性的50%性能优势。
整个开源推理生态在此之前深深扎根于PyTorch与CUDA体系,而TPU的原生开发环境是JAX。此前vLLM要跑在TPU上,得靠一层叫TorchAX的翻译墙,在底层把每个算子逐一翻译为JAX执行。这层翻译导致了分页注意力与底层优化的大量兼容问题,谷歌联合开源社区耗费一年多时间才完成修补。它利用PyTorch自带的PrivateUse1后端接口,令TPU直接成为原生的Torch计算设备。开发者仅需敲下一行代码即可将编译交由XLA处理,性能核心算子调用Pallas内核,而DDP与FSDP2等分布式特性均可无缝运转。TorchAX路径 vs TorchTPU原生路径对于vLLM和SGLang等框架,其调度器与API层等核心代码现在能够直接复用,彻底终结了隔着高墙重新造轮子的历史。此前耗费海量工程时长打磨的Pallas内核绝大部分可直接空降至全新环境。CUDA的帝国城墙由两部分垒成。一层是底层芯片性能,另一层则是封闭的生态铁幕。如今的跑分证实了其物理性能的不可替代性已被实质性打破。而那道曾让无数挑战者铩羽而归的生态铁幕,正在被PyTorch底层架构的更新以不可逆的方式逐步填平。参考资料:
https://newsletter.semianalysis.com/p/tpu-inferencex-full-steam
编辑:摩西

内容中包含的图片若涉及版权问题,请及时与我们联系删除
评论
沙发等你来抢