一江山水的随笔

当前位置:首页 - 技术 - 正文

Enjoy life!

先说结论:自研芯片不是要取代英伟达,而是为了议价权和定制化

\n

最近Google发布了TPU v5p,性能比上一代提升2倍,训练Gemini这种超大规模模型全靠它。另一边,AWS的Trainium、微软的Maia 100也纷纷上桌。巨头们集体自研,难道英伟达的H100不香了?

\n

其实,自研芯片的核心逻辑不是全面取代GPU,而是:第一,压价——有自家芯片当备胎,跟英伟达谈采购时腰杆更直;第二,定制——针对自家模型(比如Transformer)做硬件优化,能省下不少算力成本;第三,生态控制——不想被一家供应商卡脖子。

\n

下面我拿Google TPU v5e/v5p和NVIDIA H100做个对比,再聊聊其他巨头的动作。

\n\n

一、Google TPU v5e/v5p vs NVIDIA H100:硬核参数对比

\n

先上干货,我整理了一张对比表:

\n
    \n
  • TPU v5e:单芯片算力约197 TFLOPs(BF16),256GB HBM,带宽1.6TB/s,专为推理和中型训练设计。
  • \n
  • TPU v5p:单芯片算力约459 TFLOPs(BF16),512GB HBM,带宽2.4TB/s,定位超大规模训练,Google内部用于训练Gemini 1.0/1.5。
  • \n
  • NVIDIA H100:单芯片算力约1979 TFLOPs(稀疏,FP8),但实际训练常用BF16约989 TFLOPs,80GB HBM3,带宽3.35TB/s,支持NVLink全互联。
  • \n
\n

光看数字,H100单卡性能碾压TPU v5p(约2倍多),但TPU赢在集群互联成本。Google用自家光路开关(OCS)把TPU连成超大规模pod,v5p pod最多支持8960颗芯片,带宽几乎全带宽。H100虽然用NVLink,但跨节点靠InfiniBand,延迟和带宽都受限于交换机。

\n

举个例子:训练Gemini Ultra(据说1.6万亿参数),Google用了大量TPU v5p pod,通过模型并行和数据并行混合,把通信开销压到最低。H100也能训,但需要更多卡和更复杂的网络设计,成本翻倍。

\n\n

二、为什么Google坚持用TPU训练Gemini?

\n

Google从2015年就开始搞TPU,最初只是为了加速推理(TPU v1),后来发现训练也能干。到v5p这一代,Google已经积累了完整的软件栈(PJRT、XLA、JAX),TensorFlow/PyTorch都能无缝跑在TPU上。

\n

用TPU训练Gemini的核心优势:

\n
    \n
  • 成本控制:自家芯片按成本价内部结算,比买H100至少便宜30-50%。Gemini这种千亿参数模型,训练一次电费就几百万美元,用TPU能省一大笔。
  • \n
  • 定制优化:TPU的矩阵乘法单元(MXU)针对Google常用的BF16和INT8做了深度优化,Transformer的注意力计算也能硬件加速。H100虽然支持Transformer Engine,但毕竟是通用架构,某些场景下效率不如TPU。
  • \n
  • 互联优势:Google的OCS光路交换机让TPU pod内带宽极高,适合大规模分布式训练。H100集群里,跨节点通信经常成为瓶颈,需要大量InfiniBand交换机和网卡,成本飙升。
  • \n
\n

当然,TPU也有短板:不支持FP64,搞科学计算不行;软件生态不如CUDA,很多第三方库没有TPU版本。所以Google也买H100,用于非核心业务或兼容性需求。

\n\n

三、AWS Trainium、微软Maia 100:各有各的算盘

\n

AWS的Trainium目前出到第二代,单芯片算力约380 TFLOPs(BF16),但AWS强在云原生集成。Trainium通过AWS的Neuron SDK跟SageMaker、EC2深度绑定,用户一键就能拉起训练集群,成本比租H100低20-40%。AWS还搞了UltraCluster,把Trainium通过EFA(弹性结构适配器)互联,规模也能到几万卡。

\n

微软的Maia 100更神秘,官方只说了是5nm制程、用于Azure训练和推理。我猜微软的策略是先内部用,再对外卖。Maia 100主要服务OpenAI和Copilot,减少对英伟达的依赖。微软还跟AMD合作,搞了MI300X的定制版,可见其“去NVIDIA化”的决心。

\n

这些自研芯片的共同点:

\n
    \n
  • 不追求绝对性能:单卡算力都比H100低,但通过集群规模和软件优化,总吞吐量能打平甚至超过。
  • \n
  • 深度绑定自家云服务:芯片+网络+软件全栈优化,用户买的是“服务”而非“硬件”。
  • \n
  • 瞄准特定场景:比如训练、推理、或某个框架(如PyTorch)的优化,不搞通用。
  • \n
\n\n

四、对英伟达市场地位的影响:短期无损,长期有压力

\n

目前英伟达在AI训练市场份额超过80%,H100供不应求。自研芯片短期内撼动不了这个地位,原因:

\n
    \n
  • 生态壁垒:CUDA和cuDNN的软件栈太强了,95%的AI框架和库都优先支持NVIDIA。自研芯片需要自己写编译器、优化库,投入巨大。
  • \n
  • 规模效应:英伟达一年卖几百万块GPU,研发成本摊得很薄。Google TPU一年出货量可能不到10万块,单颗成本更高。
  • \n
  • 性能差距:H100在单卡性能和灵活性上仍然领先,尤其适合中小型公司。自研芯片只有超大规模客户才划算。
  • \n
\n

但长期来看,巨头们自研芯片会蚕食英伟达的高端市场。比如Google、AWS、微软这些大客户,原本每年买几十万块H100,现在可能只买10万块,剩下的用自研。英伟达为了保住份额,只能降价或加速迭代,比如明年出的B100据说性能翻倍,但价格估计也翻倍。

\n\n

五、总结与展望

\n

巨头自研芯片不是要“干掉”英伟达,而是为了在AI算力军备竞赛中掌握主动权。未来格局可能是:

\n
    \n
  • 英伟达:继续统治通用AI训练市场,但高端客户流失,被迫降价。
  • \n
  • Google/TPU:在自家生态内(搜索、广告、Gemini)全面替换GPU,并可能对外提供TPU云服务。
  • \n
  • AWS/微软:用自研芯片搭配英伟达GPU,提供混合算力方案,降低客户成本。
  • \n
  • AMD/英特尔:趁机抢中低端市场,比如推理和边缘计算。
  • \n
\n

最后提个醒:如果你不是超大规模公司,别盲目跟风自研芯片。老老实实租H100或者买AMD MI300X,性价比更高。自研芯片的坑,只有巨头才踩得起。

本文来源:一江山水的随笔

本文地址:https://298.name/post/218.html

主要内容:Google TPU vs 英伟达GPU:巨头自研芯片背后的算力博弈

版权声明:如无特别注明,转载请注明本文地址!

想找什么搜索会更快哦!
站点信息
  • 文章总数:171
  • 页面总数:1
  • 分类总数:4
  • 标签总数:170
  • 评论总数:61
  • 浏览总数:1643341
控制面板
您好,欢迎到访网站!
  查看权限
Top