• 正文
  • 相关推荐
申请入驻 产业图谱

为什么英伟达的客户们开始自研芯片?

07/20 09:31
254
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

上个月,OpenAI博通联合发布了首颗自研芯片Jalapeño——专为大模型推理设计的 ASIC(专用集成电路)。事实上,自研芯片的不仅是OpenAI,英伟达的大客户们:亚马逊、OpenAI、Meta、微软——都在做同一件事:自研芯片

规模到了这个量级,自研芯片的经济账才算得过来。Anthropic 2026年运营收入年化已越过300亿美元,2025年底还只有约90亿美元——但至今没造过芯片,Claude每次调用跑的都是合作伙伴(也是竞争对手)的芯片。这笔账,迟早要自己算。

这篇文章,我们来看这场"造芯运动"的全貌,以及它背后的深层逻辑。


一、谁在造芯

海外阵营:从"买芯片"到"造芯片"

谷歌 TPU Ironwood(第九代):售价约1.3万美元,而英伟达B200单价3.5万美元——同等算力级别,价格仅为37%。Anthropic已大规模部署TPU训练和运行Claude。TPU推理利用率达80%-90%,远超GPU的30%-40%。

亚马逊 Trainium:累计部署140万颗,Trainium 2支撑Anthropic Claude的全部推理算力;Trainium 3(台积电3nm)AI训练成本较行业平均降低50%。CEO安迪·贾西:"Trainium已经是AWS的数十亿美元业务。"

OpenAI Jalapeño:与博通合作,台积电3nm,从设计到流片仅9个月,推理成本降低50%,计划2026年底量产。

Meta Iris:2026年9月量产,制造成本比英伟达同级GPU低50%。同时Meta已开始使用AMD MI300——不再把鸡蛋放一个篮子里。

中国阵营:从"国产替代"到"自主定义"

字节跳动:年度AI基建预算2000亿元,自研芯片代号"C"2026年Q4量产,2027财年计划10万颗。同时昇腾订单超400亿元,寒武纪芯片已进入搜广推核心场景。

阿里巴巴:平头哥自研芯片累计约60万颗,含光9000推理能效比H100提升2倍,国内云厂商中部署量最大。

百度:昆仑芯规模化部署,国产替代比例高达90%,自研芯片部署比例最高的云厂商。

腾讯:紫霄芯片已量产,提供3倍加速性能和45%成本节省,但自研占比仍仅8%-10%。

全景速览


二、为什么要"自研芯片"?

原因一:供应链安全——90%即风险

SemiAnalysis数据显示,2026年Q1全球AI训练芯片英伟达占约92%,推理芯片占78%。一家公司独占90%以上的关键供应链,任何产能波动或地缘变化都是灾难。

现实已经验证:英伟达B200月出货120万颗仍卖断货,backlog堆到360万颗。美国对华出口管制持续收紧,黄仁勋亲口承认中国市场高端芯片份额从95%跌到0%,2026财年因此计提45亿美元费用。

原因二:成本——英伟达太贵

先看硬数据:

100万颗芯片的采购,每颗省2万美元,就是20亿美元的差距。高盛预计2025-2030年五大云厂商AI资本开支合计5.8万亿美元,芯片成本的每一个百分点都是数十亿美元。

已有先行者用脚投票:Midjourney把推理负载从英伟达GPU迁移到谷歌TPU后,月度算力开销从约210万美元降到约70万美元,降幅65%

更关键的是,推理成本直接决定AI商业化能否落地。OpenAI 2025年运营亏损209亿美元,推理成本居高不下是主因。英伟达自己毛利率71.1%,但下游大面积亏损——它的高定价权,正在成为整个AI行业的利润瓶颈。

原因三:推理效率——GPU空转过半

这是最致命的结构性问题。

Cast AI 2026报告:生产环境K8s GPU集群平均利用率仅5%VentureBeat调研(573家企业)86%的企业GPU运行在50%容量以下。国内中小企业自建GPU平均闲置率高达62%

花大价钱买的GPU,大部分时间在空转。通用GPU为训练、推理、图形渲染全能设计,但在推理场景下超过九成的电路资源形同虚设。

而专用ASIC所有晶体管只为AI推理服务,利用率稳定在85%以上。谷歌TPU推理利用率达80%-90%,同等数量芯片的有效推理算力是GPU的2-3倍,叠加更低的单价,每token成本差距可达5-10倍

《芯片战争》作者Chris Miller有个精准比喻:GPU像瑞士军刀,什么并行计算都能干;ASIC像单一用途工具,高效但锁死只做一类活。训练阶段需要瑞士军刀的灵活,一旦定型服务海量请求,专用工具反而更省电更便宜。

2026年全球AI推理任务已占算力负载的三分之二。推理时代,通用GPU做推理,就是航母去捕鱼。

更要命的是,智能体推理是"循环成本"而非"查询成本"——一个目标触发几十上百次推理调用。当智能体大规模铺开,推理成本会以非线性方式膨胀,通用GPU的低效将更不可忍受。

原因四:软硬件协同——自研芯片=定制手术刀

大模型厂商比任何芯片公司都更懂自己的架构。MoE调度、注意力压缩、量化格式——这些算法"暗知识"可以直接固化进自研芯片硬件。

DeepSeek自创UE8M0 FP8格式(动态范围扩大32倍,显存减少50%-75%,计算速度提升3倍),华为昇腾等已全力适配。谷歌TPU专门针对Gemini架构优化,亚马逊Trainium为Claude推理深度调优——通用GPU做不到这种"定制手术刀"级别的适配。

原因五:打破CUDA锁定+争夺定价权

CUDA生态绑定超500万全球开发者,这是英伟达最深的护城河。但2026年正在被三面瓦解:PyTorch成为硬件中立的事实标准框架;DeepSeek通过开源工具栈定义"什么芯片最适合跑自己的模型";谷歌亚马逊的自研芯片经过万亿次推理验证,迁移信心已建立。

迁移仍有代价:据Spheron分析,把服务栈从vLLM移植到亚马逊Neuron SDK往往要花2-6周工程时间,某些模型架构甚至根本不被支持。但巨头们正在用规模摊薄这笔一次性成本。

更深层的是定价权博弈。自研芯片即使不能完全替代,它的存在本身就是最有效的谈判筹码——"你不降价,我就用自研的"


三、英伟达的护城河还在吗?

短期依然坚固:大模型训练GPU无可替代;CUDA十余年积累难以速替;英伟达200亿美元收购Groq补齐推理短板,Vera Rubin平台推理成本再降10倍。

但增量风向已变。TrendForce数据:2026年定制ASIC出货增速44.6%,商用GPU只有16.1%——定制芯片增速首次超过GPU。未来主流形态是"GPU+ASIC双路线并行"——训练用英伟达,推理用自研ASIC。英伟达不会倒下,但定价权、市场份额和生态垄断,正在被一点点蚕食。

相关推荐