原标题:陆奇与FPGA往事
昨天写的百度的AI故事,与陆奇息息相关,即将上市的昆仑芯,也脱胎于陆奇的远见卓识,周末芯片早餐会有朋友问起Intel当年收购Altera的往事,想起来这件事跟陆奇也有莫大的关系,正好捋一捋。
2025年4月,一条新闻让半导体行业一片唏嘘。
Intel宣布,将旗下FPGA公司Altera 51%的股份,以87.5亿美元的估值卖给银湖资本。要知道,2015年Intel买下Altera的时候,可是花了整整167亿美元。十年时间,估值腰斩。
这不是一次简单的"低买高卖"翻车现场。这背后,是一场持续十年的数据中心算力路线之争。GPU、FPGA、ASIC,三条技术路线各自押注,最终英伟达的GPU赢了。
但在AI推理时代,FPGA的故事,可能还没讲完。
一、陆奇力推的Catapult项目
2012年,微软总部,一场关键会议正在进行。
Doug Burger,微软研究院的一位工程师,正站在时任CEO鲍尔默面前,试图说服他一个听起来匪夷所思的想法:微软应该自己做可编程芯片。鲍尔默当场表示不买账。
当时在场的人后来回忆,Ballmer的反应大致可以翻译成:微软花四十年做Windows和Office,现在你要我们去做芯片?这跟可口可乐宣布要做鱼翅有什么区别?
但就在气氛僵住的时候,另一个人开口了。
时任Bing搜索引擎负责人的陆奇,已经和Burger的团队秘密合作了两年。他告诉鲍尔默:这不是一个"要不要做"的问题——"他的团队已经开始了。"
就是这句话,保住了Catapult项目。
两年后,2014年,微软在计算机架构顶会ISCA上发表了一篇论文。论文里的数据震惊了整个业界——
在Bing搜索引擎的文件排名运算中,用FPGA做硬件加速,吞吐量提升了95%,系统延迟下降了29%。每个FPGA额外功耗不到25瓦,总成本增加不超过30%。而且,对比的是微软已经深度优化过的纯软件方案。
换句话说,这不是"从零开始的优化",而是在"已经榨干了CPU性能"的基础上,FPGA又把天花板往上顶了近一倍。从1985年诞生了全球首款FPGA产品以来,FPGA的应用逐渐从数字信号处理、高速串行收发器扩展到嵌入式处理器。FPGA被广泛应用于通信、消费电子、工业控制、测试测量等微型电子电气领域,但几乎没有被应用于大型数据中心。
这篇论文是第一篇真正意义上详述互联网巨头开发并大规模部署FPGA的专业论文。在此之前,FPGA是硬件公司的专属玩具。在此之后,谷歌、亚马逊、百度、阿里,所有互联网巨头都开始认真考虑:要不要在数据中心里铺FPGA。
微软说干就干。到2016年,微软在全球五大洲15个国家、5670台服务器中部署了FPGA加速卡。2017年,又推出Brainwave(脑波)项目,把FPGA的应用从搜索扩展到了深度学习。
尤其值得留意的是,除了项目初期原型验证阶段,微软后续全部采用了Intel(Altera)的FPGA芯片。微软一跃成为Intel FPGA的最大客户。
当年的"Wintel联盟",在后PC时代,似乎正通过FPGA,找到了一条重生之路。
2014年9月,百度快速跟进,宣布将把FPGA技术用于自己的数据中心。陆奇在2016年从微软离职,随即加入百度担任副总裁,似乎与这个Catapult项目也有很深的渊源。
二、三条路同时出发,谁也不知道对错
2015年前后的数据中心加速市场,是一幅真正的"三国杀"局面。
英伟达主推GPU路线。谷歌押注TPU路线(一种ASIC定制芯片)。微软搞出了FPGA路线。
三条路,各有各的道理。
GPU:一把瑞士军刀。
GPU最初是为游戏图形渲染设计的,但2012年AlexNet用GPU训练神经网络大获成功之后,人们发现这种大规模并行计算架构天然适合AI。英伟达围绕CUDA构建了强大的软件生态——400万活跃开发者,所有主流框架原生支持。缺点是贵。一颗H100卖4万美元,而且功耗巨大。
FPGA:一套乐高积木。
FPGA是"现场可编程"的——芯片生产出来后,工程师可以通过软件重新定义其内部的逻辑连接。这意味着极度灵活:今天用来加速搜索排序,明天可以重新配置来做网络协议卸载,后天又能跑AI推理。微软Catapult证明了这个路线可行。缺点是开发门槛高——你需要硬件工程师写Verilog代码,不是调个PyTorch就能搞定。
ASIC/TPU:一把定制的螺丝刀。
谷歌在2015年推出第一代TPU,专门为TensorFlow计算优化。ASIC一旦流片就固定了功能,不能改,但换来了极致的能效比。谷歌2015年发现:数据中心里神经网络推理需求暴涨,但GPU效率不够。于是TPU应运而生。缺点是灵活性最差——模型架构一变,芯片可能就废了。
当时的局面,很像移动互联网早期:Symbian、Windows Mobile、iOS、Android,所有玩家都在押注,没人知道谁会赢。
Intel没有选一条,而是试图把两条路合成一条——CPU+FPGA。
三、两笔天价收购,两个截然不同的结局
2015年6月1日,Intel宣布以167亿美元收购Altera。这是Intel历史上最大的一笔收购。
收购的逻辑听起来非常合理:把Altera的FPGA技术和Intel的Xeon处理器深度整合,给数据中心客户提供"CPU+FPGA"一体化方案。Intel当时画了一个两步走的路线图:第一步,把CPU和FPGA封装在一起。第二步,把两者做到同一片硅片上。
与此同时,FPGA行业的另一个巨头也在被盯着。
2020年10月,AMD宣布以全股票方式收购Xilinx(赛灵思),最初估值350亿美元。2022年2月交易完成时,因为AMD股价大涨,最终价值达到498亿美元。
两笔收购,时间差了五年,金额差了近三倍,最后的结果也差了十万八千里。
Intel + Altera:一场没有兑现的承诺。
2018年,Intel生产出了Xeon Skylake + Altera Arria 10的共封装样品。这是全世界第一颗CPU+FPGA合封芯片。但之后呢?没有量产。永远停在了样品阶段。
更糟糕的是,Altera被收购后,一系列问题暴露了出来。
首先,Altera团队在Intel内部使用Intel自研EDA工具时发现——这些工具是为CPU设计优化的,CPU的逻辑又密又规整,而FPGA的逻辑稀疏且遍布大量互连线。两种芯片的设计需求几乎相反。工具不匹配直接导致产品开发严重延迟。Altera的Agilex 7系列,比竞品Xilinx的7nm Versal晚了整整两年。
其次,Altera业务在Intel这艘巨轮内部,始终是个"小透明"。一年的营收不到20亿美元,在Intel整体营收中占比只有3%-4%。资源分配、战略优先级,都排不上号。
然后就是一连串的连锁反应:Omni-Path互联技术取消(2019年)、Nervana AI加速器取消(2020年)、Optane持久内存取消(2022年)。CPU+FPGA生态的每一块拼图,都在一块块碎掉。
十年后,Altera 2024财年营收15.4亿美元,GAAP运营亏损6.15亿美元。167亿的买入价,变成了87.5亿的卖出价。
AMD + Xilinx:一颗冉冉升起的"自适应计算"星。
AMD的整合走了一条完全不同的路。苏姿丰没有把Xilinx"吃进去",而是让原CEO Victor Peng继续带领自适应和嵌入式计算事业部,保留Xilinx的品牌、渠道和产品线。
更重要的是,Xilinx在被收购前就已经有了一个杀手级产品——Zynq系列。
四、Zynq的降维打击
2010年,Xilinx做了一件在当时看来很激进的事:把ARM处理器直接集成到FPGA芯片里。
这个产品的名字叫Zynq。在此之前,FPGA和CPU是两个独立的芯片,通过外部总线通信,延迟高、功耗大、设计复杂。Zynq把ARM Cortex-A9双核处理器和FPGA可编程逻辑做在了同一片硅上,做到了"无缝融合"。
这个想法有多超前?要知道,直到今天,Intel和AMD还在讲CPU+FPGA异构的故事——而Xilinx十几年前就做出来了,还卖得很不错。
Zynq UltraScale+ MPSoC是目前的主力产品。一片芯片里集成了四核Cortex-A53(跑Linux)、双核Cortex-R5(做实时控制)、GPU、以及FPGA可编程逻辑。BMW的自动驾驶系统用这个芯片做传感器融合——激光雷达、摄像头、毫米波雷达的数据实时处理,延迟控制在10毫秒以内。工业机器人用它做运动控制+视觉检测一体化方案,取代了传统的"PLC+专用视觉芯片"架构,成本降了20%,体积小了40%。
再往上,就是Versal平台。Xilinx把它叫做ACAP——自适应计算加速平台。7nm工艺,内置AI Engine(AI矢量处理器阵列),专门为大模型推理做优化。
所以当AMD在2022年完成收购时,拿到的不是一个"传统FPGA供应商",而是一个已经有了ARM+FPGA+AI Engine完整产品矩阵的"自适应计算平台"。
而Altera在做什么?
在被Intel收购的那些年里,Altera的资源被分散了。当Xilinx在推Zynq和Versal的时候,Altera连自己的SoC产品线都更新迟缓。等到Agilex 5系列在2024年发布,市场上最好的坑位早就被Xilinx占完了。
一步慢,步步慢。
五、赢家只有一个,但不是因为路线错了
复盘这十年,一个核心问题是:Intel选择FPGA路线,是判断错了吗?
不完全是,但路线的微妙之处在于时机。
英伟达的GPU之所以赢了,不是因为它"技术上比FPGA好",而是因为AI算力竞赛的核心是训练,不是推理。训练一个大模型,需要的是绝对的海量并行算力。这一点,GPU天生占优——几千个核心同时跑矩阵乘法,FPGA和ASIC都做不到这个灵活度。
而当2018年之后,OpenAI、Google等掀起的"大模型军备竞赛"让训练算力需求指数级增长,GPU就成了唯一解。英伟达的CUDA生态已经积累了十几年,500万开发者、所有主流框架的原生支持——这不是任何一个FPGA厂商能在三五年内赶上的。
但这不是故事的全部。
Intel失败的另一半原因,是执行力的崩塌。同样选FPGA路线,AMD通过Xilinx的整合,在嵌入式AI、边缘计算、工业控制等场景打开了新的增长空间。AMD在2026财年Q1的数据中心业务收入同比增长了57%,很大程度上就是FPGA+CPU+GPU的组合拳在起作用。
而Intel?CPU业务被AMD蚕食,代工业务连年亏损,GPU追不上英伟达,FPGA也做丢了。样样都想做,样样都做不好。
2024年12月,Intel董事会终于动了手。CEO帕特·基辛格被解职。陈立武接任后的第一把火,就是砍掉非核心资产——Altera被摆上了货架。
六、FPGA还有机会吗?
但如果你以为FPGA的故事就这么结束了,那可能错过了正在发生的最有意思的事。
2026年3月,英伟达GTC大会上,黄仁勋发布了下一代AI计算平台Vera Rubin。在这个平台的设计中,有一个细节耐人寻味——
FPGA被首次列为AI推理机架的标准协处理单元。
Groq 3 LPX推理机架,每个Rack配32颗FPGA,单价约1.2万美元。FPGA承担什么任务?节点互联调度、协议转换、推理任务的预处理和后处理加速。GPU负责大规模并行计算,FPGA负责灵活调度和低延迟控制。
这是一个标志性事件——当初被GPU碾压了的FPGA,现在被黄仁勋亲自请回了牌桌。
为什么?因为AI算力的重心,正在从训练转向推理。
德勤的数据显示,2023年AI训练负载占总算力的约60%,到2026年,推理负载占比已经飙升到了67%。训练一个GPT只需要做一次,但推理——每一次用户对话、每一次图片生成、每一次代码补全——要跑无数次。
推理的特点是什么?模型架构固定、成本极度敏感、需要低延迟。这三个特点,全是FPGA的舒适区。
- 模型固定 → 不需要GPU的通用灵活性,FPGA可以针对特定模型深度优化
- 成本敏感 → FPGA的能效比远高于GPU,大规模部署能省下巨额电费
- 低延迟 → FPGA的直接硬件加速,端到端延迟能缩短30%-50%
Midjourney公开过一个数据:把推理业务从英伟达GPU迁移到谷歌TPU之后,月算力成本从210万美元降到了70万美元,砍了65%。这就是专用芯片对通用GPU的降维打击。
而FPGA的定位,恰好卡在GPU和ASIC的夹缝中:GPU太贵太费电,ASIC太死板无法适配算法迭代。FPGA可编程、可重构、低延迟、高能效——恰好填了这个坑。
数据也在说话。Frost & Sullivan预测,2026年全球AI服务器FPGA需求量突破350万片,单台AI服务器的FPGA用量达传统服务器的3-5倍。高端FPGA的交期从8-10周飙升至最长52周。Xilinx和Lattice在2026年3月相继宣布涨价10%-20%。
英伟达GPU的缺货,正在向FPGA市场溢出。而当英伟达自己都开始把FPGA写进参考设计中时,这个趋势已经不是猜测,而是正在发生的事实。
回头看Intel收购Altera这十年,可以得到一个朴素的商业教训:
选择赛道很重要,但赛道上怎么跑,更重要。
Intel选的FPGA路线,本身不是错的。AMD通过Xilinx证明了FPGA在AI时代大有可为。但Intel的问题在于:买了最好的资产,却没有本事把它用好。内部优先级不够、工具链不匹配、制程拖累产品迭代、生态拼图一块块碎掉——再好的战略,没有执行力撑着,都是纸上谈兵。
而Altera接下来呢?脱离Intel、拿到银湖资本的注资后,新任CEO Raghib Hussain已经放话:要成为"世界第一FPGA解决方案提供商"。Altera的Agilex 5系列内嵌AI Tensor Block,面向工业视觉和医疗设备的边缘推理,正在构建自己的差异化优势。
FPGA的故事远没有结束。在AI推理占比持续攀升、英伟达GPU供不应求、定制化算力需求爆发的三重趋势下,FPGA也许正在憧憬从边缘角色,走向数据中心的核心牌桌。
479