• 正文
  • 相关推荐
申请入驻 产业图谱

AI驱动系统性变革,GPU能否成为端侧融合计算“重心”?

原创
09/21 15:26
804
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

当AI从云端走向终端,从单一应用渗透到手机、汽车、机器人、PC和边缘设备,半导体产业正经历一场系统性变革。过去“一个任务配一个专用加速器”的思路,正在被多任务并行、资源共享、数据频繁流动的现实打破。CPU、GPU、NPU、DSP各自为战的架构,开始面临同一个问题:数据在外部内存之间来回搬运,能耗、时延和开发成本不断攀升。也正是在这一背景下,GPU的角色被重新审视。

GPU的优势在于可编程性和生态成熟度。它既能承担图形渲染这一刚需,又能通过矩阵计算支持AI推理;驱动、工具链、公开标准和开发者生态相对完善。但挑战同样明显:外部内存通信昂贵,软件栈碎片化,CUDA生态惯性强大,NPU在特定AI负载上仍有竞争力,功耗和带宽瓶颈日益突出。GPU能否成为融合计算的“重心”,取决于它能否在性能、能效、软件生态和客户协同之间找到平衡。

近日,Imagination Technologies举办E系列产品展示会暨媒体日。Imagination公司CEO Markus Mosen、首席营收官Jake Kochnowicz、执行副总裁兼中国区总经理谢巍等高管出席,介绍最新一代E系列GPU IP的性能,并与包括与非网在内的众多媒体进行了深入的交流。整场活动传递出一个核心判断:在终端、汽车、机器人、边缘设备AI负载不断融合的趋势下,GPU因其可编程性、生态成熟度和图形处理刚需,有望成为共享端侧计算“重心”。但软件生态、客户协同、开源节奏与市场竞争,仍是其必须面对的现实问题。

从“专用孤岛”到融合加速:GPU被推为可编程重心

Markus Mosen今年2月加入Imagination,他首先强调,Imagination既不是芯片设计公司,也不是半导体公司,而是一家IP公司,为芯片设计公司开发GPU与AI处理器架构,再授权给客户做成芯片。图形GPU业务已做了三十多年,客户芯片最终用于移动、消费、汽车、PC、云端以及AI计算等应用。

Imagination公司CEO Markus Mosen

Markus认为,半导体行业正在出现“融合”趋势。手机、汽车、机器人、工业摄像头等设备引入AI后,要完成多步任务,但这些任务不再各干各的,而是在同一回路中运行,共享同一块电池和资源预算。然而在硅片层面,融合尚未真正发生。过去常见做法是增加专用芯片或加速器:图形用GPU,信号处理用DSP,神经网络用NPU,再加上CPU。若都塞进SoC,部件之间需通过外部内存来回传数据,而外部内存最贵。Markus将这种昂贵通信称为“边境税”,成本包括数据搬运能耗、通信时延,以及年工程和人力投入。

因此,Imagination的判断是,系统需要一个共享、可编程的“重心”。GPU本身可编程,已在各种设备和边缘端规模部署,驱动、工具链、公开标准和开发者生态成熟,且图形渲染是任何显示设备都离不开的刚需。Markus表示,其他计算部件若想成为重心,至少还需补齐其中一项能力,而GPU全都具备。

E系列:矩阵乘法嵌入GPU,性能与能效数据公布

Jake Kochnowicz承接“融合加速”话题,发布E系列GPU IP性能。他表示,GPU是用户体验的核心,每一个像素背后都是GPU在渲染;对开发者而言,不同GPU厂商面对的是同一套行业标准编程模型,代码基本可跨平台运行。如今GPU往往已是芯片中性能最高、面积最大的处理器之一,因此当AI要提升体验时,GPU是最先动手、最快见效的地方。

Imagination公司首席营收官Jake Kochnowicz

E系列的关键变化,是把矩阵乘法直接嵌入GPU,放在现有图形算术单元旁边。Jake称,这意味着AI能利用GPU现成的寄存器、控制、缓存、固件、驱动、工具链和生态,是对既有投资的高杠杆利用。据其公布的数据,E系列每个核心在FP32下为2 TFLOPS(1GHz);做矩阵时,FP16/BF16下为16 TFLOPS,INT8下为32 TOPS,还支持FP8、FP4(含microscaling)。最大四核配置下,FP16超过100 TFLOPS,FP8超过200 TFLOPS,较上一代D系列高出四倍以上。

可扩展性方面,E系列核心从单核到四核,峰值配置可寻址内存1TB,峰值读带宽768GB/s,通过AXI可接HBM、LPDDR、GDDR或统一内存。整个系列贯穿同一套软件、同一个软件栈。Jake还强调,E系列首次把BF16、mxFP8、mxFP4等格式带到嵌入式领域。不同场景对精度需求不同:自动驾驶绝不能因精度损失出事故,消费边缘设备则受带宽和容量限制,FP4能带来节省。这些格式通过面向OpenCL的行业标准SPIR-V协作矩阵扩展提供。

在图形与虚拟化方面,E系列集成自研高性能RISC-V固件处理器,在GPU架构上并行调度图形和计算工作;底层最多支持4核、16台虚拟机,带服务质量、工作负载优先级和内存隔离,可支撑云游戏、云桌面。API兼容性上,支持DirectX 12、OpenCL、Vulkan,能跑在Linux、Android、Windows上;计算上支持ONNX、PyTorch,并对Llama.cpp做上游化。Imagination还提供计算库、工具和分析器。

神经渲染与端侧AI:NSR、Prefill成为重点
Jake用“距离成本”解释神经渲染的价值:数据搬得越远越耗时越耗电。业界常见做法是GPU渲染后写入DDR,NPU再读出超分、写回DDR,成本很高;另一种是把部分AI能力放到GPU旁边,但编程范式不同,数据仍要搬运。Imagination选择把矩阵能力直接嵌进GPU算术单元,图形开发者只需写一套shader,就能在同一编程范式下运行,不必把数据引出到DDR。

据其介绍,Imagination拥有高度优化的神经超分辨率算法,并结合专利压缩技术,可去除给定神经网络中超过一半权重,实现轻量级、低带宽算法。结果方面,单核E系列将540p提升至1080p仅需2.3毫秒;1080p提升至4K时,带宽消耗最高降低54%,帧率提升2.5倍。该算法已集成到PowerVR SDK,并作为Unreal Engine及开源Godot引擎插件提供。现场demo对比1080p原生和540p超分到1080p画面,Imagination称画质呈现没有损失。

AI基础模块方面,Imagination聚焦矩阵乘法和卷积。Jake称,矩阵乘法可视为AI推理引擎,E系列矩阵乘法性能提升近5倍,降低延迟;卷积代表感知,性能提升至上一代4.4倍,组合可实现多模态AI处理。大语言模型分prefill和decode两阶段,prefill最难也最重要,衡量指标是time to first token。E系列把prefill性能提升4.7倍。实际用例中,车机规划行程TTFT约0.2秒、150 tokens/s;盲人智能眼镜描述环境TTFT约0.25秒、153 tokens/s;邮件解读摘要TTFT 0.86秒、约126 tokens/s。Jake称,用低占用小模型,TTFT明显小于1秒、吞吐超过100 tokens/s,对用户已经够快。

与CPU、NPU关系:伙伴而非替代,软件生态成关键
媒体交流中,Agent PC成为一个焦点。Jake认为,CPU和GPU在agentic AI里是伙伴关系。CPU跑驱动、编排模型、工具调用和数据流动,挑战很大程度压在CPU上;GPU或AI处理器则承担大语言模型实际计算。GPU厂商要保证足够算力、内存容量和带宽、支持对应数据类型。未来软件管理更复杂,必须与芯片、板卡伙伴紧密合作,确保工具接入复杂软件栈。他形容,GPU是发动机,提供马力,但不规划往哪开;CPU是驾驶员,负责编排。两者互相依赖。

对于多芯粒,Jake表示Imagination有多核架构专有技术,每个单核本身就是完整GPU,核心之间通过内部连线通信协同。芯粒可以是完整SoC芯粒,也可以只是GPU芯粒,通过AXI连接,无论GPU位于不同chiplet,还是GPU与CPU分别位于不同chiplet,都能协同或作为单个GPU运行。

软件生态方面,Jake区分可编程性与固定功能。典型NPU面对PyTorch等上层框架,由图编译器处理,厂商常讲“模型库”,但开发者无法直接写底层flash attention kernel或BLAS库。GPU则可写OpenCL或Vulkan shader、自己的库,还能做FFT、Softmax等前后处理,并接入Llama.cpp、IREE、MLIR、ExecuTorch等开源生态。对于“开发者是否要额外做图形编译器、kernel调优”的疑问,Jake回应称,这不意味着没有优化,而是优化可实现且由开发者掌控,Imagination提供力量与控制权。

竞争与挑战:DLSS/FSR差异、CUDA迁移、开源节奏

谈到神经超分辨率NSR与英伟达DLSS、AMD FSR的差异,Jake称,最大区别是矩阵乘法计算单元深度集成进GPU统一着色器集群内部,紧挨甚至嵌入计算逻辑单元,计算直接在着色器单元本地完成。另一个区别是Imagination一直用分块延迟渲染(TBDR),把屏幕切成许多小块,一次处理一个块,在单个tile上同时完成图形和AI。这种设计面向边缘设备,GPU需与其他部件共享DDR;英伟达、AMD GPU为独立显存设计。功能上超分底层原理差不多,但Imagination把NSR以库功能形式放在PowerVR SDK里、随GPU IP一并开放给授权客户,英伟达方案相对封闭。

关于“一套软件栈”与拥抱开源,Jake解释,Imagination有专有软件栈贯穿GPU家族,授权时给客户源代码,客户可集成进自己的SDK或平台。同时我们也有开源项目,但开源驱动与专有驱动不同,通常需要物理平台才能开发,客户基于硅片或者开发板验证后才可以上游提交。早期只能在模拟器、FPGA上跑,且Windows、最新Android信息受微软、谷歌管控。开源界通常滞后于最前沿。不过,在PyTorch、Llama.cpp等上层AI框架,Imagination已做相关贡献满足上层兼容和适配。

对于3DGS工具链围绕CUDA、迁移成本问题,Jake称,TBDR和编程模型要分开。NSR着色器采用Vulkan,为Unreal和Godot提供插件的方法与英特尔、AMD、NVIDIA一致。CUDA迁移到其他架构类似迁移到ROCm或HIP。Imagination策略是把软件栈向上延伸至PyTorch,提供可从高级框架调用的BLAS、FFT、运算符和内核库,并关注CUDA转SYCL等开源工具。摆脱CUDA依赖是行业问题,多数公司先关注更高层次框架,再逐步向下适配。

中国市场:需求更激进,人事与生态投入加码

中国市场需求是另一重点。Jake称,中国GPU需求巨大,具体到GPU IP,中国市场推得更快、更高性能、更全功能集,正在把GPU IP能力边界往前顶;全球其他市场伙伴更多盯着深度嵌入式汽车应用,而中国对图形和AI计算的IP需求非常强,这也促使Imagination不断创新。

Markus随后就中国区人事调整和市场策略作出说明。他表示,这一系列调整正是出于Imagination对中国市场的重视和长期投入,是为了在中国取得更大成功。管理团队方面,公司任命谢巍担任公司执行副总裁兼中国总经理。Markus称,谢巍在半导体行业很多年,人脉和管理经验都很丰富,相信他能代表Imagination把中国业务做得更好。销售端,Imagination新任命中国销售副总裁宣雄文,销售网络覆盖北京、上海、深圳,且还在继续招人,以加强对客户的支持。

关于中国市场定位,Markus强调,Jake之前已说明中国市场对GPU的重要性,中国显然是全球AI发展最重要的两个国家之一,这一点非常清楚。Imagination已有一批客户,下一步会进一步加强在中国的投入,短期重点仍是把研发做好,把更好的产品和GPU IP带给中国客户、让他们成功,这是今年到明年持续投入的重点。

谢巍则表示,中国一直是Imagination GPU和AI业务核心战略市场,因保密协议无法透露客户名称和桌面GPU出货细节,但今年确实接近百万台量级。他感谢中国软硬件合作伙伴和GPU开发者,并表示会继续关注中国桌面级市场。E系列GPU IP能为汽车、边缘、具身智能机器人等注入AI能力,希望与合作伙伴共建开放生态。

Imagination公司执行副总裁兼中国区总经理谢巍

结语

整体来看,Imagination E系列试图回答一个行业问题:当AI负载与图形负载在边缘和终端融合,是否需要一个统一可编程的GPU重心。Imagination给出的答案是肯定的,并用矩阵嵌入、统一软件栈、神经超分和端侧LLM数据支撑。但E系列能否真正成为客户系统里的“重心”,仍取决于合作伙伴集成、软件栈落地、开源驱动进展,以及其与中国客户、全球生态的协同深度。E系列是起点,后续F系列及更庞大配置、更低数据类型和更高效率的产品,也是验证这条路线的关键。

来源: 与非网,作者: 高扬,原文链接: https://www.eefocus.com/article/2092486.html

相关推荐

与非网总编。所知有限,不断发现。抱持对技术、产业的热情和好奇,以我所知、所见,真实还原电子产业现状和前沿趋势。

微信公众号