• 正文
  • 相关推荐
申请入驻 产业图谱

省52%带宽、超分延迟仅2.3ms:Imagination E系列把AI引擎嵌进了GPU着色核心!

09/28 10:17
432
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

GPU已经从图形处理器演变为统一计算平台。但传统光栅/光追、神经渲染、大模型推理训练这三类负载,计算特征相差太远,想在同一颗芯片上实现,至少要翻三座山:显存容量和带宽构成的内存墙;异构负载之间的资源调度与硬件复用;精度、画质和物理正确性之间的平衡。

面对这三座山, Imagination将可编程AI加速器直接整合进E系列GPU,凭借一颗处理器、一套软件栈,既可独立运行,也可与CPU及其他加速器协同,支持生成式AI、神经渲染与游戏等多种工作负载。

去年底,E系列GPU IP 落地;不久前,Imagination公布了首批性能数据和演示结果,并推出全新的神经超分辨率(NSR,Neural Super Resolution)AI加速超分辨率解决方案。

负载已经融合,芯片没有

Imagination自研架构已有 30 余年历史,该公司CEO Markus Mosen强调,他们是tile-based延迟渲染(TBDR)、虚拟化和功能安全上的领导者,迄今已拥有4000多项图形、计算和AI专利,服务约50家授权企业,也是全球唯一专注GPU IP的供应商。

Markus Mosen的产品策略建立在一个判断上:负载先融合了,芯片却没跟上。在手机、汽车、机器人、工业相机这些应用中,从感知、建模、推理、决策到渲染,是一条数据路径、一个响应时限、一个内存预算;而负责处理的DSP/NPU/GPU/CPU四个引擎各带各的SRAM,构成四个内存域,中间结果每次都要穿越DRAM。

而融合式加速则是“一个架构上下文,数据离开时只跨一次”。“这种现状导致数据每一次跨引擎传输都在交税,而且不止交一遍。”Markus Mosen 表示,“数据搬运是纳焦耳级的能耗损失;跨引擎延迟是毫秒级的等待,任何调度器都是这样;更麻烦的是每个引擎都要独立维护工具链、驱动和安全模型,这是按工程师年计的隐性成本。”

这种代价正在推动行业走向一个共同的方向:CPU在加向量/矩阵扩展,GPU在吸收AI计算和神经渲染,NPU在增加可编程性,所有模块都在往“一个共享的可编程中心”汇聚。

Imagination认为这个中心应该是GPU:它已经可编程,且具备大规模并行、天生并发的特性;GPU在边缘等市场已规模化应用,驱动、工具链、标准、开发者生态都很成熟,开箱即用;更重要的是,图形是任何视觉设备都需要的工作负载,而GPU自带渲染引擎。

矩阵引擎进核,而不是进 SoC

这正是 E系列诞生的原因。Imagination首席营收官 Jake Kochnowicz 表示,E系列最大的架构变化,是首次将矩阵加速引擎直接嵌入 GPU 内核的每个统一着色核心或着色器(USC,Unified Shading Core)中,图形负载和AI/计算负载共享同一套GPU资源、内存层级和固件调度。这直接提升了计算的性能和效率。

E系列单核在1GHz 下即可提供2TFLOPS 图形算力、32 TOPS INT8/FP8 AI算力与64 Gtexel/s纹理吞吐,INT8/FP8算力较上一代D系列提升4倍。

基于同一架构,E系列可从单核灵活扩展至4核乃至多芯粒(chiplet)系统,提供40位地址宽度、最高1TB可寻址内存与768 GB/s峰值带宽,并全面覆盖FP32/FP16、BF16/INT8/FP8以及面向大模型推理的MXFP8/MXFP4微缩计算格式——E系列首次将 BF16、MXFP8、MXFP4 这些数据格式带入嵌入式领域。

Jake Kochnowicz强调,没有一种数据格式是万能的,这也是E系列同时支持如此多数据格式的原因:自动驾驶对精度要求极高,绝不能因精度损失导致事故;而在带宽和容量受限的消费类边缘设备上,FP4恰好能带来巨大节省。

此外,E系列的片上RISC-V固件处理器统一调度图形与计算任务,支持多达 16 个虚拟机及QoS优先级与内存隔离。这种配置非常适合汽车座舱“一芯多屏多系统”的应用。

面向设备端AI的可编程加速

通常,芯片架构定型后,AI模型及其底层运算仍在持续演进。而E系列具备通用计算能力,采用熟悉的GPU编程模型并支持行业标准API,使开发者能在设备全生命周期内实现新算子,并通过GPU内高度集成的矩阵加速器(Matrix Accelerator)加速,同时支持BF16、FP4和MX等高精度与低精度数据格式。其结果是,与上一代D系列相比,该处理器在典型边缘语言模型上的预填充性能提升了4.7 倍。

以Qwen 3.5 4B为例,在典型工作负载下,一款1.5 GHz的四核E系列GPU可实现 0.2秒的首次Token生成时间,以及每秒150个Token的解码吞吐量。为简化向Imagination GPU的移植,Imagination正在将经过优化的llama.cpp后端贡献至上游开源项目;后续还将提供原生 PyTorch 和 ONNX Runtime 支持。

智能计算的坚实基础

除了加速计算,E系列还在AI、计算机视觉、信号处理和通用计算中广泛使用的基础计算操作方面提升了性能。例如,与D系列同类产品相比,E系列运行Conv2D内核的速度快 4.4 倍,运行GEMM内核的速度快4.8 倍。在矩阵乘法工作负载下,GPU利用率可达89%。配合imgNN、imgGC、imgBLAS、imgFFT等计算库,E系列为各类计算密集型负载提供完整支撑。

将AI引入图形处理

通过神经渲染,融合技术为图形处理管线创造了新的机遇。Imagination的全新NSR技术利用行业标准扩展,将E系列的矩阵加速技术应用于图形处理管线。该时序超分辨率方案针对GPU进行了深度优化,采用单次处理方式,并结合Imagination 专有的网络自压缩技术,可移除神经网络中约65%的冗余权重,让模型更省电。在1 GHz 单核E系列GPU上,典型的540p到1080p超分辨率操作延迟低至2.3毫秒。

与原生渲染相比,NSR不仅将帧率显著提升,还将内存带宽消耗减半(1080p到4K输出场景下带宽占用降低52%),同时呈现出与真实图像视觉效果极为接近的画质。NSR将作为库功能集成于PowerVR SDK中,并通过与Unreal Engine和Godot的集成提供支持。

需要强调的是,图形处理仍然是E系列的核心。该架构带来了显著的图形性能提升,完整支持DirectX 12(FL11_0)与Vulkan。在实际游戏工作负载中,E系列与上一代同类产品相比,性能提升高达 54%,每瓦性能提升最高达 39%;其四核配置(EXD-64-2048)在《博德之门3》等AAA级桌面游戏中可流畅突破60fps。

软件生态与应用场景

E系列提供覆盖Linux、Android与Windows 11的完整软件栈,并配备PVRTune专业分析工具,助力开发者高效调优。凭借图形与AI一体化的单一可编程算力底座,E系列广泛适用于智能手机、Windows 11 PC、汽车数字座舱与边缘AI设备。

就负载特征而言,Jake Kochnowicz 的判断值得关注:LLM的预填充阶段的矩阵算力,决定生成首个Token的延迟;解码阶段的内存带宽,决定每秒Token数;而带宽是SoC设计者自己的选择。

简而言之,矩阵引擎决定上半场,SoC集成质量决定下半场。Imagination 也在工具和软件上投入,帮助客户把模型量化到更低位宽的同时保住精度。他强调,AI不能只看TOPS——系统带宽受限时,堆更多TOPS也解决不了系统问题。

针对“到底要不要 NPU”的问题,E系列通过邮箱机制、低延迟切换功能及共享内存技术,可与任何加速器无缝协作,适用平台涵盖GPU-only、GPU+NPU(GPU 为主)、NPU+GPU(NPU 为主)、GPU/NPU均衡等模式。Jake Kochnowicz表示,负载会一直变,因此架构必须提前准备好。

基于这一判断,Imagination的产品路线将沿着已有的D系列(计算库与 SDK)向最新的E系列(On-GPU AI)、下一代的 F-Series(扩展效率)以及未来的(AI 密度与效率)方向迭代。他也特别强调,E系列的统一软件栈可以保护客户的投资:客户针对某一代GPU做的优化不会因为换代而白费,可以一代一代接着用;更重要的是,软件跑得比硬件快——今天还没出现的新 AI应用明天就会来,可编程的GPU能让产品在交到客户手里后尽可能长久不过时。

商业逻辑这笔账如何算

E系列落地之后,Imagination 的卖点从“图形 IP”升级为“融合加速平台”。过去客户购买 PowerVR GPU,看中的是渲染能力;现在Imagination主张的是一个架构覆盖图形、神经渲染与AI计算的长期确定性。

对汽车、工业这类生命周期十年以上的SoC项目,“负载会变、架构不用换”恰好解决了最大的痛点。这也是为什么平台属性被摆到和TOPS同等重要的位置——重要的不仅仅是跑分,而是项目周期的保鲜期有多长。

开放生态被Imagination视为这套平台战略的基石,Markus Mosen强调。事实上,在GPU竞争的格局中,能够绕开英伟达的CUDA是开放生态的一个支点,对追求供应链安全和多供应商策略的客户——尤其是中国市场——有实实在在的吸引力。但CUDA迁移成本仍然是开发者和企业需要考虑的问题。对于已经深度依赖CUDA特定代码和软件库的应用而言,迁移到其他平台通常需要进行代码移植和性能优化。

不过,这种依赖更多属于软件实现层面,像Gaussian Splatting这样的技术本身并不天然绑定CUDA,基于Vulkan的实现也正在出现,包括英伟达自身也提供了基于Vulkan的相关渲染示例。因此,Imagination更强调通过开放的标准和软件生态,保护开发者已有的软件投入,同时扩大未来的部署选择。

与其直接替换CUDA,不如保留开发者熟悉的应用框架,并逐步完善和优化底层软件,让开发者可以根据不同硬件平台进行适配和优化。这一思路也体现在Imagination对软件生态的持续投入上。

目前,公司正在推进经过优化的llama.cpp backend向上游贡献,后续还将进一步提供原生的PyTorch和ONNX支持。对于客户而言,这意味着随着应用需求不断变化,可以持续基于GPU构建和扩展应用:对于常见运算,可以使用经过硬件优化的计算组件;当需要不同的功能或行为时,也可以开发自己的kernel,同时保留一个既支持图形处理、又支持通用计算的统一平台。

从这个角度看,摆脱对CUDA的依赖并不是某一家公司的单独任务,而是整个GPU软件生态需要面对的问题。Vulkan 等开放标准正在提供新的机会,使开发者能够在保持软件投资的同时,获得更加广泛的硬件部署选择。

从商业模式来看,Imagination的核心模式并没有改变,依然是IP授权加版税。但如果E系列要从“GPU IP”进一步成为“融合计算平台”,真正需要建立的壁垒就不仅是硬件架构本身,还包括长期积累的软件、工具链、驱动、专利和功能安全能力。

30余年的GPU架构积累、4000多项专利,以及成熟的软件和功能安全体系,构成了客户在选择IP时考虑的综合因素。神经渲染是差异化最明显的一张牌。E系列的NSR能做到2.3毫秒、省 52% 带宽,前提恰恰是矩阵单元嵌在着色管线里,这是独立NPU架构做不到的,属于架构带来的结构性优势。随着端侧游戏和座舱HMI普及神经渲染,E系列的融合架构就会从锦上添花变成不可替代。

结论:值得认真对待的架构演变

E系列为Imagination提供了更高的竞争支点,但还有两个挑战绕不过去。

其一是生态成熟度:Vulkan cooperative matrix和llama.cpp/OpenCL路线虽然开放,模型和算子的覆盖与CUDA生态相比仍有明显差距,解码吞吐受制于SoC带宽,GPU IP这一侧能控制的变量有限——下半场不在自己手里。

其二是独立NPU的挤压和客户自研的长期压力。终端大厂自研加速器的趋势并未停止,IP 授权模式的可服务市场长期承压,短期内尚无正面突破的办法。E系列本质上是用架构革新来优化竞争:不宣称单点TOPS领先,而是论证成本和效率的最优解。用架构统一性应对算力竞赛,进攻点在端侧AI推理和神经渲染,防御点在守住 30 年的图形客户基本盘。

接下来,市场将关注三个验证点:授权客户产品落地;硅后实测和仿真数据差多少;NSR、llama.cpp这些软件在开发者社区的真实采用度。成功与否,就看这三点兑现的速度。

当然,Imagination并不是一个人在战斗,该公司的客户包括全球顶级的智能终端厂商和汽车芯片提供商等,该公司CEO Markus Mosen也强调在中国和越来越多的战略客户开展超越IP交易的合作,再加上该公司参与的多个开放标准组织中也藏龙卧虎,也有充分的机会借助E系列GPU和GPU-First战略与客户在边缘智能全面兴起的时代与客户携手走出新的创新之道。

Imagination

Imagination

Imagination Technologies,英国芯片设计商。

Imagination Technologies,英国芯片设计商。收起

查看更多

相关推荐

半导体科技资讯和观察!