跳转到主要内容

【原创】当所有人都在追NPU,Imagination为什么反而押注GPU?

作者:电子创新网张国斌

AI时代,GPU似乎正在被重新分工。

一边是NPU越来越强,AI加速器几乎成了端侧芯片的“标配”;另一边,越来越多厂商都在思考如何把AI计算做得更专用、更高效。按这个逻辑,GPU似乎应该逐渐退回自己的传统阵地——负责图形,把AI交给NPU。

但Imagination Technologies却选择了另一条路。它没有因为AI的到来而弱化GPU,反而进一步强化“GPU-First”战略:把矩阵计算、低精度AI、神经渲染等能力更深地融入GPU架构,希望让GPU从传统的图形处理器,进一步成为一个在端侧能够同时承载图形、通用计算和AI的可编程计算中心。

问题也就来了:当NPU已经成为端侧AI的主流选择,GPU为什么还值得押注?答案可能并不是“GPU也能做AI”这么简单。

真正发生变化的是,端侧AI正在让计算变得越来越复杂:模型在变、算子在变、精度在变,AI开始与图形、视觉、传感、实时交互深度耦合。对于这样的计算环境,专用加速器追求的是“把确定的事情做到极致”,而GPU所拥有的可编程性,则可能意味着另一种价值——面对不断变化的工作负载,保持足够的适应能力。

这也解释了Imagination的选择:以不变应万变--不变的是GPU,不变的是30多年积累的图形架构、软件生态和开发者基础;变化的,则是GPU内部的计算能力、数据类型、AI加速方式以及它在整个SoC中的角色。

所以,Imagination真正押注的,可能不是“GPU打败NPU”,而是一个更大的问题:在AI工作负载越来越不可预测的时代,谁有机会成为端侧的可编程计算中心?

端侧AI真正带来的机会,是计算边界正在重新打开

近日,Imagination Technologies在中国举行的媒体开放日上,公司CEO Markus Mosen亲自下场推介其最新的E系列GPU IP以及全新的Neural Super Resolution(NSR,神经超分辨率)AI加速超分辨率解决方案。

Image
GPU

Imagination Technologies CEO Markus Mosen

“今天想讲的第一件事,是半导体行业正在出现的“融合”趋势,以及在这个趋势里GPU会扮演什么角色。现在手机、汽车、机器人、工业摄像头这些设备,引入AI之后要干的活儿有好多步,但这些活儿不再是各干各的——它们在同一个回路里跑,用的是同一块电池的电,共享同一套资源预算。可在硅片层面,这种融合还没有真正发生。过去的办法也很管用:要干什么活儿,就专门加一个专用芯片、专用加速器。图形这一块很早就加了GPU,信号处理用DSP,神经网络用NPU,再加上更早的CPU,本质上都是专用芯片、专用加速器。”Markus Mosen指出,“业界一种做法是把它们都塞进SoC,但这就带来一个大问题:各个部件之间要通过外部内存来回传数据,而外部内存是最贵的。我把这种昂贵的数据通信叫作“边境税”——每个部件像一座孤岛,孤岛之间用最贵的方式连起来。这个成本可以拆成三块:一是数据在外部内存来回搬运耗掉的能量;二是数据通信带来的时延;三是开发投入的年工程和人力成本。现在的趋势是这些模块在互相靠拢:CPU加了向量和矩阵扩展,NPU加了更宽的数字格式支持,GPU也在吸收AI计算和神经渲染。我们的看法是,真正需要的是一个共享的、可编程的“重心”。有了这么一个可共享的可编程中心,整套系统就更灵活,数据传输量大降,计算资源利用率也上来了。”

Image
当所有人都在追NPU,Imagination为什么反而押注GPU?

“融合已经在发生,问题是谁当这个重心。我们的判断是GPU。原因很简单:GPU本身就是可编程的,已经在各种设备和边缘端规模部署,驱动、工具链、公开标准、开发者生态都最成熟,而且它本来就在干图形渲染这个必需的活——任何要显示的设备都离不开图形处理。别的计算部件想来当这个重心,都还得至少补齐我们刚才说的这几样里的一样,而GPU全都有。”Markus强调。。

过去,业界有一句话是“专业的人干专业的事!”例如CPU负责通用计算,GPU负责图形,DSP负责信号处理,NPU负责神经网络--在这种分工下,不同工作负载对应不同的专用处理器。这种架构在特定时代非常有效,因为每一种工作负载都相对明确。专用硬件可以针对固定算法进行极致优化,在性能、功耗和面积之间取得很好的平衡。

今天的AI已经不再只是一个“跑模型”的问题。

手机上可能需要同时处理生成式AI、计算摄影、语音、视频、图像生成;AI PC需要运行本地LLM、代码助手和Agent;汽车需要同时面对视觉、座舱、导航、感知和实时交互;机器人则要把视觉、语音、空间理解和动作控制连接起来。

更重要的是,这些算法还在快速变化--模型会变化,算子会变化,精度会变化,数据规模会变化,甚至AI处理的任务本身也在变化。

而当芯片架构在产品定义时就把 AI 工作负载"写死",几年后这部分硬件还能不能继续发挥价值?这正是端侧 AI 给传统异构计算架构带来的第一个挑战。对此,Markus 把这种现象概括为"碎片化":为了应对不断增加的工作负载,SoC 不断增加新的专用加速模块、软件栈和数据通路,模块越多,系统集成越复杂,不同加速器之间的数据搬运成本也越高,而且一旦面对新的工作负载,部分固定功能硬件就可能出现利用率下降。

目前“计算正在从“为某一种任务设计硬件”,转向“为不断变化的任务提供计算能力””。

这正好击中了GPU最传统、也是最容易被忽略的优势——可编程性。

二、Imagination为何“不追NPU”?

如果沿着传统思路走,Imagination完全可以把GPU和NPU进一步做成两个独立模块。GPU负责图形,NPU负责AI。事实上,这也是目前很多SoC的基本路径。

但Markus表示Imagination选择了另一条路线:继续坚持GPU,同时改变GPU本身,这就是“GPU-First”。

这里有一个很重要的区别--GPU-First并不意味着GPU-Only。

Markus并不认为CPU、NPU或者DSP会消失。相反,在汽车、机器人等复杂系统中,GPU本身只是异构计算体系的一部分。E-Series也设计了硬件mailbox、低延迟交接和共享内存等机制,让GPU能够与SoC中的其他处理器协同工作。

它真正想改变的是:在越来越多不确定的工作负载面前,谁可以成为系统里的“可编程计算中心”?Imagination给出的答案是GPU。

原因也很现实--GPU已经存在于手机、PC、汽车等大量终端设备中,而且图形处理本身并不会因为AI出现而消失。手机需要UI和视频,PC需要图形,汽车需要座舱和显示。

换句话说:GPU不是为了AI才进入端侧,而是它本来就在端侧。

现在的问题变成了:既然GPU已经存在,能不能让这颗GPU同时承担更多计算任务?

Image
当所有人都在追NPU,Imagination为什么反而押注GPU?

这就是Imagination所说的“converged accelerator”。笔者认为从这个角度看,GPU-First其实是一种非常典型的“以不变应万变”的融合加速——下文将进一步解释它的硬件形态。

不变的是GPU--30多年积累下来的GPU架构、图形能力、开发工具和软件生态没有被推倒重来。

变化的是GPU--它开始吸收GPGPU、矩阵计算、低精度计算、神经渲染以及生成式AI等新的工作负载。

三、E-Series真正的创新,不是“GPU里加了一个NPU”

如果只是简单地在GPU旁边放一个矩阵加速器,这个战略其实没有那么大的意义。E-Series值得关注的地方恰恰在于,它试图从架构层面解决AI计算与图形计算之间的数据距离问题。

据介绍,E-Series将Matrix Accelerator(矩阵加速器)深度集成进GPU的Shader/Compute架构,与GPU共享资源、调度、寄存器以及内存层级。这与传统的“GPU算完→写入DDR→NPU读取→计算→再写回DDR”的模式存在明显区别。

为什么这件事情重要?因为端侧AI最贵的往往并不只是计算。数据搬运同样昂贵。

尤其是在手机、汽车、机器人这类功耗受限的设备中,CPU、GPU、ISP、NPU等不同模块共享系统内存。如果一个工作负载需要在不同处理器之间反复搬运数据,理论上的TOPS最终未必能够转化成实际的系统性能。

Markus把它称为“cost of distance”--距离越远,数据搬运的延迟和能耗通常越高。因此,GPU和AI计算越靠近,实际上就越有可能减少数据移动。而这正好形成了E-Series最有代表性的应用:Neural Rendering。

这种"靠近",在 E-Series 的具体实现里被进一步工程化为一种融合 GPU(converged GPU)架构:Matrix Accelerator 不是作为外挂模块并排放置,而是下沉到统一着色簇(USC)内部,与图形渲染共用同一组 ALU、寄存器、共享本地存储(Unified Store、LMS、MCU L1 Cache)以及同一套片上固件调度器。换句话说,GPU 不再只是承载图形的处理器,而是同时承载图形、通用计算与 AI 的融合处理器。这种架构的好处是立体的:

第一,距离成本被压到最小。原本"GPU→DDR→NPU→DDR→Display"的数据往返,现在变成 GPU 内部 Tile 级别的本地交换——E-Series 为此在每个 USC 配备了 512 KB 统一存储(Unified Store)和跨 16 个 bank 的本地存储(LMS),神经渲染、AI 卷积、FP16 / BF16 / INT8 / FP8 / MXFP 矩阵运算都可以在本地就近完成,AI 不再需要把中间结果回写到外部 DDR。

第二,硬件利用率被推到极限。E-Series 里,图形、Compute、MMA、2D、光追可以在同一颗 GPU 里并发执行,由片上固件调度器自主仲裁。这意味着同一颗硅片在跑 UI 渲染的同时,还可以并行跑 AI 超分、卷积或大模型 Prefill,而不必再分别为图形和 AI 砸两颗芯片。

第三,能效与时延被同时优化。Matrix Accelerator 与图形共用本地存储,"边境税"——也就是数据在外部内存来回搬运所消耗的能量和延迟——被直接消除;对电池供电的手机、被动散热的 AR / VR、对功耗极敏感的汽车系统,这意味着单位 TOPS 对应的系统级功耗,比"GPU 加外挂 NPU"那种松耦合方案更低。

第四,软件栈被统一到一套 API 上。开发者可以用 Vulkan 或 OpenCL 的同一条着色器 / 算子代码路径去写 shader、写 AI 卷积、写矩阵乘,而不必在"图形渲染管线"和"AI 推理 Runtime"之间维护两套工具链、两个内存模型、两份调度逻辑。E-Series 沿这条路径提供 Kernel 库、PowerVR SDK 对神经渲染(包括 NSR)的支持,以及 Unreal Engine / Godot 的集成。

因此,融合 GPU 并不是一个营销词。当 GPU 的算力、本地存储、片上调度以及软件栈同时向图形和 AI 敞开时,AI 也就顺理成章地成为 GPU 内部的一种计算能力。这正是接下来要谈的 Neural Rendering 之所以关键的真正原因——它是这套融合架构跑出来的第一个有代表性的工作负载。

四、Neural Rendering:融合 GPU 架构跑出来的代表性工作负载

传统图形渲染和AI处理,本来是两个不同的世界。GPU生成画面,然后把数据写入DDR;NPU再读取这些图像进行AI处理,再写回内存。

E-Series则把 AI 直接放进 GPU 的渲染路径,利用 TBDR(Tile-Based Deferred Rendering)天然的分块能力,在 Tile 级别同时完成图形与 AI 处理。这相当于把"GPU → DDR → NPU → DDR → Display"的链式往返,压缩成 GPU 内部一次本地交换。

于是,AI并不是一个“渲染之后再接入”的外挂模块,而是可以和图形处理一起完成。Imagination此次公布的NSR(Neural Super Resolution,神经超分辨率)就是一个很典型的例子。

Image
当所有人都在追NPU,Imagination为什么反而押注GPU?

据介绍,在单核E-Series、1GHz配置下,NSR可以在2.3毫秒内完成540p到1080p的时域超分;1080p到4K的超分场景,内存带宽消耗最高可降低52%,网络权重通过自压缩技术减少65%。

这些数字证明了一件事情:AI和图形如果从架构层面真正融合,它优化的就不只是AI计算本身,而是整个数据路径。这也是为什么我认为,单纯把E-Series理解为“一个更强的AI GPU”其实低估了它。

因此,单纯把 E-Series 理解为"一个更强的 AI GPU",其实低估了它真正的架构意义。

五、AI工作负载本身也在从“固定模型”走向“持续变化”

如果说Neural Rendering代表图形和AI的融合,那么生成式AI、LLM和Agent代表的是另一种变化。过去谈AI加速器,经常看TOPS,但LLM时代,仅仅看TOPS已经越来越不够。一个典型LLM工作负载至少包含Prefill和Decode两个阶段。Prefill决定模型处理上下文的速度,直接影响TTFT;Decode则更多受到内存带宽影响。尤其是Agent出现之后,Prefill的重要性进一步提升。

一个Agent并不是简单地输入一句话,然后输出一句话。它可能需要读取文件、调用工具、分析上下文、检索数据、进行推理,然后才开始生成第一个Token。也就是说:第一个Token之前,已经发生了大量计算。

Imagination此次把E-Series的Prefill性能提升到上一代的4.7倍,正是针对这一变化。这其实又一次说明了GPU-First的逻辑。AI工作负载正在变化,因此需要的不只是一个固定的AI加速引擎,而是一种能够不断加入新算子、新模型、新算法的计算平台。

这也是GPU可编程性的重要意义。

六、真正的“以变化迎合变化”:不是追着每一个AI模型造一颗芯片

这里其实可以看到Imagination和传统专用AI加速路线之间一个很有意思的差异。NPU最大的价值之一,是针对已经明确的AI工作负载进行高度优化。但它的挑战也恰恰在这里:

当工作负载发生变化时,原来的硬件优化还能不能继续复用?

Imagination选择的思路则不同。E-Series支持FP32、FP16、BF16、INT8、FP8,以及MXFP8、MXFP4等不同精度,并通过标准GPU编程模型和API提供给开发者。其Matrix Accelerator负责把矩阵计算做得更快,但开发者依然可以使用GPU的通用编程能力。

Image
当所有人都在追NPU,Imagination为什么反而押注GPU?

目前公布的数据中,E-Series相较上一代D-Series,GEMM性能最高提升4.8倍,Conv2D最高提升4.4倍,矩阵乘法GPU利用率最高达到89%。

这组数据的意义并不只是“AI性能提高了多少”。它意味着:GPU正在从图形处理器,逐渐变成一个可以承载越来越多计算原语的可编程加速器。

而这恰恰对应了AI发展的一个基本规律:模型在变,算子在变,精度在变,应用在变。如果硬件无法变化,那么最终只能不断增加新的专用模块。而如果硬件本身具有足够的可编程性,那么就可以通过软件和架构迭代去适应新的变化。

七、所以,端侧AI真正给GPU打开的是“计算中心”机会

如果只看表面,GPU 似乎在不断拓展业务边界。但从架构角度看,事情可能恰恰相反:GPU正在回到它更本质的价值——成为一种高度可编程的并行计算架构,AI 只是再一次证明了这一点。

这正是 Imagination 所说的“converged accelerator”——它的真实含义,是 GPU 从图形加速器向融合型计算中心移动。

而是说,在一个CPU+GPU+NPU+DSP+ISP共存的SoC中,GPU可以成为一个更加灵活的计算节点。

需要图形,它可以跑图形。需要AI,它可以跑矩阵。需要视觉,它可以跑卷积。需要通用计算,它仍然可以通过GPU编程模型完成。需要与NPU、CPU协同,它又能够通过共享内存和低延迟机制完成数据交换。

八、这条路最大的挑战,也恰恰来自GPU最强的地方

当然,GPU-First并不是没有挑战。其中最大的挑战其实不是硬件,而是软件生态。AI时代的软件生态已经高度成熟,CUDA在数据中心和AI开发领域形成了非常强的开发者惯性。大量模型、算子、工具和工程经验已经围绕CUDA形成。

因此,拥有一个可编程GPU,并不意味着开发者自然就会使用它。

Markus表示Imagination的解决方式,是尽可能往更高的软件层迁移。例如支持Vulkan、OpenCL、SPIR-V等标准,同时推进PyTorch、ONNX、Llama.cpp、IREE、MLIR、ExecuTorch等生态,并提供BLAS、FFT以及各种算子和Kernel库。

其逻辑并不是要求开发者重新学习一套完全不同的AI世界,而是尽量让现有AI软件栈能够进入GPU。

九、这也是为什么我认为,“端侧AI给GPU带来机遇”这个判断还不够

很多文章谈到端侧AI,会把逻辑简单归纳成:AI下沉 → 端侧算力增加 → GPU重新获得机会。但这个解释其实停留在市场层面。真正值得关注的是架构层面的变化:云端AI追求的是极致规模化算力,而端侧AI面对的是高度碎片化、快速变化和严格功耗约束的计算环境。

这两种环境对芯片架构的要求并不完全一样。云端追求极致规模化算力,端侧则要面对高度碎片化、快速变化与严格功耗约束的计算环境,这正是 GPU 能重新获得战略空间的原因。

也就是说:端侧更需要兼顾性能、能效、可编程性、软件复用和数据路径效率,这也是 GPU 能够重新获得战略空间的原因。

十、Imagination真正押注的,可能是一个“不会那么快过时”的架构

Imagination并没有试图预测未来哪一种 AI 模型一定会成为主流——这件事本身就很难预测。它选择的方式是不预测具体工作负载,而是让架构拥有适应未来的能力。这意味着真正押注的,不是某一个 AI 应用,也不是某一个模型,而是一种能够同时承载图形、AI 和通用计算,并能随着工作负载变化持续进化的计算架构。

E-Series只是这条路线的第一步。按照Imagination的规划,后续F-Series还将向更大规模配置、更低数据类型以及更高效率继续演进

它可能推动GPU重新定义自己的角色:从过去的图形加速器,走向AI时代的可编程融合计算平台。而这,才是Imagination“GPU-First”战略真正值得讨论的地方。

对此大家怎么看欢迎留言讨论!(完)

注:本文为原创文章,未经作者授权严禁转载或部分摘录切割使用,否则我们将保留侵权追诉的权利