“边境税”之战:Imagination E系列与GPU的“重心”赌局

作者:邵乐峰
来源:电子工程专辑


芯片设计行业最近多了一个词:“边境税(Boundary Tax)”。

发明这个词的不是经济学家,而是Imagination Technologies公司CEO Markus Mosen。他说的不是国与国之间的关税,而是芯片内部的一笔通信搬运费:数据每跨过一个计算单元,就要付出能耗、时延和工程时间的代价。一颗SoC芯片里每多加一个专用加速器,就多出一道边界;而每道边界,都是一笔税(Every boundary is a tax)。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

这个比喻,在Imagination日前举办的E系列产品展示会暨媒体日上被反复引用。

作为拥有30余年GPU IP历史的公司,Imagination公布了其E系列GPU IP的首批性能数据和演示结果,并推出全新的Neural Super Resolution(NSR,神经超分辨率)AI加速超分辨率解决方案。

一些足够硬核的数字是值得分享的。例如,与D系列同类产品相比,E系列运行Conv2D内核的速度快4.4倍,运行GEMM内核的速度快4.8倍;在矩阵乘法工作负载下,GPU利用率可达89%;最大四核配置时,FP16超过100 TFLOPS,FP8超过200 TFLOPS,比上一代D系列高出四倍以上。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

但在数字背后,这家公司真正想讲述的,其实是一个关于行业走向的判断:计算正在走向融合,而融合的重心,将是GPU。


“每一道边界都是税”

过去二十多年里,芯片设计的主流思路是“分而治之”——图形处理交给GPU,信号处理交给DSP,神经网络处理交给NPU,CPU负责统筹调度。这套分工在功能单一的时代行之有效,但进入AI时代后,手机、汽车、机器人里的AI任务越来越多,它们在同一个回路里运行,共享同一块电池、同一份内存预算,硅片层面却依然是各自为政的“孤岛”。

“每个部件都像一座孤岛,孤岛之间用最贵的方式连起来。“Markus把孤岛之间的通信成本拆成三笔账:数据在外部内存来回搬运耗掉的能量、通信带来的时延、以及开发投入的年工程和人力成本。换句话说,每多加一个加速器,就多一套软件栈、多一支团队、多一段集成周期。

“实际部署里,软件才是最大的成本,不是硬件本身。”Imagination首席业务官Jake Kochnowicz在回答媒体提问时说,“不少做嵌入式SoC的客户一直在追问,你们的GPU性能能做到多强?能不能替换掉NPU?原因很简单,跑多套不同软件栈实在太贵了,也太复杂。”

换个角度看,这些模块现在其实都在向同一个方向靠拢:CPU增加了向量和矩阵扩展,NPU添加了更宽的数字格式支持,GPU则在吸收AI计算和神经渲染。Jon Peddie Research总裁兼创始人Jon Peddie博士把这称之为“传统处理器类别之间的界限正在逐渐模糊。“

“边境税”之战:Imagination E系列与GPU的“重心”赌局

那么,问题也随之而来:随着功能不断融合,谁最有可能在这一趋势中脱颖而出?或者说,谁才是那个共享的、可编程的“重心”?

Imagination给出的答案就是GPU。在Markus看来,GPU本身就是可编程的,已经在各种设备和边缘端实现了规模部署,驱动、工具链、公开标准、开发者生态最为成熟,而且它本来就在干图形渲染这个必需的工作——任何要显示的设备都离不开图形处理。

“别的计算部件想当重心,至少得补齐其中一样,而GPU全都有。”Markus说。


把矩阵乘法嵌进GPU

在E系列的架构设计中,Imagination没有在GPU旁边单独外挂一颗NPU,而是把矩阵乘法单元直接嵌进了图形计算单元内部。这意味着,AI能把GPU现成的一整套东西都用上,包括寄存器、控制、缓存、固件、驱动、工具链,以及围绕GPU的整个生态,是对既有投资极高的杠杆利用。

如果换算成算力数字,E系列每个核心在FP32下是2 TFLOPS(1GHz),同样的算力转换成矩阵运算,是FP16/BF16下16 TFLOPS、INT8下32 TOPS,还有FP8、FP4(含microscaling)的性能。

但GPU不只是堆TOPS、堆FLOPS这么简单,它还得能用于真实系统,给系统设计者留足选择空间。为此,E系列核心实现了从单核到四核的可伸缩配置,峰值配置下可寻址内存为1TB,峰值带宽768GB/s,通过AXI还能连接HBM、LPDDR、GDDR或者统一内存中的任意一种。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

架构上的深度融合,换来的是数据格式多样性的跃迁。

E系列第一次把BF16、mxFP8、mxFP4 这些格式带进嵌入式领域。毕竟没有一种数据格式是万能的,比如自动驾驶不能因为精度损失导致出事故,而消费类边缘设备对带宽和容量极度敏感,FP4正是为后者准备的。最终,这些格式通过面向OpenCL的行业标准SPIR-V协作矩阵扩展提供,因为这背后是同一种统一的软件。

“我们的矩阵计算单元直接原生集成在统一着色器(USC)的算力通路与流水线中,共享寄存器与调度资源;而非像传统独立 GPU 那样,在计算核心内部划分出分立的 Tensor Core 与通用 Shader ALU 执行单元。”Jake介绍到。

性能提升在真实负载里得到了验证。数据显示,E系列的预填充(Prefill)性能提升了4.7倍,这是大模型体验最关键的环节——time to first token(首次Token生成时间,TTFT)。现场演示中,一款1.5GHz四核E系列运行Qwen 3.5 4B时,TTFT只需0.2秒,解码(Decode)吞吐量150 tokens/s。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

如果你对这些指标意味着什么还不是十分清楚,可以对比一下这些行业用例:比如车机规划行程时,TTFT约为0.2秒、解码吞吐量150 tokens/s;盲人戴智能眼镜描述周围环境时,TTFT约0.25秒、153 tokens/s;邮件解读和摘要时,TTFT为0.86秒、126 tokens/s。这些TTFT明显小于1秒、吞吐超过100 tokens/s的低占用小模型,对用户来说已经够快、够跟手。

Agentic AI演示中,模型通过Llama.cpp接上OpenCode智能体框架,先连调度器、收集数据、推理,然后才开始吐第一个token——在第一个token之前,每一步都是计算。当上下文规模指数级增长,prefill优化的价值会被进一步放大。

图形处理的老本行当然也没有丢,尤其是跑高性能负载的能力。E系列里集成了Imagination自研的高性能RISC-V固件处理器,可以在GPU架构上把图形和计算工作并行调度。底层最多支持4核、16台虚拟机,带高质量服务、工作负载优先级和内存隔离,云游戏、云桌面这类场景都能撑住。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

众所周知,GPU有多大本事很大程度上受软件限制,E系列在图形上支持DirectX 12 FL11_0、OpenCL、Vulkan,能运行在Linux、Android、Windows操作系统上;计算上进一步支持ONNX、PyTorch,并对Llama.cpp进行了上游化处理。此外,Imagination还拥有自己的一套计算库、工具和分析器,以帮助开发人员创建、优化并最终部署应用程序。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

“E系列第一次把高性能带到桌面端。”Jake提供的数据显示,诸如《博德之门3》这样的AAA级桌面游戏,其在四核E系列上的帧率可达到60fps以上;《古墓丽影:暗影》、《毁灭战士》展示了图形保真度;在实际游戏负载中,每TFLOPS算力对应的帧率比上一代提升54%,每瓦性能提升39%。

“边境税”之战:Imagination E系列与GPU的“重心”赌局


一次渲染,两笔账

如果说矩阵乘法是E系列对AI的正面回应,NSR则是它向图形老本行交出的答卷。

神经渲染的本质,是让AI加工GPU渲染出的图形数据,实现超分、插帧等效果,最后显示给用户。业界通行的做法有两种:一种是图形与AI完全分开,渲染结果写进DDR、NPU读出来处理完再写回DDR。不过在Imagination看来,这笔“边境税”贵得离谱。

另一种趋势是把部分AI能力挪到 GPU附近,但尚未完全耦合,由于编程范式不一样,数据依然需要在缓存和片上之间来回搬运。Imagination的选择是把矩阵能力直接嵌进GPU算术单元,让图形开发者用同一套Shader(Vulkan或OpenCL)在单次渲染中完成全部工作,数据不用离开芯片。

“边境税”之战:Imagination E系列与GPU的“重心”赌局

于是,我们看到了相当惊人的效率数字。在单核E系列上,将540p分辨率提升到1080p只需2.3毫秒;如果从1080p提升至4K,带宽消耗最高下降54%,帧率提升2.5倍,画质几乎是无可感知的损失。支撑这组数字的,是Imagination拥有大量专利的网络自压缩技术,该技术可以移除神经网络中约65%的冗余权重——模型轻了,带宽省了,才能在边缘端跑起来。

目前,Imagination已将NSR集成到PowerVR SDK中,并并通过Unreal Engine以及开源Godot引擎的插件提供给应用开发者。

另一个差异化来自Imagination坚持了多年的分块延迟渲染(TBDR)架构。在该架构中,GPU一次只处理屏幕的一小块,图形与AI在同一块tile上完成,这种为共享内存而生的效率,恰恰是它的护城河。

“我们也清楚,Imagination的GPU并非孤立运行,它处在一个由IP厂商、SoC厂商、软件开发者组成的丰富生态里。系统到底怎么组合这些能力,由合作伙伴决定。“Jake表示,Imagination在E系列架构里增加了硬件mailbox、低延迟交接、共享内存,以及一套客户能集成进自身SDK的开放软件栈,专门用于跟SoC里其他处理器进行交接和互操作,核心目的就是“要在对的时间、用对的处理器、出对的结果。”

相比前代E系列在架构和性能方面都实现了更加巨大的飞跃,并将AI融入了GPU的核心能力之中。根据规划,接下来的F系列及后续产品将把这些GPU推向更庞大的配置、更低的数据类型和更高的效率。


接近百万台的桌面市场

中国市场是这场发布会另一个受关注的部分,不仅因为新上任的中国区总经理谢巍首次公开亮相,更因为一个流传已久的数字得到了证实。

“今年我们确实正在接近百万台这个量级。”当被问及国产桌面GPU出货传闻时,谢总给出了确认。尽管由于保密协议,他无法透露客户名称,但这个数字本身,已经说明Imagination在国产桌面 GPU 浪潮中的位置。

作为多代产品合作伙伴,象帝先计算技术有限公司总经理张珩评价说,“Imagination之所以能成为我们多代产品的合作伙伴,得益于其前瞻性的GPU路线图,以及在GPU设计中优先追求真实场景性能,提升用户体验而非单纯峰值TOPS和FLOPS的务实理念。”

Jake则从另一个角度解释了中国的特殊性。“中国市场要求更高的性能和更全的功能集,是真正在把GPU IP的能力边界不断外扩。”相比之下,海外客户更多盯着深度嵌入式的汽车应用,并不追求成百上千TFLOPS的图形性能,面向的是更受限、更深度嵌入式的设备。言下之意,中国正在成为Imagination创新最重要的反馈回路。


AI也在重塑芯片设计本身

在被问及“AI是否会影响IP公司的价值边界”时,Jake用两个具体的例证给出了自己的看法。

一是EDA物理设计。目前,Synopsys、Cadence等EDA大厂已经把AI能力做进物理设计工具,在加快流片、提升性能、降低功耗和面积上表现明显,Imagination在自己的IP参考实现中也通过使用这些工具尝到了甜头。

二是软件开发。对IP公司而言,这是AI价值最直接的落点。“写代码往往不是最花时间的,最花时间的是调那些藏得很深的复杂软件栈bug。”Jake举例说,一个极难定位的编译器corner-case bug,以往人工排查大约要十天,用AI工具的话,30分钟就解决了。

这表明,当芯片本身在融合时,芯片的设计方式也在被AI改造。对IP公司来说,这既是效率红利,也可能重塑行业的价值边界——当工具链的智能化让“设计”本身贬值,真正值钱的,或许只剩下架构判断和生态粘性。Imagination选择在这时把赌注押在“融合”上,时间点值得玩味。


赌注与回声

把镜头拉远,这场媒体开放日其实更像是一次战略表态:Imagination押注融合GPU会发生在边缘AI,在那些必须精打细算每一瓦电、每一字节带宽的设备里,用一颗GPU同时干图形、计算和AI的活。

但这个“赌注”要建立在两个前提上:一是软件成本终将压过硬件成本,客户会主动追求简化;二是GPU的可编程性,会让它在AI模型快速迭代中比固定功能的NPU更优秀。Jake表示,GPU能连接上极其广泛的开源生态——Llama.cpp、IREE、MLIR、ExecuTorch这些高度优化的开源后端,而典型的NPU厂商就没有这些,每个NPU都需要重写一遍。

“Imagination 提供经过优化的库和开发工具,同时让客户能够自行实现和调优自己的工作负载。我们的目标是让开发者能够充分利用硬件的能力,并为他们进一步扩展应用提供空间。。”Jake说。

至于从CUDA生态迁移的代价,他的看法是,“CUDA本质上是一种独立的语言,无论它如何开发,该代码仍需迁移到另一种架构上。”因此,一个可行的做法是将软件栈一直向上延伸至PyTorch,毕竟大多数开发者使用PyTorch进行开发,而非直接使用CUDA。

Imagination为此也正在创建可从该高级框架调用的库,这些库与NVIDIA最流行的库相匹配——包括其自有的BLAS、FFT、运算符和内核库,开发者在编写高级框架时可以从中进行选择。此外还有一些开源工具,例如将CUDA转换为SYCL或其他框架的工具。

Jake认为,摆脱对CUDA 的依赖是整个行业面临的问题。但大多数公司采取的策略是先关注更高层次的框架,然后逐步向下适配,而不是直接替换CUDA。


结语

在边缘侧,没有无限的功耗预算,也没有无限的带宽冗余。谁能用更少的资源做更多的事,谁就能在端侧AI的长跑中胜出。E系列的发布,正是Imagination对这一逻辑的极致践行——它不追求在单一指标上的绝对霸权,而是追求系统级的最优解。

当所有人都在向同一个重心靠拢时,最先到达的未必是跑得最快的,而是把账算得最清楚的那一个。Imagination显然认为,自己是后者。


最新文章