在近日于上海举办的 AI 芯片高峰论坛上,Imagination 技术支持总监艾克发表主题演讲,从端侧推理的真实场景出发,分享了 Imagination 对异构融合架构的思考,以及 E 系列 GPU IP 如何将 AI 能力融入 GPU 核心,应对端侧芯片 5-10 年生命周期中的持续变化。

一个真实的端侧场景,暴露了异构架构的代价
艾克首先描绘了一个现实中再普通不过的应用路径:无论是手机还是汽车,设备先感知数据,再建模、推理、决策,最后通过 GPU 渲染出来,让用户感知到结果。
从任务角度看,这是一个完整的整体——它需要在确定的时间内完成,比如在 32G 带宽的预算内跑完整个流程。
但从芯片设计角度看,却是另一幅画面:视频流处理用 DSP,AI 推理用 NPU,渲染用 GPU,一些不好执行的算子又回到 GPU。这是一个高度异构的结构。
异构 IP 之间,天然伴随着大量内存吞吐与调度开销。艾克指出,这正是当前方案成本上升的三个来源:
- 内存墙:数据搬移越多,功耗越高
- 调度延时:各 IP 之间来回调度,延迟增加
- 软件栈集成:每家 IP 的软件栈与集成方式不同,给工程师带来额外负担
更关键的是,芯片一旦设计完成,配置和参数就固定下来了。而一颗端侧芯片的生命周期可能长达 5 年甚至 10 年,期间会不断出现新的模型、新的需求。如何让架构具备足够的灵活性与可编程性,去应对这些尚未出现的任务,是端侧推理芯片设计的核心命题。
产业趋势:各家都在向"可编程中心"靠拢
艾克观察到,异构架构中的各个角色都在做相似的事情:CPU 在增加向量与矩阵运算能力,NPU 发现自己太专一、开始增加可编程性,而 GPU 本身拥有海量并行度,正从以图形为主,逐步走向计算,走向并行度极高的 AI 场景。
GPU 正在成为这个可编程的中心。
Imagination 的判断是:与其在 GPU 之外再堆一个独立的 AI 加速器,不如把 AI 能力直接放进 GPU 里面。当 GPU 内部增加更多的 AI Tensor Core 能力,前面提到的那些开销就会大幅减少——内存搬运少了,调度延时低了,工程人员的集成工作也更简单。
E 系列 GPU IP:把 AI 放进计算核心,靠近 USC
Imagination 是一家专注于自研 GPU IP 架构的公司,全球有一百多亿台设备在出货,拥有 TBDR 渲染、光追、汽车功能安全等大量专利,产品布局覆盖消费电子、汽车以及国产替代方案。
在 E 系列架构中,Imagination 的思路是:在计算中心里加入 AI 能力,让它尽可能靠近通用计算的部分。
具体来说,AI 能力被放置在架构上离 USC(统一着色集群)非常近的位置——那里提供 GPU 最通用的 FP32 算力。AI 部分负责 Tensor Core 式的矩阵大量运算,与 GPU 的通用运算协同工作。这样一来,寄存器、memory 开销以及 cache 都可以在同一个架构内完成,不再需要跨 IP 搬运。
在底层,E 系列保证了图形渲染与 AI 能力的结合;在此之上,可以通过域与域之间的互联或多核方案,满足端侧推理所需的算力。艾克举例说,目前四核拼在一起,可以提供 200 多 T 的 INT8 本地运算能力,同时兼具 13T 的浮点运算能力。
端侧部署对内存带宽非常敏感,权重格式与轻量化至关重要。E 系列在格式支持上做了广泛覆盖,以支持轻量化部署的需求。
挑战在调度:固件统一调度,多任务隔离
真正的挑战在于:既要兼顾渲染,又要兼顾端侧 AI 的协同。在一个核里,渲染与计算的调度同样需要考量。
Imagination 在硬件中内置了固件,负责调度任务并管理开销,从而降低延迟。同时,多任务之间的隔离也是重点:不同任务的优先级如何设定、调度如何更优化、内存空间如何更好地独占。
艾克举了一个汽车场景的例子:自驾推理过程中,如果娱乐系统挂掉了,仪表盘不能出问题。这类需求,在 AI 芯片设计与 GPU 协同之间,需要更好的调度机制来支撑。
在软件层面,传统的 API 调用,满足图形图像渲染要求;而当一个核里兼容了 AI 运算之后,如何把 AI 能力开放出来,是各家方案企业都在做的事。Imagination 的做法与 NVIDIA 类似:在中间层提供 AI 算子库(如 ImgNN算子库),同时提供图优化库(ImgGC)用于大模型端侧部署时的图层 compile 优化,还提供傅里叶变换(ImgFFT)等端侧 AI 常见运算库。底层优化好之后,上层建模型、计算和AI应用可以直接调用这些库,再结合前面的软件栈高效调度功能,整体达到更好的性能与功耗表现。
性能表现:图形与 AI 结合带来的提升
基于这套方案,Imagination 跑了一些同时带渲染与计算的游戏场景。
在《古墓丽影:暗影》这类调度 API 调用非常重的任务中,以及炮火光粒子等用 AI 计算的效果中,图形与 AI 的结合都带来了收益。由于调度更紧凑、AI 结合更紧密,功耗也下降了很多。
在超分场景中,原本需要渲染 1080P 的画面,可以先渲染 540P,再用 AI 放大。这样一来,渲染本身的计算任务被腾出来,交给 AI 结合处理。由于计算 ALU 与 RAM 距离很近——不再是两个独立 IP——memory 吞吐也更高效。
效果是:渲染 1080P 可以在更小的 2.3 毫秒内完成,带宽节省 54%;借助 AI 超分以及压缩技术,可去除65% 的权重,不再使用。
端侧大模型推理:prefill 与 decode 的实测数据
在 AI 计算方面,E 系列相比上一代有显著提升:
- 传统卷积运算:4.4 倍提升
- 矩阵运算:4.8 倍提升
这些能力可以解决大量边缘侧推理任务——左侧的检测、分支等任务,右侧的大模型本地化推理。
在大模型测试中,Imagination 分别测试了 prefill 与 decode 阶段:
- prefill 阶段:相比上一代有 4.3-4.7 倍提升。prefill 是计算密度集中型任务,AI 能力融入后性能提升明显
- decode 阶段:与内存带宽和吞吐相关,端侧融合 AI 方案后,能更好地支持端侧大模型推理
在实际应用场景中,比如汽车、盲人识图、质检、邮箱处理等,都可以把模型放在本地处理。基于 E 系列架构,第一个 token 出来是亚秒级的,decode 阶段可以达到 120 tokens/秒。
现场演示中,千问 3.5 的 4B 模型在端侧运行。艾克强调,很多数据在端侧处理更有价值——日历、日程、邮箱信息等不宜上传,本地处理既保护数据,又不受信号限制。在开发场景中,本地模型可以了解整个代码工程,而不是只给出片段信息,从而提升笔记本上的 coding 能力。
下一代:更融合、更扩展、更紧凑
艾克在演讲最后展望了 Imagination 的路线图:
E 系列这一代,是把 AI 融合到 GPU 里面去。下一代,Imagination 正在考量如何更好地配置、把核做得更大、扩展性更强,能够灵活地适应从大到小的融合需求。更长远来看,则是追求更有效率、密度更高、整个 pipeline 更紧凑的架构规划。
艾克说,"Imagination 是一家全球领先的GPU和AI IP 公司,很希望跟国内生态伙伴一起,在图形、计算、AI 领域有更多的合作。"
除了主题演讲,Imagination 也在论坛现场设置了展台,展示了 Imagination GPU应用的Demo,与到场的行业观众面对面交流。






