GPU 正在成为端侧推理的融合中心——Imagination 艾克谈端侧芯片的下一个十年

在近日于上海举办的AI芯片高峰论坛上,Imagination技术支持总监艾克发表主题演讲,从端侧推理的真实场景出发,分享了Imagination对异构融合架构的思考,以及E系列GPU IP如何将AI能力融入GPU核心,应对端侧芯片5-10年生命周期中的持续变化。

d9086782-b653-11f1-ab55-92fbcf53809c.jpg


一个真实的端侧场景,暴露了异构架构的代价

艾克首先描绘了一个现实中再普通不过的应用路径:无论是手机还是汽车,设备先感知数据,再建模、推理、决策,最后通过GPU渲染出来,让用户感知到结果。

从任务角度看,这是一个完整的整体——它需要在确定的时间内完成,比如在32G带宽的预算内跑完整个流程。

但从芯片设计角度看,却是另一幅画面:视频流处理用DSP,AI推理用NPU,渲染用GPU,一些不好执行的算子又回到GPU。这是一个高度异构的结构。

异构IP之间,天然伴随着大量内存吞吐与调度开销。艾克指出,这正是当前方案成本上升的三个来源:

内存墙:数据搬移越多,功耗越高

调度延时:各 IP 之间来回调度,延迟增加

软件栈集成:每家IP的软件栈与集成方式不同,给工程师带来额外负担

更关键的是,芯片一旦设计完成,配置和参数就固定下来了。而一颗端侧芯片的生命周期可能长达5年甚至10年,期间会不断出现新的模型、新的需求。如何让架构具备足够的灵活性与可编程性,去应对这些尚未出现的任务,是端侧推理芯片设计的核心命题。


产业趋势:各家都在向"可编程中心"靠拢

艾克观察到,异构架构中的各个角色都在做相似的事情:CPU在增加向量与矩阵运算能力,NPU发现自己太专一、开始增加可编程性,而GPU本身拥有海量并行度,正从以图形为主,逐步走向计算,走向并行度极高的AI场景。

GPU正在成为这个可编程的中心。

Imagination的判断是:与其在GPU之外再堆一个独立的AI加速器,不如把AI能力直接放进GPU里面。当GPU内部增加更多的AI Tensor Core能力,前面提到的那些开销就会大幅减少——内存搬运少了,调度延时低了,工程人员的集成工作也更简单。


E系列GPU IP:把AI放进计算核心,靠近USC

Imagination是一家专注于自研GPU IP架构的公司,全球有一百多亿台设备在出货,拥有TBDR渲染、光追、汽车功能安全等大量专利,产品布局覆盖消费电子、汽车以及国产替代方案。

在E系列架构中,Imagination的思路是:在计算中心里加入AI能力,让它尽可能靠近通用计算的部分。

具体来说,AI能力被放置在架构上离USC(统一着色集群)非常近的位置——那里提供GPU最通用的FP32算力。AI部分负责Tensor Core式的矩阵大量运算,与GPU的通用运算协同工作。这样一来,寄存器、memory开销以及cache都可以在同一个架构内完成,不再需要跨IP搬运。

在底层,E系列保证了图形渲染与AI能力的结合;在此之上,可以通过域与域之间的互联或多核方案,满足端侧推理所需的算力。艾克举例说,目前四核拼在一起,可以提供200多T的INT8本地运算能力,同时兼具13T的浮点运算能力。

端侧部署对内存带宽非常敏感,权重格式与轻量化至关重要。E系列在格式支持上做了广泛覆盖,以支持轻量化部署的需求。


挑战在调度:固件统一调度,多任务隔离

真正的挑战在于:既要兼顾渲染,又要兼顾端侧AI的协同。在一个核里,渲染与计算的调度同样需要考量。

Imagination在硬件中内置了固件,负责调度任务并管理开销,从而降低延迟。同时,多任务之间的隔离也是重点:不同任务的优先级如何设定、调度如何更优化、内存空间如何更好地独占。

艾克举了一个汽车场景的例子:自驾推理过程中,如果娱乐系统挂掉了,仪表盘不能出问题。这类需求,在AI芯片设计与GPU协同之间,需要更好的调度机制来支撑。

在软件层面,传统的 API 调用,满足图形图像渲染要求;而当一个核里兼容了 AI 运算之后,如何把 AI 能力开放出来,是各家方案企业都在做的事。Imagination 的做法与 NVIDIA 类似:在中间层提供 AI 算子库(如 ImgNN算子库),同时提供图优化库(ImgGC)用于大模型端侧部署时的图层 compile 优化,还提供傅里叶变换(ImgFFT)等端侧 AI 常见运算库。底层优化好之后,上层建模型、计算和AI应用可以直接调用这些库,再结合前面的软件栈高效调度功能,整体达到更好的性能与功耗表现。


性能表现:图形与AI结合带来的提升

基于这套方案,Imagination跑了一些同时带渲染与计算的游戏场景。

《古墓丽影:暗影》这类调度API调用非常重的任务中,以及炮火光粒子等用AI计算的效果中,图形与AI的结合都带来了收益。由于调度更紧凑、AI结合更紧密,功耗也下降了很多。

在超分场景中,原本需要渲染1080P的画面,可以先渲染540P,再用AI放大。这样一来,渲染本身的计算任务被腾出来,交给AI结合处理。由于计算ALU与RAM距离很近——不再是两个独立IP——memory吞吐也更高效。

效果是:渲染1080P可以在更小的2.3毫秒内完成,带宽节省54%;借助AI超分以及压缩技术,可去除65%的权重,不再使用。


端侧大模型推理:prefill与decode的实测数据

在AI计算方面,E系列相比上一代有显著提升:

传统卷积运算:4.4 倍提升

矩阵运算:4.8倍提升

这些能力可以解决大量边缘侧推理任务——左侧的检测、分支等任务,右侧的大模型本地化推理。

在大模型测试中,Imagination分别测试了prefill与decode阶段:

prefill 阶段:相比上一代有 4.3-4.7 倍提升。prefill 是计算密度集中型任务,AI 能力融入后性能提升明显

decode 阶段:与内存带宽和吞吐相关,端侧融合 AI 方案后,能更好地支持端侧大模型推理

在实际应用场景中,比如汽车、盲人识图、质检、邮箱处理等,都可以把模型放在本地处理。基于E系列架构,第一个token出来是亚秒级的,decode阶段可以达到120 tokens/秒。

现场演示中,千问3.5的4B模型在端侧运行。艾克强调,很多数据在端侧处理更有价值——日历、日程、邮箱信息等不宜上传,本地处理既保护数据,又不受信号限制。在开发场景中,本地模型可以了解整个代码工程,而不是只给出片段信息,从而提升笔记本上的coding能力。


下一代:更融合、更扩展、更紧凑

艾克在演讲最后展望了Imagination的路线图:

E系列这一代,是把AI融合到GPU里面去。下一代,Imagination正在考量如何更好地配置、把核做得更大、扩展性更强,能够灵活地适应从大到小的融合需求。更长远来看,则是追求更有效率、密度更高、整个pipeline更紧凑的架构规划。

艾克说,"Imagination是一家全球领先的GPU和AIIP公司,很希望跟国内生态伙伴一起,在图形、计算、AI领域有更多的合作。"

除了主题演讲,Imagination 也在论坛现场设置了展台,展示了 Imagination GPU应用的Demo,与到场的行业观众面对面交流。

推荐阅读:

A股下半年如何走?五大百亿私募策略出炉

A股午后反攻 央妈有新进展!“100万点可期”?

国办发布!证监会、公安部、财政部等六部委联合,打击财务造假!

去年全球碳排放量创新高,谷歌、东航、中海油都在增加

价格周报|本周生猪价格震荡上行 市场乐观预期仍存

慈溪农村商业银行重大关联交易:第二大股东关联企业向该行贷款1.5亿元,占上季末资本净额比例1.34%

您可以还会对下面的文章感兴趣:

暂无相关文章

使用微信扫描二维码后

点击右上角发送给好友