产品派
返回

Imagination E系列首秀:超分2.3毫秒,Prefill提升4.7倍

硬件雷锋网2026/9/28 09:21:00
AI 导读

消费电子、汽车和机器人正承担本地大模型、Agent以及视觉、语音和传感器处理等任务,SoC需要更强的通用计算能力。Imagination曾同时探索GPU参与AI和独立神经网络加速器,但随着模型、算子与软件生态不断变化,公司逐步将AI战略转向通用GPU,认为专用硬件带来的适配与维护成本可能高于硬件本身。E-Series因此强化矩阵乘法、低精度计算和卷积能力,试图在同一套软件体系中统一图形、计算与AI任务。

在图形应用中,四核E-Series可让部分3A级桌面游戏达到超过60FPS。配备Neural Core后,GPU可以先以较低分辨率渲染,再利用神经网络重建高分辨率画面,从而降低传统渲染压力。与GPU渲染、NPU超分的异构方案不同,E-Series由GPU同时完成图形和矩阵计算,减少数据写入共享DDR内存后再交给其他处理器的往返。

配合矩阵单元与着色器执行体系的深度整合,以及对权重进行压缩,E-Series可减少模型存储和读取量。单核配置下,画面从540p提升到1080p只需2.3毫秒;继续提升至4K时,带宽消耗最高降低54%,帧率最高达到对照结果的2.5倍。

E-Series延续TBDR分块延迟渲染,将画面拆分为多个Tile处理,让更多中间数据留在片上,并可围绕同一Tile连续完成图形与神经网络计算。其ALU还会将相关运算组织成连续工作,使中间结果更多保留在计算单元内部。Imagination称,这些设计可带来最高39%的每瓦性能提升。

针对Agent背后的大语言模型推理,E-Series首次加入常见的MXFP8、MXFP4低精度格式。更低位宽能够提高矩阵吞吐,缩短Prefill阶段处理输入的时间;按其测算,Prefill性能较上一代提升4.7倍。量化还可减少模型权重和部分中间数据的字节数,缓解Decode阶段的带宽压力。

E-Series通过AXI连接SoC内存子系统,可适配LPDDR、GDDR和HBM,最高支持768GB/s读取带宽,实际表现仍取决于内存、控制器和SoC配置。针对视觉识别、感知和图像处理等多模态任务,其卷积计算性能达到上一代的4.4倍。

软件方面,开发者可使用OpenCL、Vulkan编写Kernel,也能接入Llama.cpp、ONNX和PyTorch。统一的跨代软件栈有助于复用针对算子、精度和执行方式的优化,减少更换GPU后重复开发。部分嵌入式SoC客户也在评估让GPU承担原本由NPU处理的任务,以降低另一套软件栈的适配和维护成本。

E-Series并非要取代所有专用处理器。Agent PC中,CPU仍负责驱动GPU和NPU、管理数据及协调工具调用;自动驾驶和机器人则需要GPU与感知、控制等单元协作。为此,E-Series提供硬件mailbox、共享内存和SDK集成能力,帮助系统按任务选择合适的计算资源,在减少数据拷贝和切换等待的同时发挥GPU的融合计算优势。

ImaginationGPU IPAI加速神经超分

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文