简体中文

Arm边缘AI负责人采访:助力移动计算步入新时代

廉颇

2026-09-17

助力移动计算步入新时代

    在不久前举办的Arm Everywhere China年度大会上,Arm正式推出其第二代移动终端计算子系统(CSS for Mobile 2),在单一计算平台中实现对智能体AI和AI原生图形技术的全面支持。该系统集成全新Arm Mali G2-Ultra NXGPU、搭载SME2的Arm C2 CPU集群、增强型系统IP、物理实现方案以及开发者就绪的软件生态系统,并针对下一代移动设备进行了全面优化。

    其中,Arm Mali G2-Ultra NX是首款集成专用神经网络加速器的MaliGPU,可将神经网络计算与传统图形处理紧密融合,实现更高的能效和响应速度。这款GPU在神经网络处理场景下可实现最高4倍的“每瓦性能”提升,与上一代产品相比,在现有游戏内容中可实现高达14%的性能提升。为了展示它的性能,Arm也在现场为我们演示了他们与Sumo Digital联合开发的游戏《光影新生》,它拥有过往手游难以企及的更具电影感的光影效果,以及更流畅、更高分辨率的游戏体验。未来,包括网易的《燕云十六声》计划于今年向玩家推出支持神经超级采样的版本,腾讯的《暗区突围:无限》也正在与Arm 开展神经超级采样与降噪(NSSD)技术演示的共研,为玩家带来游戏体验的革命性升级。

    除此之外,Arm还在本次大会上公布了全新的Arm C2 CPU集群,结合了Arm性能最强大的移动CPU——C2-Ultra、面向能效优化的C2-Pro CPU,以及双SME2单元,能使AI工作负载直接在CPU上实现高响应、低延迟处理,同时与各类AI加速器无缝协同工作。C2 CPU集群配置了翻倍的SME2计算能力,可使最新小语言模型的运行速度提升高达 70%,进一步增强CPU对 AI工作负载的加速能力。

    最后,Arm还公布了第二代移动终端计算子系统——CSS for Mobile 2,它是Arm针对智能体AI和神经图形技术正在重塑移动设备的能力需求这一趋势而打造的,Arm认为下一代移动AI体验将不再由单一加速器来定义,而是通过在统一优化的系统中融合各类AI能力,共同打造全新的移动体验。

    大会结束后,我们也有幸和其他国内媒体一起,对Arm边缘AI执行副总裁Chris Bergey和Arm边缘AI智能终端计算副总裁James McNiven,进行了长达四十多分钟的采访,和他们一起聊了聊目前Arm的产品生态和技术亮点,以及他们对整个行业和Arm未来发展的期待,以下是详细的采访内容。

    Arm边缘AI负责人采访:助力移动计算步入新时代

    Q:我们了解到Arm NX单元支持INT8和INT16精度。有信息显示平台可实现FP16精度运算,请问FP16运算为何不由NX单元承担,请问这背后有哪些考量?

    James McNiven:Arm神经网络加速器本身支持的数据格式是INT8和INT16。这样的设计是为了在保证神经超级采样(Neural Super Sampling, NSS)等应用场景所需精度的同时,实现更高的效率,并提供优异的能效与性能表现。同时,我们也支持FP16在内的浮点格式运算,但这部分的能力并不在神经网络加速器内部,而是由执行引擎中的标准着色器核心来处理。这样能够针对不同类型的工作负载,在专用AI加速与通用计算能力之间取得最佳平衡。

    Q:今天上午提到的神经网络加速器,为什么是放在GPU里面,而不是放在NPU里面?

    James McNiven:我们认为,不同类型的AI工作负载需要不同形式的加速能力,而异构计算正是满足各类计算需求的最佳方式。不同的应用场景和计算强度,需要由不同类型的计算引擎来承担。因此,我们在GPU中集成的神经网络加速器,专门用于加速神经图形相关工作负载,并针对这类任务进行了高度优化。与此同时,我们在最新的C2 CPU 集群中,配置了最多两个SME2单元,能够基于CPU指令集对AI工作负载进行加速,从而提供更快速的响应能力和更低的延迟。简而言之,我们认为在每一种计算引擎中都应具备相应的AI 加速能力,让各类工作负载都能够在最适合的计算单元上高效运行。此外,我们的芯片合作伙伴通常也会集成专用NPU,以加速其自身特定的AI应用和工作负载。

    另外,我想强调一点,将SME2部署在CPU集群中,能够提供极低延迟和快速响应能力,同时还能充分利用CPU已有的安全模型与安全机制。而将神经网络加速器集成在GPU 内部,则能够共享执行引擎的内存和缓存资源,例如L1和L2缓存,因此能够以更高效率处理AI图形相关工作负载,并实现更快的响应速度。这种设计带来的好处是,不仅能够获得最佳性能和能效表现,还能够让AI加速功能与图形渲染管线紧密协同,与其他工作负载进行统一调度和并行处理,从而发挥整个系统的最佳效率。

    Q:目前存储价格暴涨,未来两年很难改变。请问从CPU或GPU设计的角度,Arm是否有相关的技术规划或战略,来应对持续走高的存储成本压力?

    Chris Bergey:移动产业当前确实正承受着来自多个方面的成本压力,不仅是存储价格,还包括晶圆成本。因此,我们正与合作伙伴共同努力,全力推进全链路优化,其中关键的一项就是推动AI模型向更小、更高效的方向演进,在有限的资源条件下实现更好的性能与能效。举例来说,我们已经与阿里巴巴通义千问合作,在SME2上实现了2-bit量化模型。由于模型规模非常小,因此能够在性能、成本和能效之间取得更好的平衡。此外,通过让图形能力具备神经网络处理能力,我们可以减轻系统内其他承担同类任务加速器的压力,从而实现效率提升。因此,我们正尝试从多个不同维度来应对这一挑战,但这确实是一项艰巨的任务。

    Q:去年参加Arm活动时,我体验的是搭载天玑9400(Cortex-X925架构)的手机,之后联发科(MTK)发布了天玑9500,CPU架构从Cortex-X925升级到了C1。当时了解到这一升级能为开发者带来显著的性能提升,但今年换用天玑9500手机后,日常使用中并未感受到明显的性能或速度提升。请问是什么因素制约了C1架构与上一代Cortex-X925架构之间在实际使用体验上的差异?另外,Arm发布C2架构后,将如何进一步加快与合作伙伴在开发层面的协作,更好地赋能终端用户?

    James McNiven:我不便对合作伙伴的具体产品实现做评价。谈到性能提升幅度,实际表现要看具体运行的负载。从Cortex-X925升级到C1-Ultra,单线程性能确实实现了较大幅度的跃升:IPC实现了两位数增长,同时主频也有所提高,综合性能最高可实现约20%提升,不过具体表现会随实际负载不同而变化。

    展望C2-Ultra乃至未来的发展,我们将持续致力于每年实现两位数的性能提升。我希望大家从这次发布中看到的不仅仅是基准测试成绩的提升,更包括AI性能、应用启动速度以及其他各项用户体验指标的持续改善。

    对于Arm在生态里的定位:我们投入大量资源做生态适配,推动各大AI框架支持SME2。过去一年,我们已经公布了多个框架合作,把SME2优化落地到产品当中。我们也持续与安卓生态协同合作以提升相关效率;在图形领域,联合腾讯游戏、Unity中国等众多合作伙伴,落地NSS和神经帧率提升(Neural Frame Rate Upscaling,NFRU)等新功能。这也是我们同时在CPU和GPU两端都高度关注AI性能提升的原因。再回应前面提到的问题,比如今天腾讯游戏的伙伴提到的神经纹理压缩(Neural Texture Compression)就是很好的案例:在画质不变的前提下大幅缩小文件体积,节省设备内存,这同样是我们重点布局的方向。

    Q:刚才提到了《光影新生》这款游戏,能否介绍下它当前的开发进展,以及后续的发售计划?

    Chris Bergey:这款游戏由Sumo Digital负责开发。我们邀请他们基于我们的理念和神经网络技术来打造这款游戏,并在概念设计等方面与他们进行了合作。这款游戏目前已经完成制作。我们希望能够适配本次发布的这款全新芯片平台,因此大概还需要30至60天的测试与验证周期,以确保能够为玩家带来出色的体验。具体的上线时间,我们会另行通知。

    Q:关于CPU内部统一的神经网络加速器设计,相较于传统NPU这种独立的原生AI计算划分方式,对于算力利用会有什么区别?在架构层面具体改变了什么?

    Chris Bergey:两者间存在不少差异。SME2最独特的一点在于,它的编程方式和CPU保持一致:开发者无需采用独立的编程模型,而是可以沿用熟悉的CPU编程方式,通过指令直接调用SME2的矩阵计算能力,正因如此,SME2能够实现极低的延迟,同时也更易于开发和编程。

    大家应该还记得,去年我们介绍了Arm Kleidi软件库。开发者将其集成到AI框架,或者使用像ExecuTorch这样的抽象化框架时,底层软件会自动完成适配。如果硬件配备了SME2,它就能够自动调用这一能力;如果硬件不支持,则不会调用。

    类似地,神经网络加速器通过基于Vulkan的GPU工作流进行编程。相比之下,NPU通常作为独立加速器进行调度,因此采用的是不同的编程模式。事实上,来自不同供应商甚至不同产品形态的加速器,其编程模型也各不相同,具有相当的独特性。这也正是开发者需要重点考量的地方,即根据自身工作负载的运行需求,选择合适的技术路径。

    Q:智能体(agent)需要持续调用工具并保持运行状态,而智能手机受电池功耗、内存资源约束比较大。请问对于Arm平台而言,如何解决AI智能体持续运行所带来的内存和功耗难题?

    James McNiven:这取决于我们如何定义“持续运行”这个概念。手机本身一直向网络发送信号,持续在后台运行各类任务。所以,全时段高强度占用整个系统,与按周期进行调度,这两者之间是有区别的。目前许多OEM厂商和智能体供应商也还在摸索这部分的实现方案。但实现高效的持续运行的智能体工作负载并非不可能,关键在于任务的运行强度。部分智能体可以周期性触发运行,但并不需要微秒级不间断持续工作。

    Chris Bergey:另外我想补充两点。第一,我们在玩游戏时,通常同时活跃的线程数量是三到四个,这样的状态可能持续一个小时甚至更久,这说明通过智能调度能够实现很多可能性。第二,可以利用充电场景:当您晚上给手机充电时,设备可以进行大量的KV缓存优化和上下文预处理等工作。因此,可以将其理解为两种不同的运行模式:电池供电模式,以及充电供电模式。在充电状态下执行词元(token)生成这类高负载任务,就能让设备在移动使用阶段拥有更高的运行效率。

    Q:Arm的边缘计算布局目前已经从智能手机延伸至PC、机器人以及物理AI等多个场景,并针对不同领域陆续推出了相应的计算子系统(CSS)。请问Arm是如何定义不同领域之间计算子系统边界的?这套CSS基础子系统是否会在不同领域间实现复用,还是会针对不同领域持续进行差异化演进?

    Chris Bergey:简单来说,核心判断依据就是市场需求。举个例子,NVIDIA RTX产品所采用的Cortex-X925核心,其实是两年前搭载在CSS for Mobile中的成熟技术,就当时的市场需求而言,那是最合适、最成熟的解决方案。

    如今,我们在PC领域看到了更强劲的发展势头,不光是Arm架构设备相关生态在发展,还包括其他方面的积极进展。与此同时,我们也看到了越来越多独特的需求,包括安全能力以及其他各类功能特性。在这种情况下,我们就会有针对性地打造全新的CSS及差异化产品。相关进展欢迎大家持续关注。总结来说,我们会复用成熟IP和组件,但产品的演进方向完全取决于市场和客户的实际需求。

    Q:过去几年,移动端GPU技术似乎一直追随桌面端的发展路径。目前,桌面端的DLSS 5已经实现了完整的画面帧生成,能够生成游戏本身未渲染的一些细节元素;而移动端GPU目前更多还是聚焦在超分辨率和增强上。请问,移动端的神经图形技术,距离DLSS 5这种帧生成渲染水平还有多远?Arm在技术路线图中是否有相关规划?

    James McNiven:二者底层技术原理高度相近,我们同样具备超级分辨率能力,同时通过神经帧率提升(Neural Frame Rate Upscaling,NFRU)实现了完整的帧生成能力。与其他方案相比,我们方案的一大差异点,是自始至终将能效放在核心位置。这一点从模型规模上就能体现出来,受能效优先的设计思路约束,我们的NSS模型相比其他复杂度更高的同类方案,体量要精简很多。就当前能力与DLSS 5的对比而言——DLSS 5目前已经支持多帧生成,而现阶段NFRU主要实现单次额外帧生成,也就是实现帧率翻倍,这是我们当前所能实现的技术能力。当然,我们也计划进一步拓展至多帧生成能力。

    此外,我们也将看到诸如全局光照、辐射缓存等技术带来的新应用场景,这些都是我们正在布局的未来技术方向。但在当前阶段,我们更希望确保能够高效地实现高质量的图形效果,因此现阶段的重点仍聚焦于超分辨率和帧率提升,也就是实现帧率翻倍的效果。

    还有一点值得一提——我们一直非常积极地推动开放模式的生态。开发者可以直接前往Hugging Face下载模型权重,并结合我们提供的工具进行实验和开发。我们希望通过这种开源模式,激发包括Arm在内以及行业其他厂商的创新活力。我们非常期待更多公司能够充分利用这套开放能力,目前我们也已经看到越来越多的行业协作。我们认为,这种开放协作的模式与传统做法有所不同,同时也能够为整个生态带来独特而长远的价值。

    玩家点评 0人参与,0条评论)

    收藏
    违法和不良信息举报
    分享:

    热门评论

    全部评论