智能体 AI 正在重塑移动体验。AI 的能力已从早期的问答交互,演进到能够理解用户意图并自主执行任务。基于端侧 AI 与生成式 AI 的发展,这类系统能够感知相关上下文信息、规划任务流程,并代表用户协调各类应用与服务。
与此同时,智能体工作流以及日益复杂的 AI 原生图形技术,也对移动计算提出了新的要求。随着工作负载的复杂度持续提升,移动设备的性能表现将取决于三个核心维度:各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度能力。
满足这些需求,需要一个从整体系统层面进行设计和优化的计算平台。Arm 第二代移动终端计算子系统(CSS for Mobile 2) 正是基于这一理念打造的 AI 原生移动计算平台,通过将架构设计、物理实现与软件生态深度整合,实现针对复杂 AI 和图形工作负载的系统级优化,全面提升性能与响应能力。
面向完整智能体 AI 工作流打造的平台
由于智能体 AI 在单次交互过程中会同时调用移动系统的多个组件,因此当设备理解用户意图并推动任务逐步完成时,数据处理、模型执行、内存访问以及应用控制等环节都必须保持紧密协同。
这种系统级设计理念贯穿了 Arm CSS for Mobile 2 的构建与交付。它将 CPU、GPU、系统 IP、软件及开发者工具整合为一个完整的平台,并从整体工作负载的角度,统筹优化性能、能效和数据传输效率。与此同时,Arm CSS for Mobile 2 还将系统优化延伸至物理实现阶段,使合作伙伴在开展系统级芯片(SoC)集成之前,便能够将功耗、性能和面积(PPA)与架构设计进行协同考量。
这种异构计算能够支持越来越多跨多个计算资源运行的工作负载,其中,CPU 作为可编程计算与系统调度中心,负责协调整个系统中的计算活动。依托持续稳定的性能输出与能效表现,即使面对高频并发的 AI 交互,整套系统也能在移动设备功耗、散热约束条件下,维持灵敏响应。
该平台在实现高度集成的同时,也保留了充分的灵活性。合作伙伴既可以单独选用各个组件,也可以将其与自研 IP 或第三方 IP 结合,在更广泛的 CSS 配置中灵活集成,从而根据产品定位、性能目标和市场需求打造差异化的系统设计。
Arm C2 CPU 集群:支撑智能体 AI 编排
在 Arm CSS for Mobile 2 平台中,Arm C2 CPU 集群提供了支撑智能体 AI 从“意图”到“行动”所需的可编程算力与编排能力。通过融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可伸缩矩阵扩展(SME2)技术,该集群不仅提升了移动应用中的日常计算性能,还进一步增强了端侧 AI 能力,为语音处理、信息检索和模型执行等工作负载提供更强支持。
Arm C2 CPU 集群性能亮点:
- 最新 AI 模型性能最高提升达 1.7 倍
- 单线程性能最高提升 15%
- 网页浏览速度提升 15%
- 应用启动速度提升 12%
- 集群级多线程性能提升 12%,支持知识检索、模型准备和应用执行等任务并行处理
这些性能提升贯穿智能体 AI 工作流的各个环节。更强的单线程性能可降低单次决策和系统响应的延迟,而更高的多线程性能则让信息检索、模型处理和应用执行等任务能够并行推进。与此同时,更快的网页浏览和应用启动速度进一步缩短了服务访问和任务执行所需的时间。
该工作流的核心为编排层(Orchestration Layer)。它负责维护任务状态、整合相关上下文信息,并决定工作流中每个阶段应由哪个计算资源来执行。根据具体工作负载的不同,执行过程可能涉及本地应用、端侧模型、其他计算资源或云端服务,而 CPU 则负责统一协调权限管理、任务决策以及整个任务的执行进程。
SME2:拓展端侧 AI 能力
相较于上一代的配置,新一代 Arm C2 CPU 集群集成双 SME2 引擎,可实现 SME2 能力翻倍,为各类对延迟敏感的端侧 AI 工作负载提供更充足的 AI 算力空间。
在运行最新的 Moonshine 和 Parakeet 语音转文本模型时,搭载 SME2 的 Arm C2-Ultra 相比 C1-Ultra 可降低 40% 的延迟。更快的语音处理能力有助于缩短智能体 AI 交互的起始延迟,因为设备需要先理解用户的语音指令,方可启动后续工作流。
在记忆阶段,搭载 SME2 的 C2-Ultra 的内存信息检索与搜索性能较上一代提升 41%,可助力智能体更快速地访问设备端存储的上下文信息。在推理阶段,小语言模型能够将用户请求与检索到的上下文结合起来,生成结构化指令并调用相应工具,以执行下一步操作。在测试的各类模型中,C2-Ultra 完成这一过程的平均速度较上一代提升 25%。
在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端智能体 AI 工作流测试中,搭载 SME2 的 C2-Ultra 配置相比上一代配置实现了 24% 的整体性能提升,能够更快完成整个工作流。
神经网络加速器:提升移动图形性能与视觉体验
神经网络技术为提升视觉体验开辟了新路径,使移动设备能够在既定功耗和散热预算下,实现超越传统渲染技术所能提供的画质表现。这些技术能够基于低分辨率输入重建更高质量的图像,对光线追踪场景进行降噪处理,并通过生成额外帧来更高效地提升游戏流畅度。
Arm Mali G2-Ultra NX 将神经网络加速能力直接引入 GPU,通过将专用神经网络加速器紧密集成至着色器核心,并结合全新的执行引擎和第三代光线追踪单元(Ray Tracing Unit v3,RTUv3),为移动图形带来 AI 原生能力。在 CSS for Mobile 2 平台中,它为日益复杂的神经图形工作负载提供了坚实的 AI 原生图形基础。
它支持神经超级采样(Neural Super Sampling,NSS),能够基于低分辨率渲染画面重建更高分辨率的图像;支持神经帧率提升(Neural Frame Rate Upscaling,NFRU)技术,通过生成中间帧提升画面流畅度;同时支持神经超级采样与降噪(Neural Super Sampling and Denoising,NSSD),将神经超分与降噪技术相结合,在复杂光线追踪场景中进一步提升图像质量。
上述能力可与 Arm C2 CPU 集群的智能体 AI 能力形成互补,通过专用 GPU 加速支持日益复杂的神经图形工作负载。
系统 IP :强化异构计算协同效率
智能体 AI 和日益复杂的图形工作负载,对移动系统内计算资源协同及数据传输效率提出了更高要求。为此,CSS for Mobile 2 采用 SI L2 系统互连,基于面向移动设备优化的架构设计,为各类异构工作负载提供服务质量(QoS)支持。
再强大的计算引擎,也只有在数据能够高效传输的前提下才能充分发挥价值。SI L2 可为整个平台提供更低的数据访问延迟和更高带宽,同时具备一致性和 QoS 能力,帮助管理和优化多个计算资源之间的任务调度与优先级分配。这些能力在 CPU、GPU 及其他系统资源并行运行、共享数据及内存访问权限时尤为重要。
通过提升工作负载在整个系统中的通信效率,SI L2 能够充分发挥各个计算引擎的性能优势,并帮助 AI 与图形工作负载持续保持高执行响应能力。
开箱即用的软件生态:加速开发者创新
Arm CSS for Mobile 2 拥有完善的软件生态支持。依托 Arm 数十年的软件投入及全球超过 2,200 万的 Arm 开发者社区,开发者可通过熟悉的框架和开发环境轻松调用其平台能力。KleidiAI 与主流 AI 框架的深度集成,为 Arm CPU 提供了优化的软件执行路径,包括能够充分利用 SME2 特性的 AI 工作负载。这意味着开发者无需改变现有开发流程,即可通过正在使用的软件栈充分释放 Arm CPU 的底层能力。
Arm AI Portal 将这种支持进一步扩展到 AI 应用开发领域,在统一平台汇聚经过优化和验证的模型、性能与准确性数据、代码示例以及部署资源。同时,Arm MCP 服务器进一步将这些能力引入智能体 AI 开发环境。这将帮助开发者为特定工作负载选择合适的模型,了解其在 Arm 平台上的性能表现,并加快从评估到部署的整个开发流程。对于拥有自有专有模型的开发者,Arm 还提供早期访问版模型优化工具,帮助其针对目标设备进行优化和适配。
对于面向 CSS for Mobile 2 平台进行开发的开发者而言,Arm AI Portal 提供了一条直接利用 Arm 平台能力的路径,帮助开发者充分调动 CPU 端 SME2、GPU 端神经网络加速器等能力,将经过优化的 AI 模型与高端移动设备所提供的性能优势紧密结合。
KleidiAI、主流 AI 框架集成以及 Arm AI Portal 共同打通了从硬件到软件的开发链路,将 Arm CSS for Mobile 2 的平台能力与开发者所使用的 AI 模型和软件工具紧密连接,帮助开发者打造更加强大、更智能的端侧 AI 体验。
赋能端侧智能体 AI 的完整平台
移动 AI 的下一个时代,将不再由单一跑分成绩或单一加速器决定,而是取决于整个系统将用户意图转化为实际行动的综合能力。随着智能体 AI 持续演进,并逐步融入日常交互,底层平台将成为决定这些体验能否高效、大规模落地的关键因素。
Arm CSS for Mobile 2 正是为这一转变而打造。平台围绕响应速度、能效与持续执行能力,对计算资源、系统 IP、物理实现和软件生态进行一体化协同优化,既为芯片合作伙伴提供了可灵活配置的基础平台,助力其打造差异化产品;也为开发者搭建了从平台能力到应用落地的更直接路径。
随着端侧智能持续发展,这类系统级基础能力的重要性愈发凸显。Arm CSS for Mobile 2 致力于将这些架构创新真正落地到终端设备,为下一代更快速、更高效、更智能的移动 AI 体验奠定坚实基础。