1. e-works数字化企业网
  2. 新闻
  3. 资讯

AI内存瓶颈浮现,CXL如何从“扩容”走向“池化”?

 
2026年09月04日 来源:DOIT
关键字:CXL  

当AI基础设施进入规模化部署阶段,行业关注的重点也在发生变化:除了GPU性能,内存容量和利用率同样开始成为影响系统效率的关键问题。

由CXL技术应用俱乐部发起,于2026全球闪存峰会同期举办的CXL互联生态与弹性内存池技术论坛上,Arm边缘AI事业部高级市场经理李黎明围绕AI时代的内存压力,分享了CXL从内存扩展走向分层、池化和可组合基础设施的演进路径。他指出,随着模型规模、上下文长度和并发用户数持续增长,内存容量可能在计算资源耗尽之前率先成为系统瓶颈。

这一变化背后,KV Cache是一个典型例子。大模型推理过程中,KV Cache需要保存已经计算过的上下文信息,以避免重复计算。随着上下文越来越长、并发请求越来越多,KV Cache规模可能快速增长,并进一步挤压GPU和主机内存空间。

AI内存需求,正在从“更快”走向“更合理”

过去谈内存,行业通常首先关注带宽和延迟,但对于AI工作负载而言,容量、带宽、延迟、利用率以及功耗和总体拥有成本,需要被放在一起考量。

李黎明认为,并不是所有数据都需要停留在最高性能的内存中。热数据可以留在HBM或本地DRAM,而容量需求更大的工作集,则可以根据访问频率和延迟敏感度,逐步下沉到CXL扩展内存以及更大容量的存储层。

这一思路实际上对应了CXL架构发展的重要方向。

CXL并不是简单地给服务器“加一条内存”,其价值更在于打破计算资源与内存资源之间过于紧密的绑定关系。CXL 2.0已经引入交换和内存池化能力,而CXL 3.0进一步推动资源共享、池化和可组合架构;CXL 3.1则继续增强Fabric能力、内存共享、管理以及RAS和安全能力,为更大规模的解耦式基础设施提供标准基础。

因此,从产业发展角度看,CXL更像是一条渐进式路线:先解决单机内存容量不足,再解决内存分层和资源利用率,最终走向跨主机的池化与可组合基础设施。

从“加内存”到“内存池”,CXL改变资源配置方式

在传统服务器架构中,如果CPU算力仍然充足、只是内存容量不足,企业往往需要通过增加服务器完成扩容。这种方式简单直接,却容易带来计算资源与内存资源的同步增长,也意味着部分新增算力可能无法得到充分利用。

CXL提供了另一种思路:通过Type-3内存设备扩展主机可用容量,让计算和内存能够更加独立地扩展。

进一步发展到内存池化之后,多台主机可以通过CXL Switch或Fabric连接到共享的内存资源池。需要更多内存的主机可以获得更多资源,不需要的主机则无需长期占用固定容量。CXL Consortium也将减少“闲置内存”、提升资源利用率和支持动态资源配置视为池化架构的重要价值。

这对于AI基础设施尤其重要。AI工作负载具有明显的动态性,不同模型、不同推理任务以及不同并发规模,对内存资源的需求并不恒定。相比为峰值需求永久配置资源,池化架构的价值正在于让容量能够更加灵活地跟随业务变化。

700GB KV Cache案例,容量本身就是性能问题

三星近期公布的一项测试,为这种变化提供了一个比较直观的案例。

在其针对KV Cache卸载的测试中,三星比较了512GB DRAM和1TB CXL交换机内存池。当KV Cache规模逐步增加到约700GB时,512GB DRAM已经无法容纳完整数据,系统开始出现KV Cache重计算,吞吐量最终下降到约61K TPS;而1TB CXL内存池仍能容纳约700GB的KV Cache,测试吞吐维持在约354K TPS。

需要特别注意,这个案例并不是证明“CXL内存比DRAM更快”。恰恰相反,三星的测试说明了另一个更重要的问题:当内存容量不足导致数据被淘汰并触发重计算时,容量本身就会反过来影响系统性能。

换句话说,AI时代的内存优化,不能只看单一介质的峰值性能,还需要考虑整个系统能否持续、高效地承载工作集。

CXL真正的挑战,是从协议走向系统

不过,CXL从技术标准走向大规模部署,仍然不是简单地“把设备接上去”。

对于CXL设备而言,控制器、内存控制器、系统互连、管理处理器、RAS、安全以及软件栈,都需要协同工作。尤其当系统从单主机扩展走向多主机共享时,一致性、地址映射、资源隔离和Fabric管理都会成为必须解决的问题。

这也是Arm所强调的生态价值所在。

在演讲中,李黎明介绍了Arm在CXL生态中的角色:除了Neoverse等处理器IP之外,Arm还提供CMN等系统互连IP。以CMN-S3为例,其定位是面向高可扩展系统的互连方案,并支持CXL连接设备,可用于构建包括服务器、存储和其他数据中心设备在内的复杂系统。

从产业角度来看,Arm提供的并不是一个完整的“CXL产品”,而是帮助合作伙伴搭建CXL设备和复杂SoC的基础模块。合作伙伴则可以围绕内存介质、控制器、压缩、管理、安全以及特定AI工作负载进行差异化创新。

CXL的价值,不只是“把内存做大”

从今天AI基础设施的发展趋势来看,CXL最值得关注的变化,并不是简单增加服务器的内存容量,而是推动内存资源从固定配置走向可扩展、可分层、可池化和可组合。

这背后实际上是一场基础设施资源配置方式的变化。

AI模型越来越大,长上下文和Agent应用又进一步放大了运行时数据规模。如果继续按照传统“CPU+DRAM固定绑定”的方式建设基础设施,资源利用率和扩容成本都可能成为新的问题。

因此,CXL的长期价值或许并不在于替代HBM、DRAM或者SSD,而在于把这些不同层级的资源连接起来,形成更加灵活的内存层级。

AI时代真正需要的,不一定是让所有内存都变得最快,而是让不同数据出现在最合适的位置。

责任编辑:王力
您可以:
排行榜
  1. 怀信科技WMS智能仓储管理系统,为制药及批次流程行业数字化升级按下 “加速键”
  2. 湃睿科技×东鸿电子:PLM项目签约启动,共筑研发管理数字化新基座
  3. 金蝶推出全新AI产品小K,开启企业管理智能共生新时代
  4. 对话Gian Paolo:SOLIDWORKS 2026创新密码与AI战略
  5. 智算时代,企业需要怎样的AI基础设施?
  6. 云栖大会上,我邂逅了一个“AI原生ERP”
  7. 领略原汁原味的TPS,日本精益生产研修班圆满收官
  8. Eplan Platform 2026:标杆之作,焕新定义
  9. SAP Business Suite 整合 AI、数据和应用,驱动下一代企业转型
  10. ManageEngine卓豪:聚力IT管理革新,驱动企业数智升级
编辑推荐
• AVEVA剑维软件HMI中国版首发
• 工信部等十部门印发《促进中小企业发展“十五...
• NVIDIA 与 MediaTek 深化长期合作,构建从边缘...
• 为每一款设计实现精密放大器性能
• 国家算力互联互通区域节点建设名单公布
• 研华全栈国产芯嵌入式方案,赋能关键行业国产...
• Rambam医疗中心、EOS与PTC合作建立数字化植入...
• 霍尼韦尔科技中国创新中心在沪正式启用,赋能...
• Cadence的PCIe 6.0架构子系统实现了首轮PCI E...
• 去年还在跳舞,今年开始干活——人形机器人为...
• 2026数博会映照“十五五”数字经济发展新图景
• 2026国内优质AI算力厂商全景推荐:多元布局筑...
文章推荐
• 十年深耕,梅卡曼德何以成为“具身智能眼脑手...
• 十年深耕,梅卡曼德何以成为“具身智能眼脑手...
• 西门子ICX给企业AI大模型构建业务“数字孪生”
• e-works 2026 WRC 直击:展台只是秀场,工厂才...
• 工业AI落地频踩坑?陶建辉×黄培深度拆解务实...
• 宇树科技成为“A股人形机器人第一股”
• 达索系统、PTC、西门子三巨头AI布局的“异与同...
• 利润大涨89.2%!中国机床凭什么?
• 利润大涨89.2%!中国机床凭什么?
• 2026 增材制造技术演进与产业观察
• Gartner重磅发布!近30项AI智能体技术,谁能“...
• 卡位具身智能“新基建”!华为、百度、腾讯、...

系列微信

数字化企业
观潮工业AI
e-works制信科技
具身智能一线
智能制造网博会
智能制造IM
ERP之家
智能工厂前线
MES百科
PLM之神
供应链指南针
© 2002-2026  武汉制信科技有限公司  版权所有  ICP经营许可证:鄂B2-20030029-1(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号 法律声明及隐私权政策     投诉举报电话:027-87592219

关于我们    |    联系我们    |    隐私条款

ICP经营许可证:鄂B2-20080078
(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号
© 2002-2026  武汉制信科技有限公司  版权所有
投诉举报电话:027-87592219

扫码查看