过去一年多,存储市场涨声一片,三星、SK海力士、美光等NAND巨头集体减产,闪存价格反弹甚至翻倍上涨,内存的供需差距持续拉大,价格一路走高。对于正在落地大模型的企业来说,这道涨价题格外棘手,想要支撑长文本处理、多用户高并发推理,就得为更贵的显存和内存买单。做大模型推理,存储“记忆”的成本,已超过模型本身运算“思考”的开销。
难道想要AI业务跑得更稳更快,就只能不断追加预算、硬堆硬件吗?
面对显存成本高企、推理性能瓶颈,行业把目光投向大模型推理里一个此前并不为大众熟知的关键模块——KV Cache。8月26日中科曙光词元加速方案媒体沟通会上,中科曙光分布式存储产品部总经理石静,详解了中科曙光全新发布的ParaCache高效管理解决方案。其思路很直接,
把大模型已经算过的结果长时间保存下来,下次需要时直接复用,用存储为算力减负。这套方案要解决的问题,正是当前大模型推理中普遍存在的一道瓶颈。
显存墙:推理规模化落地的拦路虎
大模型的推理方式有点像“健忘症”,每生成新的内容,都要把历史内容重新算一遍,计算量呈平方级增长。石静介绍,
当前在整个AI算力服务中,推理占的比重越来越高。推理分为Prefill和Decode两个阶段:Prefill阶段对输入做批量处理,生成KV Cache并暂存,供Decode阶段逐字输出时反复调用。但在实际应用中,大量问题是重复的,多轮对话中的KV Cache也大量重复。“GPU算力是很宝贵的,如果能把这些KV Cache提前保存下来,不用每一次都重新计算,就会节省很多算力。”石静说,KV Cache以存换算已经成为业界共识。
但问题随之而来,KV Cache如果只放在GPU的HBM里,长上下文一来,很快就会把显存“撑爆”。“这时候虽然算力够了,但因为HBM撑爆以后,也不能响应更多请求,这就是显存墙。”石静解释道,破解显存墙有两条路:
一是在源头上压缩KV Cache;二是把KV Cache从HBM卸载到容量更大、成本更低的介质上,比如CPU内存、SSD乃至分布式存储。
然而,业界现有方案仍存在明显瓶颈。以开源的LMCache为例,它能实现KV Cache在不同推理实例间的隔离,却只是单机版,跨GPU就无法共享;不同存储层级的缓存信息相互割裂,缺少统一全局视图,系统很难精准判断一份缓存应当调度到哪一层硬件;分布式存储理论上非常适合充当共享缓存池,但受锁机制带来的延迟影响,很长一段时间里,它只能存放极少访问的老旧数据,无法深度参与推理实时调度。
四级全层级:让分布式存储直接参与推理
针对上述痛点,中科曙光提出“从存数据,走向存智能”的KV Cache管理思路。这套ParaCache方案以ParaStor分布式存储作为底层底座,结合FlashNexus集中式存储,对接主流推理框架,深度融合为一套成熟完整的全层级缓存管理体系。
石静总结这套架构有几个核心特点。
其一是完整覆盖四级存储介质:L1是GPU本地HBM显存,L2为CPU内存DRAM,L3是SSD介质,L4是POSIX接口分布式存储。值得一提的是L3缓存层,除常规本地SSD之外,ParaCache首次把FlashNexus集中式存储纳入进来。实测显示,无论是时延、吞吐量还是多请求并发数,都较本地SSD有2倍提升。
其二,L4分布式存储不再只是存放老旧数据的容器“冷数据仓库”。依托POSIX协议与AI直通存储技术,L4真正参与缓存全生命周期流转:缓存既能够直接从显存L1层卸载下沉到L4,也可以反向回迁到L1、L2,同时支持缓存的自动淘汰清理。同时,底层硬件选用ParaStor F9000,还针对性做了多项适配优化:把部分框架的覆盖写模式,改成更利于降延迟的追加写;轻量化改造分布式锁,支持按目录移除重量级排他锁;在PD分离部署的推理集群当中,只传输增量KV数据,减少网络带宽无谓消耗。
其三是自研XDS技术。“XDS技术与NVIDIA的GDS相似,但我们的X代表除了GPU以外,也可以支持国内的AI卡。”石静介绍,XDS让AI加速卡可以直接与分布式存储交互,从L1直达L4,越过L2和L3层级,省掉CPU DRAM和本地SSD,“这也是ParaStor能够作为L4满足生产级推理落地的关键所在”。
ParaCache部署在推理框架下层,基于vLLM、SGLang开发的上层业务,可以直接完成对接。石静强调,ParaCache不是曙光一家闭门造车:“我们会跟许多主流第三方KV管理软件厂商做深度联合定制开发。”
在全局调度层面,统一的元数据视图打通各模块之间的信息孤岛,系统可以精准判定每一份KV Cache该归属哪一层存储。同时系统还会和推理调度组件协同,实现缓存预取:不等业务请求到来,算法提前预判数据需求,提前把缓存加载到对应高速层级,把等待耗时转化成加速效果。淘汰策略也可以按目录灵活配置,不同业务应用可以自定义缓存留存时间,部分业务保留数分钟,部分业务则可以留存数小时。
这套架构的核心逻辑并不复杂,把热数据留在最快的显存里,温数据下沉到SSD,冷数据交给分布式存储长期保管;但难点在于,系统必须精准知道每一份数据该放在哪一层。
ParaCache的解法是用统一元数据视图打通各层级,让调度有据可依。
实测数据:首Token时延最高降98.5%,吞吐最高提升26倍
与业界常见的单请求测试不同,ParaCache的测试全部基于真实应用场景。在高并发场景下,加上ParaCache后,系统的Token吞吐量较仅使用HBM有近26倍的提升;在约12万词元输入下,单轮对话开始回答前的等待时间最高降低98.5%,可降至0.4秒;在多轮对话测试中,以30K和120K的初始输入叠加20轮对话,首词延迟也可以降低89%。同时在PD分离架构下,既压低首token时延,保障QPS稳定,还能有效降低L2缓存资源消耗。
目前这套方案已经在多个重量级项目落地验证。国内某头部互联网企业的在线推理业务,通过KV Cache管理优化,模型开始回答前的平均等待时间可降低50%以上。
在扩展性上,石静表示,目前几十台到上百台8卡GPU节点或几十卡超节点的场景应用最多,“上百台的规模是没有什么问题的”。
存算协同:一场推理架构的范式之变
“以前做AI建设,思路就是遇到瓶颈就堆GPU。但GPU成本高,供给也受限,不能单纯靠堆砌。”石静表示,
AI基础设施正从“堆GPU”转向算力存力协同优化,这是大规模训推走向规模化生产的必然趋势。
赛迪顾问《中国分布式存储市场研究报告(2026)》显示,2022至2025年,中国分布式存储市场规模从104.2亿元跃升至289.4亿元,年均复合增速近30%。石静判断,ParaCache这类KV管理软件,代表着推理架构的范式变化——“
传统概念里GPU是整个架构的中心,KV Cache只是中间的临时状态,但在新架构下,KV Cache已经成为一种数据资产,GPU应该围绕这些数据去提供计算能力。”存储正从计算配套升级为数据资产核心载体。
这一趋势直接体现在价值层面。在长上下文、多轮对话、知识库、高通量批量推理和AI智能体等场景,ParaCache能节省HBM和CPU内存的占用,大致估算,内存或SSD配置上可节省三分之一的硬件采购。同时,落地也在加速,某银行信用卡中心、办卡中心通过超节点加ParaCache,并发吞吐量提升3倍左右;教科研领域的AI助学、RAG知识库问答场景,并发度可提升15到20倍。
“存储已跳出单纯存放数据的容器角色,从被动IO响应转向深度数据调度、缓存复用与计算卸载。”石静认为,这是AI驱动下数据基础设施的结构性变化,也是国内厂商在存算协同赛道上的真正机遇。