1. e-works数字化企业网
  2. 新闻
  3. 资讯

破局显存焦虑:新华三推出大模型推理场景加速方案

 
2026年02月04日
关键字:存储  

据多家权威研究机构最新研判,2026 年 核心存储供应链的结构性短缺已成行业刚性现实,供需缺口持续扩大且很可能延续至 2027 年。不仅是存储部件的单点问题,当前,生成式 AI 正从技术尝鲜全面走向规模化落地,大模型技术的应用场景正在从训练为主转向训推并重和轻量推理,PD 分离、KV Cache 等技术的规模化应用在持续提升推理效率的同时,对高带宽、大容量的 GPU 内存提出了极致严苛的要求,显存资源紧张带来的行业焦虑正在持续蔓延。叠加存储部件供应短缺与价格跳升的双重压力,AI 产业发展面临严峻的资源与成本挑战,单纯依靠 “力大砖飞” 的硬件堆叠,不仅会大幅推高每 token 成本,更受供应链产能制约难以为继,严重影响产业良性发展。

因此,通过软硬件协同优化提升 GPU 等关键部件的使用效率,成为破解内存供应链短缺焦虑、降低总体拥有成本的核心路径。

破局困境·架构解密:新华三打造智算推理新引擎

当前,大模型推理面临的发展困境已不可回避:模型对算力与显存的需求呈指数级增长,然而堆叠GPU硬件所带来的成本与能效压力,严重制约技术的可持续发展。尤其在处理长文本、多轮对话等场景时,模型为保存上下文而生成的KV Cache(键值缓存)会急剧膨胀,不仅大量占用宝贵的GPU显存,更导致大量重复计算,成为制约响应速度、推高运营成本的瓶颈。

直面成本与效率的核心痛点,紫光股份旗下新华三集团打造出效能兼备的大模型推理场景加速方案。通过其自研的定制化ASIC芯片提供硬件级加速,KV CacheGPU内存卸载到指定存储节点,构建专为AI设计的“下一代内存层”,减轻GPU显存压力从而在系统层面实现了存算资源的新平衡。新华三凭借自身强大的硬件集成与全栈优化能力,驱动业内前沿科技与自研AI服务器的创新耦合,经过深度的测试调优最终形成了大模型推理加速的最佳实践,为业界提供了一条性能与成本兼顾的全新推理范式。

从部署形态来看,本方案既支持单机形态部署,直接提高单台AI服务器的推理性能。也支持通过外置存储节点的方式同时对接多台AI服务器,提高集群的推理性能。

图片1.png

实测验证·性能跃升:核心指标翻倍,推升深度推理新速度

为深入探究本方案中KV Cache卸载对推理性能的提升,新华三基于自研高性能AI服务器进行基准测试,重点关注在同一机型上,运行DeepSeek-V3-671B模型时,采用标准推理服务和采用KV Cache卸载加速方案的两种模式下的性能差异,分别构建10K和30K的文本输入,模拟实际应用场景中的多轮对话推理过程,以确保测试结果具有实际参考价值。经多轮验证,采用KV Cache卸载加速方案的推理核心指标显著优化

• 并发用户数提升200%在相同TPOT(每个Token生成的平均延迟,ms)限制下,同样的算力资源可支持的并发数显著提升,保障用户体验的同时支持服务更多的用户。

• 推理延迟大幅降低TTFT(首Token生成的延迟,ms)降低70%,TPOT(每个Token生成的平均延迟,ms)降低30%,大幅缩短响应延迟,提升用户体验。

图片2.png

场景适配·全域覆盖:贴合企业GenAI落地需求

• 交互式应用(多轮对话): 如聊天机器人、智能客服等。这类应用中,用户与模型的交互是多轮的,后续轮次的输入通常依赖于前序对话的上下文。通过快速加载存储历史 KV Cache,能够大幅缩短响应延迟,提升用户体验。

• 长上下文处理: 对于需要处理数千甚至数万Tokens上下文的任务(如长文档问答、代码生成、复杂指令理解),GPU内存容量往往成为瓶颈。本方案提供的PB级KV Cache扩展能力,使得处理这类长上下文任务更为从容,避免了因GPU内存不足导致的性能下降或任务失败。

• 高并发推理服务: 在面向大量用户的在线推理服务中,系统需要同时处理多个并发请求。本方案通过高效的KV Cache管理,能够支持更多并发会话,显著提高系统的整体吞吐量(RPS),从而在相同的GPU资源下服务更多用户。

随着模型规模的扩大和用户基数的扩张,大模型推理效率正成为AI基础设施性能的关键指标。新华三凭借多年来在AI领域的技术创新与实践探索推出推理加速方案,并进行精心的调优实践,充分验证了该方案在提升推理效率方面的显著优势,进一步加速GenAI应用的发展。

GenAI时代,推理加速注定是一条持续提升、永无止境的创新之路。面向未来,新华三将持续在AI Infra领域深耕,提供更多针对不同场景,设计基于不同加速层级、不同加速介质等技术路线的推理加速方案,帮助企业和开发者更轻松地应对大模型落地应用的复杂性和规模挑战,推动AI技术在更多领域的应用和创新。

责任编辑:陈玲
本文为授权转载文章,任何人未经原授权方同意,不得复制、转载、摘编等任何方式进行使用,e-works不承担由此而产生的任何法律责任! 如有异议请及时告之,以便进行及时处理。联系方式:editor@e-works.net.cn tel:027-87592219/20/21。
您可以:
排行榜
  1. 奥哲孟凡俊:融合AI的低代码成为企业数智化核心引擎
  2. PTC 推出领先的产品开发 ALM 解决方案 Codebeamer 3.0
  3. 奥哲获CIC灼识认证:中国低代码市场第一品牌!
  4. 怀信科技WMS智能仓储管理系统,为制药及批次流程行业数字化升级按下 “加速键”
  5. DeepSeek发布新版R1 称能力接近国际顶尖模型
  6. 美国对华断供EDA?暗藏怎样的科技博弈?
  7. SAP发布2024年第四季度及全年财报
  8. 国产IEC61499工业控制软件AIOSYS重磅发布
  9. 达索系统3D UNIV+RSES亮相巴黎航展,AI助推转型
  10. U9 cloud重塑价值定位:数智制造成本管理专家
编辑推荐
• 工信部:推动6G、量子科技、具身智能等领域攻...
• 重磅:NVIDIA与达索系统共建工业AI平台
• 研华模块化电脑SOM-7583:通过模块化架构应对...
• 和利时与天津仁爱学院签约揭牌仪式成功举行
• ABB与浪潮通信达成战略合作,携手推进电力与算...
• 达索系统AI专家天团亮相3DE WORLD 2026
• 面向工业类应用高效电源解决方案,MPS推出超薄...
• ABB集团发布2025年第四季度业绩
• TÜV南德双实验室荣获2025年度消费类物联网产...
• 2025年我国规上电子信息制造业增加值同比增长...
• 上汽通用:“岛”上造车,有什么新逻辑
• 科技大厂角逐AI流量新入口 红包大战“硝烟”渐...
文章推荐
• 撕开未来的一隅:当未来工厂在Smart Factory ...
• 天马(芜湖):基于“显示+AI”战略的数智化工...
• 张斌 天马(芜湖)微电子有限公司 CIO
• 厦门ABB:基于大数据的全过程全要素的卓越智能...
• 汪秋果 厦门ABB低压电器设备有限公司 CIO
• 百瑞源:从原料到成品的数智质量管理闭环
• 浙江方泉:基于AIoT+MES的智能工厂建设思路
• 物理AI加速渗透,机器人迈入“能思考、会干活...
• 基于IDEF0的单相异步电机并行设计过程建模
• 变局与重构:2025工业机器人产业发展热点观察
• 基于“整车DMU”工具的开发与应用
• 汽车零件设计可制造性智能检查研究及实践

系列微信

数字化企业网
PLM之神
e-works制信科技
MES百科
工业自动化洞察
智能制造IM
AI智造圈
智能工厂前线
工业机器人洞察
智造人才圈
工业软件应用
智能制造网博会
ERP之家
供应链指南针
© 2002-2026  武汉制信科技有限公司  版权所有  ICP经营许可证:鄂B2-20030029-1(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号 法律声明及隐私权政策     投诉举报电话:027-87592219

关于我们    |    联系我们    |    隐私条款

ICP经营许可证:鄂B2-20080078
(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号
© 2002-2026  武汉制信科技有限公司  版权所有
投诉举报电话:027-87592219

扫码查看