越来越多的AI推理正在从云端向边缘和桌面迁移。一位医院院长在行业会议上直言,希望智能体推理能够发生在医生的诊室和手术室里,而不只是遥远的云端。这背后,是数据隐私、部署成本与长期记忆缺失等一系列现实困境。
8月26日,在2026全球闪存峰会“存储介质与AI SSD创新应用论坛”上,晶耀智远Envixion AI联合创始人刘钢发表了题为《Memory Hierarchy潜龙腾渊:创新存储架构,突破Agentic AI推理瓶颈》的演讲,分享了智能体推理走向边缘化过程中,团队对存储架构的探索与实践。
晶耀智远Envixion AI联合创始人 刘钢
刘钢指出,仅靠在本地部署大模型并不足以解决专业场景的落地难题。大模型需要叠加“操控系统”(Harness Engineering),并进一步引入让工作可验证的Loop Engineering,以及控制多智能体协作路径的Graph Engineering。在一项医疗场景测试中,单纯使用大模型的问题处理准确率仅42%,叠加上述架构后可提升至78%。
基于此,团队搭建了医疗AI多智能体系统:影像、病理、基因等不同数据分别交由专业智能体分析,再由“主任智能体”综合判断,模拟多学科会诊的协作模式,避免单一模型的幻觉。团队还将结构化知识图谱引入检索环节,使问答准确率从常规向量检索的75% 提升至92.5%。此外,系统具备“反思重组记忆”能力,能够将长期对话沉淀为可跨模型复用的结构化知识,目前已应用于与哈佛医学院、麻省总医院合作的科研项目中,协助寻找肿瘤检测新指标。
大模型不是操作系统,真正让智能体“落地”的,是它背后的记忆与工作架构。
刘钢表示,这类专业场景往往要求数据不能离开本地,因此桌面级智能体设备正在成为新趋势;团队已推出搭载128GB内存的液冷桌面设备,可支持千亿参数模型本地部署。而在他看来,AI设备中存储所占的价值比例已从此前的68%上升至75%,算力已不是推理场景的最大瓶颈,内存容量与带宽才是关键,这也是英伟达将2026年称为“AI存储元年”的重要原因。
刘钢提到,这类桌面智能体设备正迎来新一轮硬件迭代:英伟达在6月发布的RTX Spark已配备128GB内存,AMD即将推出的新一代APU内存容量将提升至192GB,苹果最新发布的M5 Ultra芯片更是搭载了512GB统一内存与1.2T带宽。在他看来,算力已不是边缘智能体推理的核心瓶颈,能否配备足够大的内存容量与带宽,直接决定了本地能否流畅运行千亿乃至万亿参数级别的大模型,减少KV Cache的重复计算。
刘钢认为,随着智能体从云端走向边缘和桌面,存储将在成本和性能层面持续扮演最核心的角色,晶耀智远也将持续围绕Memory Hierarchy的架构创新,为专业场景下的智能体部署提供支撑。
从PC到“AC”(Agent Computer),当算力设备开始为智能体而非人类设计,存储架构的重新定义或许才刚刚开始。
ICP经营许可证:鄂B2-20080078
(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号
© 2002-2026 武汉制信科技有限公司 版权所有
投诉举报电话:027-87592219