AI时代,GPU无疑是聚光灯下的主角。从大模型训练到智能推理,从自动驾驶到AIGC创作,GPU几乎成了“算力”的代名词。但在科学与工程计算的深水区,一个基础性命题始终存在:当算法结构复杂、逻辑分支密集、精度要求苛刻时,什么样的算力底座才真正可靠?
6月15日,中科曙光发布了新一代通用高性能计算平台,以国产百核级通用CPU为核心,通过“算、存、传”全栈协同优化,给出了一个清晰而有力的答案。这是国产通用CPU性能首次进入10T FP64双精度浮点算力区间,首次在规格与性能上达到国际厂商旗舰级水平。
AI浪潮下算力分层:CPU仍是高精度科学计算不可缺失的核心基座
如今AI工具普及,市场普遍形成“GPU主导一切算力”的片面认知。但实际上CPU和GPU各司其职,适用场景完全不同。GPU的核心优势是大批量简单重复运算,主打低精度快速计算,是AI训练、推理的最优选择。但为了追求速度,GPU硬件设计优先优化低精度运算,在高精度计算上天生薄弱。
CPU则擅长复杂、严谨、高精度的数值求解。气象预报、新材料模拟、飞机汽车流体仿真这类科研工业场景,一丁点计算误差都会导致结论完全失真,必须做到极高精度。这类计算要求数值精准到百万分之一级别,依靠CPU原生的双精度(FP64)运算能力才能稳定实现。
除此之外,仿真模拟往往要同步处理上万组原子、流体的联动数据,数据之间关联紧密、不能拆分,GPU分批计算的模式很难适配;全球几十年沉淀的工业仿真、科研软件,都是基于CPU架构开发,若强行迁至GPU,需大规模改写底层代码,成本极高甚至无法完整运行。
“CPU与GPU不存在替代关系,二者长期协同分工”,中科曙光解决方案与创新业务总经理张磊在新品沟通会上明确,GPU承载通用AI加速任务,CPU牢牢守住高精度、强逻辑、大内存交互的科研与工业计算市场。而中科曙光本次发布的新一代通用高性能计算平台,核心目标就是补强国产高精度算力,
解决长期以来国内高端HPC依赖海外芯片、软件迁移成本高、集群并行效率不足三大痛点。
全栈自研性能追平国际旗舰,百核国产CPU实现三大核心突破
在性能参数层面,
中科曙光新一代平台搭载的国产128核、512线程通用处理器,单颗CPU FP64双精度算力达到10T。对于国产通用CPU而言,这是两个“首次”——性能首次进入双位数T级区间,规格首次达到国际旗舰产品水平。
中科曙光展示了一组对比数据:在HPL双精度浮点基准测试中,新一代平台相对性能较上一代提升近2倍,与国际旗舰产品处于同一水平线;在STREAM访存基准测试中,相对性能较上一代提升近1倍,超越了国际同类产品;在应用性能层面,新一代平台平均达到当代平台的1.8倍。
性能突破背后是系统级能力的支撑。
中科曙光围绕“计算—存储—网络”三层架构做全栈协同:
●
计算层通过BurstBuffer技术将海量小文件读写性能提升10倍,SocketDirect技术则让CPU绕过节点间中转直连网卡,有效削减集群通信延迟;
●
存储层自研ParaStor F9000全闪存储,千万级IOPS与220GB/s带宽的组合,曾在IO500全球榜单中拿过冠军;
●
网络层自研scaleFabric无损RDMA,单端口800G带宽、端到端时延0.93微秒,单子网可支撑11.4万卡组网,集群容量比进口方案提升133%的同时成本下降30%。
此外,配套自研HPC-Kit基础软件库,整合优化数学库、编译器、MPI通信库,从底层充分释放国产CPU硬件潜力,实现软硬件一体化紧耦合调优,区别于行业内单纯堆叠芯片的粗放式建设思路。
原生AVX512+X86生态兼容,实现行业软件零成本迁移
长期制约国产超算落地的核心瓶颈并非硬件算力,而是数十年沉淀的全球HPC软件生态壁垒。AVX512作为全球科学计算软件通用优化标准,GROMACS、VASP、NAMD、各类工业CAE仿真软件全部基于该指令集深度优化,过往国产CPU缺失原生支持,用户部署国产平台必须重新编译、改造源码,时间与资金成本极高,极大阻碍国产化替代落地。
中科曙光超算平台搭载的国产百核CPU实现国内首个原生兼容x86架构、原生支持AVX512指令集,完成关键生态跨越。绝大多数成熟商用仿真软件、开源科研工具无需修改源码、无需重新编译,文件可直接运行,自动调用AVX512加速路径,用户原有软件授权、仿真流程、工程经验全部保留,真正做到零迁移成本。
中科曙光高端计算总工程师李建军在采访中表示,对于存量海外商业软件,平台做到了“开箱即用”;而针对国内科研院所和企业自研的小众专业软件,曙光提供全流程适配优化服务,逐步补齐国产软件生态的短板。
当前,平台应用已覆盖六大科学工程计算场景,实际应用表现验证了生态适配价值:材料领域VASP分子动力学模拟性能较上代平台提升2.2倍;工业流体仿真性能提升1.86倍,达到国际旗舰产品95%以上水准;生命科学BWA基因测序工具开启4线程SMT后,性能提升223%;气象公里级数值模拟速度提升1.95倍,可支撑全国36小时预报分辨率从3公里升级至1公里,1小时完成全区域高精度演算……
东南大学李强教授依托国产化小型超算平台开展大量实测验证,指出当前国产硬件核心参数已接轨国际,但小众自研软件适配、多节点集群并行线性效率仍有优化空间。依托曙光全栈软硬件协同方案,通过自研编译器、通信库、高速互联网络,可有效缓解多节点1+1<1.5的并行损耗问题,持续缩小与海外产品工程落地差距。
三类散热硬件全覆盖,兼顾机房改造、高密度、绿色低碳多元需求
为适配不同规模、不同基础设施条件的客户机房,中科曙光同步推出风冷、冷板液冷、浸没相变液冷三种形态计算节点,覆盖高校小型计算集群、区域算力中心、国家级超算中心全场景,兼顾初期投入、长期能耗、部署密度多重需求。
●
风冷机型H620G59:标准化通用算力载体
采用2U标准机架式双路服务器,搭载两颗128核国产CPU,整机256物理核心,单节点算力20TFLOPS;支持32条6400MT/s DDR5内存,8块2.5寸SSD+2块M.2本地存储,3条PCIe5.0扩展槽、双OCP3.0网卡插槽,适配现有传统机房,无需改造基础设施,是当前市场主力交付机型。整机搭载多维度RAS可靠性设计,Gridview全栈监控系统实现集群统一运维,适配中小型科研单位、企业仿真部门轻量化算力部署。
●
TC800 G6冷板式高密计算柜:中型算力中心节能首选
国内首个单机柜实现P级通用算力的液冷系统,单柜部署16000核以上,全冷板无风扇设计,运行噪音低至50分贝,达到图书馆静音标准。整机PUE低至1.08,同等算力规模相较风冷机柜年省电60万元。机柜解耦设计兼容客户现有机房基础设施,整机交付周期压缩至2天,相比传统部署节省60%工期,适合省级气象中心、车企、石化企业中型算力集群建设。
●
TC8600H G5浸没式超高密计算柜:国家级超算核心方案
源自曙光超算同源浸没液冷技术,第三代相变散热能力达200W/cm²,单柜最高支持8万+CPU核心,整柜算力6.4P。整机PUE低至1.04,机房空间节省85%,单柜年节电超千万度,高度契合国家“双碳”算力节能政策。支持CPU与GPU节点混插部署,实现超智融合统一算力池,面向国家级超算、大规模能源勘探、全球气候模拟等超大算力项目,系统可靠性达99.99%,可实现万级作业秒级故障修复。
全栈自主可控,国产HPC迎来赶超窗口期
高性能计算作为国家科研、高端制造的核心算力底座,长期面临海外芯片、软件、网络设备等多重技术制约。中科曙光新一代平台实现了计算CPU、服务器架构、scaleFabric高速交换芯片,以及全套HPC基础软件的100%全国产自研,构建起完整且自主可控的算力链条,具备极强的供应链安全优势。
这场发布的意义,远不止于一座国产高性能计算平台跨入10T算力门槛。它真正撬动的,是对AI时代“算力价值观”的纠偏——在AI热潮下,算力不应只有“快”这一个维度。GPU拓展了智能的边界,CPU则守护着计算的精度与可信,二者从来不是替代关系,而是支撑现代科学计算的两条腿。中科曙光的选择,恰恰是为这条高精度之腿补上了关键的国产化肌肉,让中国算力在面对最苛刻的工业仿真与基础科研时,能真正站得稳、走得远。
从“可用”到“好用”,国产通用计算走过了漫长的技术沉淀期;但从“追赶”到“定义”,还需要更长的耐心。在超智融合的下半场,高精度计算不再是AI热潮中被冷落的配角,而是AI从“涌现”走向“严谨”的必经阶梯。中科曙光此刻锚定的,不是一块CPU的市场份额,而是中国高端制造与基础科研在未来十年里,不依赖外力、不妥协精度的算力主权。