资讯 芯片
此为临时链接,仅用于文章预览,将在时失效

国产首个十万卡集群曙光8000亮相WAIC,上线首周应用满载

作者:陈悦琳
2026/07/21 14:58

“如果全部算力都用于推理,曙光8000将是中国最大的Token工厂,能支撑当前全国5%~10%的Token需求。”在一次采访中,中科曙光公司高级副总裁李斌的换算,让现场嘉宾对国产十万卡集群的体量有了最直观的感受。

7月,光合组织2026智能计算应用大会期间,首台全国产十万卡量级AI超集群系统——曙光8000(登峰)正式落成,一周后真机在世界人工智能大会(WAIC)正式亮相。据了解,这也是国内首台明确采用“超智融合”技术路线的系统。

国产首个十万卡集群曙光8000亮相WAIC,上线首周应用满载

根据曙光8000(登峰)公布的最新运行数据,集群正式上线市场需求火爆,首周即实现应用满载运行,目前日均处理作业数突破15万个,单日处理作业峰值超过50万个。


落成即投用,投用即满载。从万亿级参数大模型的训练和高通量推理,到超300余个重点科学工程计算应用,再到AI4S(AI for Science)的前沿探索,曙光8000承担的任务量被迅速拉满的同时,还为下一代十万亿参数大模型预留了空间。

 

但挑战随之而来。当建设成本与运营复杂度呈指数级攀升,这套在2024年底完成研制并在接下来一年多时间内完成批量部署的系统,究竟如何撑起十万卡的野心?

 

十万卡集群的工程硬仗

故事的开端并不在AI。

 

早期大规模GPU集群主要服务于模拟仿真、流体力学等高性能计算场景。转折出现在2018年。英伟达发布的HGX-2统一计算平台,不仅验证了大规模GPU互连的可行性,更值得注意的是,其搭载的V100凭借Tensor Core,首次将AI混合精度计算能力推至百TFLOPS级别。

 

同年公布的全球超算TOP500榜单显示,Tensor Core GPU已广泛进入超级计算机系统。这意味着,原本主要服务于科学计算的基础设施,开始具备支撑大规模AI训练的能力。

 

但真正推动AI基础设施扩张的是AI训练需求的爆发。彼时OpenAI披露了一组数据:自2012年AlexNet点燃深度学习热潮以来,用于最大规模AI训练的算力增长了超30万倍。OpenAI同时预警:业界必须为“远超当前算力水平的全新系统”做好准备。

 

大模型时代迅速验证了上述判断。模型参数、训练数据和推理需求的膨胀,对总算力不断提出更高要求,集群规模亟待扩展。

 

而曙光集群的演进轨迹,也成为了不断突破集群规模边界的显著标志。

 

2010年发布的曙光6000(星云)采用CPU-GPU异构架构,验证了大规模异构计算系统的可行性;进入大模型时代后,曙光开始围绕AI训练重新设计基础设施,2025年发布国内首个基于AI计算开放架构设计的曙光AI超集群系统,随后在年底发布了全球领先的大规模智能计算系统scaleX万卡超集群。直至今日发布的曙光8000,代表着国产AI基础设施首次向十万卡规模发起挑战。

 

集群规模每发生一次跃迁,技术可能性的天花板也随之被抬高一层。与此同时,工程层面的考验也在升级。李斌将核心挑战归结为两点:性能效率与可靠性

国产首个十万卡集群曙光8000亮相WAIC,上线首周应用满载

如何让增加的计算卡真正转化成有效算力,也是今天所有超大规模AI集群落地时首先需要回答的问题。

 

“保证效率和卡数量一样呈线性增长,这是最大的挑战。”李斌解释,此时的互联网络极度复杂,包含Scale-Out和Scale-Up两层架构。任何一个计算与网络的重叠掩盖没做好或系统设计存在任何短板,性能就发挥不出来。

 

据李斌介绍,中科曙光首先在Scale-up层面提升单柜计算密度,将640张加速卡集成于单个机柜内,尽可能缩短GPU之间的互连距离,并优先采用铜互联,以降低通信时延、功耗和系统复杂度。

 

他解释,在短距离条件下,铜连接通常具有成本、功耗和可靠性优势。英伟达NVL72等高密度方案同样遵循这一思路。但他同时表示,随着传输速率继续提高,铜互联必然面对物理瓶颈。

 

“预计在2029年至2030年前后,硅光和CPO(光电共封装)可能进一步进入柜内互联,届时计算芯片与光纤之间的距离会继续缩短。”李斌表示曙光目前也正在布局相关技术路径。

 

而在机柜间,中科曙光自研400G高速网卡和880G交换芯片,构建起国产原生RDMA(Remote Direct Memory Access,远程访问内存)高速互连网络Scale Fabric,实现十万卡规模下的高带宽、低时延通信。

 

针对这一早在今年3月首发的网络方案,李斌表示,经过长时间的性能、可靠性与应用兼容性验证,Scale Fabric未来有能力实现对InfiniBand的全面国产化替代。

 

除此之外,十万卡规模攀升背后是数量增加十倍的元器件。当潜在故障点随之翻倍,维持整个集群长期稳定运行的难度也在成倍放大。

 

李斌坦言,解决方式没有捷径,从最微小的部件到每一块板卡,曙光选择的是把每个单点的可靠性再提高一个数量级。

 

在这套逻辑下,液冷的角色被重新定义。李斌指出,液冷的关键作用并非单纯降低PUE,而是让系统运行在一个恒定的、稳定的环境中,从而大幅提高整机可靠性。

 

在后续的国家超算互联网核心节点实地探访中,雷峰网见到了中科曙光最新一代相变浸没式液冷机柜集群。机器运转的那一刻,一个感受变得具体:十万卡集群真正的工程复杂度,不只在于“点亮”,更在于持续运营。

 

这无疑重新划定了算力产业的竞争边界。

 

国海证券计算机首席分析师刘熹认为,千卡集群的表现更多受到GPU和服务器等硬件性能影响,但随着规模走向万卡、十万卡乃至更大规模,组网、系统集成、散热、电源和软件调度等环节的重要性反而更加凸显。

 

另一位券商分析师补充,这种系统级能力无法通过短期采购快速获得,而是依赖长期积累的工程经验、方法论和工具链。

 

当AI基础设施的竞争从谁拥有性能更高的GPU升维至系统集成、工程经验和工具链的厚度,中科曙光显然已经站在前列。

 

超智融合,为什么成为十万卡的主战场?

但这并不代表模型已经进入十万卡时代。

 

在发布会现场,李斌透露目前曙光8000已与国内大模型团队合作完成语言模型、语义模型和世界模型的万卡级预训练,并为超过400个主流模型提供线上推理服务,此外还针对PD分离、KV Cache等推理部署完成了大量高通量优化。

 

“比较遗憾的是,现在没有找到任何一个大模型能跑到10万卡。”李斌解释,当前模型参数扩展到万卡规模后,即使继续增加计算资源,性能也很难实现同步上升。

 

这意味着,当基础设施的扩张速度开始快于模型扩展能力,下一阶段比拼的不再只是有效算力的供给,而在于模型架构、训练算法和系统工程化层面的协同。

 

不过,这并不影响十万卡系统”跑满“应用需求。在“超智融合”技术路线的指引下,已接入国家超算互联网的曙光8000更像一座共享算力底座。

国产首个十万卡集群曙光8000亮相WAIC,上线首周应用满载

李斌指出,一方面,大模型时代的AI需要借助超智融合架构提供算力支撑;另一方面,传统的科学与工程计算也在AI4S的推动下走向智能化——这类场景本身就是混合负载。

 

他表示,当前基于曙光8000运转的AI4S项目中,超过40%已结合了机器学习方法。随着智能体、物理AI等方向持续发展,这一融合趋势还将加速。

 

值得注意的是,中科曙光的超智融合路线并非在不同机房里分别部署超算设备和智算设备,而是让同一个计算单元同时覆盖科学工程计算与神经网络计算。

 

根据其已披露的架构,曙光8000支持从FP64到INT8的多种计算精度,并可进行混合精度调用;底层平台由6款达到了国际先进水平的核心国产芯片、存储和互连系统等部件共同构成。

 

李斌介绍,当前超300项的超智融合应用优化覆盖了大模型、机器人、创新药、天文气象等二十余领域,其中70余项已完成万卡规模扩展,验证了核心节点在极端负载下的稳定性。此外,蛋白质折叠、万亿原子水分子模拟、百万亿网格湍流模拟等重点应用也已跑通。

 

随着曙光8000实现技术、生态、应用、服务标准完成闭环验证,曙光还将与北京科学智能研究院启动第二套全国产十万卡超智融合系统。李斌透露,下一代将更聚焦AI4S,可能减少对部分纯AI通用场景的兼顾,以换取对科学任务更有针对性的支持。

 

正如中国工程院李国杰院士所言,大模型能力的边界,本质上仍然是语言的边界。而科学发现需要超越语言。对于AI4S来说,算力的意义不再只是训练更大的模型,而是帮助人类探索未知规律。

 

从服务模型到服务科学,这或许才是十万卡真正的下一步。


雷峰网雷峰网(公众号:雷峰网)

 

长按图片保存图片,分享给好友或朋友圈

正在生成分享图...

取消
相关文章