【环球网科技综合报道】9月25日起,四集纪录片《超级工程—
这不是一个只靠“堆卡”就能回答的问题。它牵涉芯片架构、高速互连、存储、散热、工程交付,更牵涉对未来的判断:两年、三年后,科研和产业到底需要什么样的计算能力?曙光8000的选择,正是一次面向未来的关键下注。
立项时还在“小模型时代”
纪录片第一集将时间拉回2021年底。在片中回忆,当时行业尚未意识到,需要以大规模计算架构来支撑人工智能发展。项目启动时的需求背景,与后来大模型带来的算力需求并不是同一幅图景。
但研发团队必须提前规划五年后的系统。李斌说,做方案时需要预判未来市场需求、工艺和工程化能力。曙光信息产业股份有限公司董事长
需求进行原生优化。曙光8000支持从FP64到INT8的全精度算力,覆盖科学计算、大模型训练、AI推理、工业仿真等多类场景。它既可承载高精度科学工程计算,也可支持低精度AI计算,使不同任务都能获得相应的计算支持,也为两类方法结合使用提供条件。这意味着,系统的能力边界和使用范围在方案阶段就被重新划定。
改路线,比新建更难
路线选择听起来是技术问题,但在大型工程中,它首先是协作问题。历军在片中坦言,大型任务一旦确定,要想调整难度极大。业界专家、科学家、产业伙伴需要高度认同,团队至少用一年时间反复沟通、反复说服,最终才能一锤定音。
最终,曙光8000成为国内首个在十万卡规模下研发原生超智融合技术路线的项目。它既要做高精度的科学计算,又要能支持AI大模型的训练推理。路线既定,真正的硬仗才刚刚开始。
曙光8000 AI超集群主任架构师
多芯片协同随之而来。曙光8000单块主板搭载8颗智算芯片,芯片之间的数据通信成为瓶颈。钟于义说,高性能计算任务中,每张卡往往齐步做一样的事情;而智算任务中,每张卡任务不同,数据还要不停通信。
阳欢从传统“斗拱”工艺中找到灵感。斗拱中,有的零件垂直承重,有的零件连接固定,各司其职,保障古建筑结构稳定。机器设计也参照这种思路:有的零件起强度作用,有的起连接作用,经过组合达到系统稳定性和可靠性。最终,整机结构组装精度达到0.05毫米,多达9层部件被装配进不足9厘米的空间内。从万卡到十万卡,不是芯片数量的简单叠加。十万张智能计算芯片要被组织成一套稳定运行的系统,网络、存储、散热、供电、调度每一个环节都要重新设计。
应用才是最终检验
;实现328万亿网格湍流直接模拟;量子领域实现152自旋轨道FeMoco团簇基态能量计算;助力中国气象局地球系统数值预报中心实现1小时完成全球未来10天预报计算,精度达到5公里分辨率。
,可以为更加广泛的用户提供服务。目前超算互联网应用服务平台注册用户数达170万+,应用商品7300+,日均作业量超30万次,累计作业量超2.7亿次。应用覆盖材料、地质、电磁、工具类、海洋、量子、流体、气象、生信、数学、水文、天文、物理等领域。
这些实践说明,曙光8000并非单一算力资源的堆叠,而是从架构设计之初就面向多元混合精度计算需求进行原生优化,是一套可落地、可运营、可验证的系统级解决方案。对产业读者而言,其价值不只在技术参数,更在于一种方法论:
历军在片中回忆,30多年来,团队只在这一个领域持续发展,积累下来的技术、经验和人才,就是底气。中国工程院院士、中科曙光创始人李国杰则说,好钢要用在刀口上,用在真正解决最急需解决的问题上。
从纪录片来看,一套需要多年研制的复杂系统,要跟上快速变化的AI时代,既考验技术实力,也考验对未来应用的判断。路线选择需要提前下注,而工程实现,才是把判断变成现实的那一步。(勃潺)