7月18日下午,由观察者网、WAICCONNECT主办、半导体行业观察协办的「重构算力」——AI算力需求与供给的结构性重构产业链接会,在张江科学会堂举行。整场活动聚焦训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算等当下算力产业最紧要的议题。
中科曙光北京公司高端算力系统首席架构师刘冠川,就AI4S的产业落地、国产大规模算力集群的可用性、行业从“卖设备”向“卖算力”的演进趋势等一系列问题做了深入阐述。
算力基础设施的坐标系,正在从“建设导向”重新校准到“应用导向”、从“资源建设”重新校准到“价值创造”。
超算与智算的边界,正在被下游需求倒推着重画
过去很长一段时间,超算和智算是产业里两条几乎不相交的技术路径。超算面向科学计算、工程仿真、生命科学,追求的是高精度、复杂模拟以及长时间的稳定运行;智算伴随着人工智能的兴起而崛起,主打的是大规模模型训练、推理吞吐和海量数据处理。两套体系、两套指标、两支人马、两种工程文化,在过去十年里几乎处于“隔行如隔山”的状态。
但这种边界正在被下游的需求侧倒推着重画。刘冠川对此指出:“AI正在成为科学研究和产业创新的重要工具,AI4S需要同时具备人工智能计算能力和传统科学计算能力;越来越多行业应用也不再是单一任务,而是需要模型训练、数据分析、仿真验证、工程计算等多种能力协同。”他强调,未来的算力基础设施不能再简单按“超算”“智算”这种建设方视角来划分,而必须面向用户实际需求,实现不同计算资源、不同软件生态、不同应用场景的融合。
这就是中科曙光提出的“超智融合”路线。刘冠川特别澄清了一个业内常见的误读——“超智融合”的核心,并不是把两套系统在物理上简单堆到一起,而是通过统一架构、统一管理、统一调度,让不同类型的算力资源能够更高效地协同工作。
落到产品层面,代表性载体就是今年7月正式落成并接入国家超算互联网的首个全国产十万卡AI超集群——曙光8000(登峰)。它能够同时支撑高精度科学计算与低精度AI训练推理,是国内目前规模最大、也是“原生一体化”路线走得最远的一套超智融合系统。
对下游用户而言,融合最直接的价值并不写在参数表上,刘冠川指出:“过去一个科研团队或者企业面对不同计算任务,可能需要建设或者申请不同类型的计算资源;未来通过超智融合架构,可以根据任务特点动态匹配计算资源,让算力从‘建设导向’转向‘应用导向’。用户关注的不再是使用什么类型的机器,而是如何更快、更高效地解决实际问题。”“能不能跑得起来”这件事的重要性,正被“能不能算出结果”覆盖。
AI4S要变成一门生意,采购逻辑要先变
学术圈津津乐道的蛋白质折叠加速千倍、万亿原子分子动力学模拟、860亿神经元全脑模拟,这些AI4S成果对WAIC现场坐着的企业家和投资人来说意味着什么?换句话说——AI4S什么时候能真正变成一门可持续的生意?药企、材料公司、能源企业这些行业用户,今天对AI4S的付费意愿和采购逻辑,跟过去买超算相比又有什么本质不同?
刘冠川给出的判断是——AI4S真正产生商业价值,并不是简单替代传统计算,而是在研发流程中创造新的效率和能力:“过去很多行业用户建设超算资源,主要解决的是计算能力问题,比如仿真模拟、数据分析;但随着AI技术发展,企业关注的不只是‘有没有算力’,而是能不能利用算力缩短研发周期、降低试错成本、提升创新效率。”
这套逻辑正在生命科学、材料、能源等重资产研发行业里显性化——药物研发过去依赖大量实验验证,AI介入之后可以在数据分析、分子筛选、模拟验证多个环节压缩周期;材料和能源领域,AI与传统科学计算的结合正在把新材料发现和复杂系统模拟的边界外移。曙光围绕这类场景推出的“OneScience”科学大模型一站式开发平台,正是把算力、软件工具、行业模型和应用生态打包给最终用户的一次商业化落子。
由此带来的采购逻辑变化,才是产业投资人真正需要关注的信号。
刘冠川认为:“过去(行业用户)更多是采购计算设备和计算资源,未来会更加关注面向业务目标的算力服务能力,包括计算资源、软件工具、行业模型以及应用生态的整体支撑。”
算力供应商未来的价值锚,可能不再简单看装机量和出货吨位,而要看它能不能被行业客户按“业务成效”付费。这是从“卖工具”到“卖结果”的一次范式转移。
当然,他也承认AI4S仍处在快速发展阶段,成熟商业模式的形成不是任何一家厂商能单独推动完成的,需要基础设施提供者、科研机构、行业企业和开发者生态等产业链各方共同发力。用他自己的话说,“算力基础设施的作用,就是为这些创新提供稳定、开放的底座。”
全国产十万卡:从“单点突破”走向“系统协同”
国产算力生态的成熟度与易用性,是行业内所有算力供应商都绕不开的一道追问。中科曙光的十万卡AI超集群在芯片、网络、存储、液冷等方面实现了全链路国产化,这在业内被视为国产大规模算力系统的一个里程碑。但站在客户侧,“能跑”和“好用”之间到底还有多大一道鸿沟?跟国际主流方案的差距,是在缩小还是在拉大?
刘冠川对这道题的判断是——国产算力生态正处在从“单点突破”向“系统协同”的转变之中。“过去大家关注更多的是某一个核心部件能不能实现国产替代,但对大规模算力系统来说,真正的挑战并不只是单个产品性能,而是芯片、服务器、网络、存储、软件、应用优化以及运维体系之间的协同。”这也是曙光反复强调“全链路能力”的原因——一个大型算力集群能否稳定运行,最终考验的是整个系统工程能力,而不是任何单一环节的峰值指标。
落到曙光自身的产业生态,参股公司海光信息覆盖国产CPU/GPU芯片,旗下曙光数创在数据中心液冷赛道保持国内市占率连续四年第一,中科星图等生态成员进一步向遥感、地理信息等应用侧延伸;配合中科曙光自研的scaleFabric类IB原生RDMA无损高速互连网络,与自研ParaStor分布式全闪存储,构成了“计算、存储、网络、散热、应用、服务”全链路全国产自研AI基础设施能力。这套生态版图不是营销叙事的产物,而是过去十几年在高端计算领域一段段积累出来的系统工程能力。
但对于国产算力和国际先进水平之间的差距,刘冠川的回答颇为坦率——“以大规模AI计算为例,除了硬件本身,还需要围绕通信效率、资源调度、模型优化、应用迁移等环节持续优化。与国际先进水平相比,国产算力生态仍然需要进一步完善,特别是在软件生态、开发者生态、应用迁移效率等方面,需要产业共同努力。”这段话把接下来几年真正的战场清晰地指了出来:软件、开发者、迁移工具,这些是硬件之外国产算力真正的长跑赛道。
他最后给出的结论是:“未来竞争不会只是单个产品的竞争,而是整个算力生态体系的竞争。谁能够为用户提供更加开放、高效、易用的计算环境,谁才能真正支撑人工智能产业发展。”这句话放到「重构算力」的会场里读,别有意味——它意味着国产算力产业的下一轮胜负手,不再只在单卡性能与制程工艺上,而是在整个生态的组织能力上。
从卖设备到卖算力,算力产业价值链正在延伸?
翻开中科曙光2025年报,一个显著的信号是——软件与技术服务业务增长超过75%、毛利率将近47%,而传统IT设备业务只保持了个位数增长;同期公司整体营收149.64亿元、同比增长13.81%,扣非归母净利润增速达34%,主业盈利能力显著提升。此外,国家超算互联网平台已服务超过35万家用户、连接超过300万CPU核和20万GPU卡这样的运营侧数据,几个维度拼在一起,指向一个不容回避的问题:中科曙光是不是正在从一家硬件公司,变成一家算力服务公司?
刘冠川的回答绕开了“是”与“否”的二元框架。他强调了产业侧变化的方向——“过去计算产业更多围绕硬件产品展开,用户采购服务器、存储等基础设备;但随着人工智能时代到来,用户需求正在从‘购买设备’转向‘获得计算能力和应用价值’。”
这并不意味着硬件不再重要:“强大的基础设施仍然是算力发展的基础。”但竞争的重心,未来将从单一产品能力,向软硬件协同能力、资源管理能力、应用服务能力以及生态建设能力延伸。
中科曙光过去几年积累的“从计算设备、数据存储、液冷基础设施到算力平台和应用生态”的综合能力,可以更好应对行业趋势变化。“我们希望做的不只是提供计算设备,而是帮助用户更高效地使用算力、释放算力价值。”
以面向科学计算场景的“OneScience”平台为例,通过把算力“隐藏”到应用之后,让客户直接获得业务侧的成效,而不是一堆需要自己再去做二次开发的裸算力。
但最大的挑战不在硬件端,而在服务端。刘冠川坦言,挑战是“如何让先进计算能力真正普惠化、服务化”。一方面,算力基础设施本身越来越复杂——大规模集群的建设和运营,对系统能力的要求已经不是单一厂商可以独自覆盖的;另一方面,不同行业用户对算力的需求差异极大——金融、医疗、材料、能源、汽车,每一个行业都有自己的算力使用曲线、数据合规要求和业务节奏,需要供应商更贴近应用场景,提供更加灵活、高效的服务。这既是能力建设问题,也是组织形态和商业模式的问题。
“算力基础设施的发展方向一定是从‘资源建设’走向‘价值创造’。”这是刘冠川在这场对话中给出的核心判断,也为算力产业长期发展给出战略坐标。它意味着未来评价一家算力供应商的标准,不再是它建了多少个数据中心、部署了多少卡的集群,而是它能否让这些算力被更多行业用户以更低门槛、更高效率地使用起来。
十万卡里程碑之后,产业最难的一战刚刚开始
「重构算力」的六大议题——训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算,本质上都指向同一个更大的问题:AI时代的算力供给,能不能真正对齐产业侧的实际用力方向。中科曙光作为国内高端计算领域少数具备全链路能力的头部厂商,其“超智融合”的技术路线选择与“从设备到服务”的价值延伸,是观察这场算力产业结构性变革的一个重要样本。
刘冠川用一句朴素的话为这次专访作结:“我们的目标,就是让算力更好地服务科研创新和产业发展。”在十万卡集群刚刚成为一个可复用的工程能力样板的今天,这句话背后真正的含金量,可能才刚刚开始被产业读懂。而这,也正是「重构算力」这场论坛把“重构”二字放到最前面的原因所在——真正的重构,从来不是硬件层面的堆叠,而是产业逻辑与商业模式的重新校准。