光合及目
1lux.xyz
← 报道
公司新闻网易· 2026-09-18

华为的硅基 “黑土地”:只做算力底座,把庄稼和收成留给伙伴

2026年,AI产业开始重新思考一个基本问题,算力的底座应该长什么样。

大模型参数快速迈向10万亿,智能体从小时级工作走向月级,中国每日推理Token(词元,大模型处理信息的基本单位)达到500万亿,2030年将达到百万万亿级;端侧智能同样在快速增强,手机模型从2024年的3B发展到今天的30B,未来将走向100B级。需求以数量级增长,单靠提升芯片性能已经不够,算力的供给方式需要从底层重新设计。

这个问题之所以紧迫,是因为AI产业的分工正在走向深水区。做模型的、做应用的、做基础设施的,各自的边界需要清晰。尤其是做底座的那一方,如果同时涉足模型和应用,上层的企业就很难放心把业务建在上面。

9月17日,华为全联接大会2026在上海开幕,华为副董事长、轮值董事长汪涛在主题演讲中将硅基黑土地确立为华为AI战略的核心表达,聚焦AI基础设施,做算力底座,把应用和数据的繁荣留给伙伴。

在现场,华为还发布了业界首个采用NPO(近封装光学)技术的超节点昇腾960,并公布了昇腾芯片此后数年的路线图。

当天,汪涛与经济观察报等媒体进行了深度交流,就超节点与集群的技术边界、近封装光学的产业前景、算力生态的开放路径等话题,作了进一步阐释。

计算的基本单元变了

数十年来,数据中心的基本单元是服务器,采购按台计算,部署按台推进,扩容按台叠加,扩大算力规模的办法,是买更多的服务器,再把它们接进同一张网络。

AI大模型的持续迭代让这套沿用多年的逻辑碰到了天花板。

当前,所有排名靠前的SOTA(State of the Art,业界最先进水平)模型,参数规模已经至少从万亿级起步,2027年将走向10万亿级。

十万卡以上的超节点集群正在成为AI基础设施的基础配置。但在传统服务器架构下,集群内通信耗去超过40%的训练时间,服务器与服务器之间的带宽远低于服务器内部,上万张卡虽然都在集群里,但相当一部分时间不在计算,在等待数据。

有产业链人士就告诉记者,在目前一个规模达10万卡的超大集群中,业界MFU(模型浮点算力利用率,衡量算力被真实用于计算的程度)往往连30%都不到,意味着70%的时间处于故障和故障修复状态。

买下上万张卡,七成算力在空转,对于任何一家投入前沿大模型训练的企业来说,这笔账都很难算得过来。

汪涛谈到,华为走的是一条不同的创新路径,利用全新的系统架构,采用“超节点+集群”,以多个超节点构成高速协同的算力系统,来满足超大规模大模型的训练和推理需求。

所谓超节点,是指物理上由多个计算节点通过高效互联协议紧密连接组成、具备跨物理节点统一内存编址能力、逻辑上呈现为一台计算机的计算系统。

今年,鹏城实验室和全球计算联盟(GCC)联合38家单位共同定义了超节点并写入行业规范。中国工程院院士高文此前公开指出,超节点已成为AI基础设施建设的全新范式。

上万张卡,在逻辑上是一台计算机。

汪涛指出,超节点内跨物理节点的内存可以统一编址,任何一颗AI芯片都能访问超节点内的整个内存共享池,这才叫超节点。

此前行业对超节点的称谓一度宽泛,定义写入行业规范之后,超节点有了统一的衡量标准。

统一内存编址的产业意义在于,传统架构下必须逐包走网络协议的通信,在超节点内部不再需要发生。省下的通信时间直接换算成算力产出,相关仿真数据显示,4K超节点组成的10万卡集群,MFU较8卡服务器组成的同规模集群提升2.75倍,而MFU每提升1个百分点,10万卡集群的大模型训练周期就可缩短约三天。

在以月计的训练竞赛里,系统效率的差距就是模型迭代速度的差距。

竞争的标尺由此从单卡峰值算力换成系统效率。入场门槛也随之改变,供电、散热、互联、故障的快速恢复,任何一环的短板都会拉低整体可用度。

汪涛向记者表示,做好一颗芯片不够,做好一台服务器也不够,如此大规模的计算系统,最终需要的是复杂的多学科系统工程能力,给客户交付一个高可用度的计算系统,这才是有价值的。

而华为在通信技术、光模块、算力、系统等每个领域都有长期大规模的研发投入,每个领域都有最好的专家。

超节点的难度在于,它对芯片、互联、散热、供电、软件的要求是同时提出的,任何一个领域的短板都会成为整个系统的瓶颈,单一领域的领先不能解决问题,多个领域的积累同时到达一定水准,系统级的创新才具备条件。

此外,当算力的瓶颈从计算本身转向芯片之间的连接,通信能力成为算力竞争的核心变量。

互联协议、组网架构、光电转换,这些过去属于通信工程的课题,如今直接决定一套算力系统的效率上限,三十余年的通信积累在这个时代有了新的用武之地。

超节点的规模从384卡、1024卡演进到4096卡,每一代提升对应芯片统一内存编址能力的代际增强。

随着智能体任务不断拉长、模型上下文快速膨胀,训练与推理所需要的算力形态,已从单一的智算超节点扩展为一个复杂的系统。智算超节点负责训练和推理,鲲鹏通算超节点面向通用计算与智能体运行场景,AI记忆存储为长任务推理提供PB级的缓存能力,各子系统经由灵衢UnifiedBus(华为自研的超节点统一互联协议)连接,多种互联协议归一为一种,协议转换的开销大幅减少。

再向上,超节点集群最大可支持百万卡量级。

技术上的扩展空间已经打开,商用部署也在同步跟进。

截至目前,昇腾910C超节点部署超1000套,昇腾950超节点也已规模商用,客户覆盖互联网、运营商、金融、政务、制造等370多家企业,也是国内唯一训练出SOTA模型的超节点。

算力供给由此不再单纯依赖单颗芯片的性能提升,在大模型参数迈向十万亿的时代,这条以系统架构创新为轴心的路线,为中国AI产业提供了可持续演进的算力支撑,也为全球AI基础设施提供了又一种经过规模验证的选择。

光走进了计算系统

超节点内部,芯片之间的连接逼近了铜的极限。

芯片间互联速率迈入224G时代后,电信号的有效传输距离缩短到两米以内,单板损耗预算只剩二十几dB(分贝,衡量信号衰减程度的单位)。而一个数千卡规模的超节点,高速铜缆动辄以数万根计,布线、散热与可靠性的负担都随规模同步增长。

系统规模的增长没有止境,铜的物理极限却不会移动,互联方式的更换由此成为必然。

全行业的共识是让光尽可能靠近计算芯片,在芯片近旁完成电光转换,用光的长距离与低损耗接管铜做不到的部分,柜内用电、出柜用光。

汪涛指出,随着超节点规模越来越大,从传统的可插拔光模块走向NPO,即把光引擎安装到距离算力芯片仅几厘米的位置就近完成电光转换,是必然的选择。

率先把这条路走通的产品出现在中国。

华为将三十余年光通信技术积累引入超节点,推出了NPO光引擎Hi-ONE。


汪涛提到,Hi-ONE有三个业界第一,它是业界首个规模商用的NPO产品,目前业界尚无同类产品进入规模商用;单引擎7.2T(每秒传输7.2万亿比特),相当于把36路200G通道集成于一个模块,是目前行业最大传输能力;它同时是唯一实现内置光源的NPO产品。

把光源做进引擎内部,考验的不只是光学设计,还有材料、工艺与制造的协同,仅制造良率一项,就经历了数年的迭代攻坚,这也是业界同类方案迟迟停留在概念阶段的原因之一。

昇腾960超节点以5500个Hi-ONE替代原本需要的4.8万颗800G光模块,功耗降低超过550千瓦,系统无故障运行时间提升一倍,可用度达到99.8%。互联部件数量压缩近一个量级,故障概率的基数被同步压缩,超大规模系统的可靠性逻辑由此改写。

这条技术路径承接τ定律(韬定律)的创新方向,在几何尺寸的缩微之外,把信号传输的时间与路径持续压缩,同样能带来系统性能的代际提升。

业界同样在探索的CPO(共封装光学)方案,当前仍面临封装良率与可靠性的产业化挑战,近封装光学是当前阶段更为成熟可行的方案。

过去,光通信解决的是信息跨城市、跨大洲的传输;今天,同样的技术积累被用于芯片与芯片之间数米到数十米的互联。当光走进计算系统,光通信与计算这两条各自演进数十年的技术脉络,在AI基础设施上完成了合流。

中国光通信产业数十年的积累,由此第一次进入算力竞争的主战场。

华为已在全球光互联标准组织OIF提出NPO标准立项建议并获得行业响应,此前联合20余家产业伙伴发起的OPEN NPO多源协议也在推进。

标准化意味着更多厂商可以生产相互兼容的NPO产品,产业整体成本随规模扩大而下降,一项率先落地的技术,以此成为整个产业可以共用的能力。

随着标准体系逐步建立,这一由中国企业率先完成规模商用的技术方向,日益成为全球下一代AI基础设施的共同选项。

互联标准从何处发起,往往预示着下一轮产业创新将围绕何处展开。

智能世界需要硅基黑土地

硅基黑土地不是一个新造的概念。

2018年,黑土地作为平台战略被提出,华为把自身定位为智能世界的基础平台,把应用与数据的繁荣留给伙伴。数年演进后,其内涵扩展为覆盖云、边、端的端到端算力底座。


汪涛向记者表示,华为讲的硅基黑土地是一个跨边、端、云侧的端到端AI算力底座,既有超大规模用于训练的算力集群,也有用于高效推理的算力集群,在末端小的物联网终端,也要全面走向智能化。

从训练万亿参数模型的超大规模集群,到口袋里的手机、路上的汽车、工厂里的传感器,华为为不同场景提供从微算力到超大算力的完整方案,智能世界不仅仅是数据中心的智能。

底座的定位划定了业务的边界。华为AI战略的核心是算力,坚持硬件变现,将业务收敛在行业分层的底部。

汪涛谈到,坚持硬件变现的实质是约束华为自身的业务边界,70%的研发投入在软件上却不靠软件变现。每家企业磨好自己的豆腐,华为的豆腐就是AI算力底座,做好大模型企业的底座和后盾。客串是没有长期竞争力的。

在他看来,中国新一代AI企业非常优秀,华为的定位是支持好他们。华为愿意提供硬件和云两种灵活的算力模式,无论是互联网头部企业还是创新新秀,也包括中小企业,所有的核心是提供算力而非应用。

对大模型企业来说,在一个不会和自己“抢生意”的底座上训练和部署模型,长期投入的确定性会高很多。

边界清晰之后,昇腾生态开始加速生长。

汪涛就提到,经过八年的努力,昇腾生态基本跨过了拐点。

CANN(昇腾的基础软件平台,开发者经由它调用昇腾算力)代码全量开源,在中国开放原子开源基金会的平台上,CANN已成为第一活跃的社区,外部开发者占比达61%,首次超过内部,社区月活开发者突破5200名,基于昇腾与CANN原生训练的模型已超过40个。

社区中已出现客户基于开源代码自行优化的算子性能超过原始版本的案例,这在以往由厂商单方面维护的生态中很难出现。开源让研发团队直面全球开发者的检验,进步的速度反而更快。

更深层次的变化发生在全球开发体系的打通上。

记者了解到,目前,昇腾已覆盖90多个主流第三方社区,并成为PyTorch(全球最主流的AI开发框架之一)官网可直接安装的首个中国算力平台。

汪涛还告诉记者,此前中国的AI算力平台要进入PyTorch生态,开发者需要先转到华为自己的社区下载安装,流程烦琐。

经过数月努力,这一障碍被消除,全球开发者如今可以直接在PyTorch官网获取昇腾的开发工具。

未来中国的开源大模型将逐步转向以昇腾做原生预训练,完成预训练之后走向推理和各个垂类的训练,基本上不需要再做额外的适配。

系统工程不仅仅是硬件,还有软件生态,涉及算子、框架以及复杂的工具体系。

鲲鹏全球开发者超过416万,openEuler装机量超2000万套,居中国服务器操作系统份额第一。

灵衢协议连同参考设计、测试规范全量开放并捐赠全球计算联盟,且版本持续刷新,让不具备复杂系统自研能力的企业同样可以进入超节点生态。

互联标准的统一,避免的是各自为战带来的重复投入与生态割裂。

在芯片路线图上,昇腾960芯片研发进度超出预期,此后昇腾芯片将坚持一年一代,基于灵衢互联,超节点集群最大可支持百万卡量级。华泰证券在今年4月的研报中测算,2028年中国超节点架构市场规模有望达到3414亿元

一块边界清晰、开源开放的算力底座,正在中国AI产业的底层成形。

底座的归底座、模型的归模型、应用的归应用,当分工走向成熟,模型公司不必担心底座供应商有一天变成竞争对手,应用开发者不必重复造轮子,算力像水电一样成为产业的公共供给。

这块硅基黑土地上,庄稼已经开始生长,而随着越来越多的产业力量汇入,更大的丰收还在前面。


郑晨烨

资深记者。关注新能源、半导体、智能汽车等新产业领域,有线索欢迎联系:zhengchenye@eeo.com.cn,微信:zcy096x。

成为付费用户可以阅读 华为 所有资料

了解更多 →