徐直军:华为昇腾中国份额已超英伟达

在2026年9月17日举行的华为全连接大会期间,华为轮值董事长徐直军与海思首席科学家廖恒博士与多家媒体机构的记者进行了问答环节,讨论了华为面向人工智能时代的Peerium计算架构以及UnifiedBus(UB,灵衢总线)。
在去年的华为全连接大会上,徐直军发表了主题演讲,发布了昇腾芯片及其路线图(包括950、960、970,以及SuperPoD和SuperCluster)。他还宣布了UnifiedBus协议的开放发布。
在今年的华为全连接大会上,华为发布了昇腾950和Atlas 950 SuperPoD。当业界都在谈论SuperPoD或超级节点时,实现这些产品的方式却有着巨大差异。SuperPoD的关键在于让数千甚至数万个处理器像一台计算机一样工作。
Atlas 950 SuperPoD由华为首创的新计算架构驱动。这一架构如今可以让一百万个处理器像一台计算机一样工作。该架构被称为Peerium,它通过嵌套并行、统一内存寻址和对等互连,实现了百万处理器级别的强扩展。它通过引入嵌套BSP(嵌套批量同步并行)扩展了图灵的并行范式。
该架构还扩展了冯·诺依曼单机架构,超越了数十年来盛行的主从设计范式。鉴于业界现有技术无法支持这一架构,华为发明了一项关键互连技术——UnifiedBus。最终,一百万个处理器能够真正像一台更大的计算机一样工作。
UnifiedBus是一种高速总线,采用开放协议,可无限扩展,用于连接CPU、NPU、内存、SSD、接口卡和交换机。借助UnifiedBus,实现了跨计算、存储和网络的对等互连。这从根本上超越了传统的主从架构。
Atlas 950 SuperPoD是基于Peerium计算架构构建的产品。目前,一个拥有25.6万张计算卡的SuperCluster正在部署和测试中。
以下为采访实录:
问:廖博士,您的论文提到了一款由25.6万张卡组成的SuperPoD。这是你们技术的上限吗?能否进一步谈谈市场对你们产品的需求?
廖恒:25.6万,或者说大约20万,这个数字不是随意选择的。
首先,这些大型集群的目的是用于训练。它拥有能够支持基础模型训练的硬件基础设施,而如今的基础模型已经达到5万亿参数的规模。
未来两年,中国大约会有6到7家前沿AI实验室,它们都将致力于训练规模在10万亿到40万亿参数之间的基础语言模型。这些数字大致与内存容量和SuperPoD的规模相匹配。所以,你需要如此规模的 infrastructure 来训练这些模型。
第二,在中国,大多数数据中心在电网方面都有国家规划。因此,考虑到单个自治区域和单个数据中心园区的电力输送系统设计,20万是一个相对保守的数字。
正如我所说,大家肯定对全球正在发生的AI模型竞赛非常熟悉。在中国,至少有三到四家一线玩家已经得到广泛认可,并达到了一线地位。
问:你们有什么计划鼓励中国的模型提供商使用昇腾芯片进行训练?
徐直军:对于昇腾950,我们首先向市场推出了950PR。它主要用于AI推理,目前市场上可供应的总量不是很大。基于昇腾950DT的SuperPoD主要用于AI训练。目前它们正在测试中,大规模供应将在今年年底或明年年初开始。我们正在与AI模型提供商进行广泛的对话和讨论。使用昇腾950DT进行训练的测试结果相当不错。我相信从明年开始,大量AI模型训练将基于使用昇腾950DT的SuperPoD。我认为归根结底,不在于我们要多努力去推动模型提供商,而在于我们有多少供应能力。我们只能根据生产多少来供应。我们希望价值链能更快地扩大产能,增加供应。
问:华为对美国领先AI模型提供商近期呼吁放缓AI开发有何看法?
徐直军:我们需要看中国和美国AI发展的水平和节奏。中国的AI模型主要是开源模型,其进展相对透明。如果我们看美国的主流模型提供商,他们拥有更多算力,所以也许只有他们自己知道其模型的复杂程度处于什么水平。中国市场对AI风险的感觉可能比美国弱。中国的模型提供商需要加快步伐,达到他们也能感受到AI发展风险的水平。然后,也许他们会与美国领先的模型提供商有同样的感受。但我始终相信,我们需要在推动AI发展和管控AI风险之间取得平衡。至少,底线是我们需要确保AI向善,而不是AI作恶。
问:华为是否有计划将Atlas 950 SuperPoD推向中国以外的其他市场?如果有,你们的目标市场是哪些?能否分享你们在中国市场份额的数据?你对中国推动芯片自给自足有何看法?
徐直军:由于我们甚至没有足够的产能满足中国国内的需求,我们没有计划全面拓展国际市场。但确实有几个国家有非常强劲的需求。我们正在进行一些测试,并向这些国家提供一些供应,但数量相当有限。
目前,很难收集英伟达在中国市场份额的数据。但根据我们收集的数据,昇腾已经超越了英伟达。
中国推动芯片自给自足是必然的前进道路。中国是一个拥有14亿人口的国家,是一个工业强国,人们的工作和生活方式与芯片紧密相连。中国人有强烈的紧迫感,不会接受由别人决定我们能否获得某些产品的未来。即使我们的芯片可能不那么先进,至少供应是有保障的,这样你就不必日复一日地担心芯片供应。我认为这肯定是前进的道路。对于中国政府、对于国内产业、对于华为来说,前进的道路无疑是推动芯片和整个半导体价值链的全面自给自足。我们也相信这迟早会成为现实。
问:你们的UnifiedBus互连技术源自你们在计算和通信领域的长期优势。UnifiedBus有多少来自你们的网络部门?
徐直军:UnifiedBus不仅仅源自我们业务的网络部分。我们整合了不同的互连协议,开发出一个统一的协议。网络更多地与IP协议相关,其延迟要高得多。当我们看计算互连时,它与传统网络不同,它更多地与总线相关,总线应该提供低延迟和高速度。当我们决定做这个产品本身时,我们的想法是把它放在计算部门,而不是传统的网络部门。我们认为,如果我们想提供高速、低延迟和统一协议的UnifiedBus,这是更好的选择。
廖恒:如果你把UnifiedBus看作一群人的智慧结晶,它是由计算机架构师构思的,但是由网络团队养大的。
问:UnifiedBus同时适用于横向扩展和纵向扩展,而英伟达分别用NVLink和InfiniBand应对这两种场景。那么华为将协议统一为一个UnifiedBus同时支持纵向和横向扩展,是出于什么考虑?与类似解决方案相比,UnifiedBus有哪些优势?
徐直军:这不是英伟达是否开发统一技术的问题。这是他们是否有能力开发这种技术的问题。他们最新的NVL72解决方案在机架内通信带宽高达1.8 TB/s。但一旦使用InfiniBand进行机架间通信,带宽就降至0.2 TB/s。如此低的机架间通信带宽,根本无法让一百万个处理器像一台计算机一样工作。我认为每个人都希望拥有超高速互连,用于机架内、机架间、数据中心间,甚至自治区域间的通信,因为这样我们才能将大量处理器变成一台计算机。这就是UnifiedBus的价值所在。我们可以使用一个统一的协议,在所有层级实现高速互连。从技术上讲,UnifiedBus的功能就像计算机的总线,它不仅仅支持链路。基于UnifiedBus,我们可以实现高达800 GB/s的机架间通信带宽。
去年我们将UnifiedBus协议开放后,下载量最多的地方是硅谷。最初,英伟达可能不想做NVL72解决方案;他们可能瞄准的是NVL256解决方案。但最终他们做出了NVL72解决方案,而不是NVL256解决方案。然而,华为开发了搭载384个910C处理器的SuperPoD解决方案,我们已经出货了1000多套。这很大程度上是因为我们有UnifiedBus用于这个解决方案。英伟达使用NVLink进行机架内通信,他们的机架间通信速度不够高,这使得他们很难按自己的意愿扩展。
廖恒:你问题的一部分是关于为什么单一协议是必要的,因为显然英伟达和大多数其他厂商至少使用了两个协议,在某些情况下可能更多。想象一下,如果你的旅程涉及飞机、高铁和汽车,中转相当耗时。超级节点内部需要大量的流量交换。如果你从NVLink转换到InfiniBand,至少需要微秒级的时间从一个协议转换到另一个协议。有了这两个独立的协议,很难满足延迟要求。
有了UnifiedBus,我们使用单一协议。这意味着如果你将一个数据包从纵向扩展网络移动到横向扩展网络,可能只需要150纳秒。协议转换开销至少节省了一个数量级。
问:在采用UnifiedBus的Atlas 950 SuperPoD中,有多少纵向扩展是通过电信号实现的,有多少是通过光信号实现的?你认为光学最终会占据整个机架吗?最大的障碍是什么?
徐直军:华为今天上午发布的Hi-ONE模块是一个NPO模块,支持7.2T带宽,距离主芯片仅5厘米。我们使用铜线连接这两者,其余全部是光学。所以我们可以说这个SuperPoD几乎是一个全光SuperPoD。光源也集成在Hi-ONE模块中。我想说,在未来两到三年内,没有其他厂商能够生产类似的模块。华为能够开发和量产这个模块,是因为我们在光子学方面有多年的经验。
廖恒:在我职业生涯的早期,几乎可以追溯到20年前,我们就已经在谈论让芯片走向光学。因为我们都知道光学传输距离短、衰减很小,所以信号可以高速传输更长的距离。
但如果你看Hi-ONE内部的电路,组件并不多。但量产过去对我们来说非常困难。因为光学涉及很多物理问题。如果温度变化几度,就会影响二极管的物理特性、折射率和波导特性,导致无法工作。
我认为最大的采用障碍是对可靠性的担忧,因为东西会坏。大多数其他提供商几乎主要选择将激光器放在外部。想想如果你必须用单个光源馈送32路信号,光源的功率必须乘以32倍。这是很大的功率,会在耦合接口和其他所有地方导致问题。我们选择将光源集成到模块中。这纯粹是工程上的务实选择。Hi-ONE是经过一个又一个妥协后的绝佳方案,很快就会进入量产状态。
问:你提到昇腾芯片在中国大陆的产能和供应有限。那么阻碍中国大陆产能提升的最大障碍是什么?到什么时候华为能够确保大规模稳定供应?
徐直军:中国大陆的瓶颈基本上与世界各地的瓶颈相同。全球产业没有为我们所看到的AI激增做好准备。当我们看光模块和存储产品的供应商时,他们以非常高的溢价销售,不一定是因为他们产品非常好,而是因为供应相比市场需求非常短缺。只有当中国大陆和全世界的供需达到平衡时,这个瓶颈才能完全解决。在我看来,全球范围内的供需平衡将在2029年左右实现。在中国大陆,可能还会更慢。当我们看这种供需平衡时,我们必须考虑到AI领域不断发展的技术,如NPO(近封装光学)和CPO(共封装光学)。
如果我们回顾华为的历史,无论是在通信业务还是IT业务,我们目前向市场供应的量已经可以称为“规模化供应”。但如果我们将供应量与AI基础设施的需求相比,我认为还非常少。如果我们要满足客户想要的供应量,这种平衡最终将依赖于整个中国行业的供需平衡。
问:有报道称马来西亚正在考虑将华为昇腾910C加速器作为其主权AI计划的核心。你如何平衡国内和国外客户的需求?
徐直军:对于任何客户来说,他们部署华为解决方案的决定是基于地缘政治和多供应商策略的考虑。所有公司都必须着眼长远,努力确保供应安全。在这种背景下,昇腾当然是很多客户的选择之一,尽管可能与一些竞争对手存在一些差距。满足国内客户和国际客户需求之间的平衡其实很简单:我们优先考虑对算力有迫切需求的中国客户;在中国以外,我们只向非常有限的客户供应,这些客户要么无法获得替代解决方案,要么想要一个替代解决方案。
问:当华为决定选择NPO而非CPO时,华为内部最重大的反对意见是什么?
徐直军:华为内部似乎没有就此进行辩论。华为从事光器件、光模块和昇腾芯片,所以我们知道哪个是我们的最佳选择。因此华为内部的共识很早就达成了。我们就选择了NPO,而不是CPO。除此之外,我们认为从工程实施、成本、可维护性和良率等多个角度来看,NPO将在很长一段时间内是最佳选择。
行业参与者随着时间的推移对NPO和CPO有了更清晰的认识。这在光互联论坛(OIF)最近的两次讨论中得到了完美体现。在第一次OIF讨论中,一些成员不支持NPO——他们决心做CPO。但在最近的OIF讨论中,只有非常有限的参与者仍然反对NPO,并且启动了一个新的NPO项目。NPO仍然有大约5厘米的铜互连,比CPO大约5毫米的铜互连要长。然而,与CPO相比,NPO将成本降低了近40%。NPO还有另一个好处:如果光引擎出问题,整个AI芯片不会随光引擎一起报废。当然,CPO和NPO不是谁取代谁的问题;而是在工程实施、成本、供应链和可维护性等因素之间的平衡选择。这里没有对错之分。
华为完全致力于NPO。我们正在推动标准化努力,也帮助发展整个产业生态,以便NPO有一条技术路径可以蓬勃发展。我们不是说CPO不好。OIF的40家厂商在看到NPO能带来的好处后,现在都支持NPO。
问:关于使用950DT进行训练,你们从模型提供商那里收到了哪些关于需要改进的领域和问题的反馈?你们做了哪些改变来让昇腾上的预训练更好?
廖恒:昇腾遇到的第一个障碍实际上不是硬件本身。主要是生态障碍,因为两年前昇腾仍然存在巨大的软件障碍,而CUDA显然具有主导优势,因为整个学术界是与CUDA一起成长起来的。所以所有算法开发者都习惯了PyTorch加CUDA的便利。
过去18个月发生了巨大变化。首先,模型数学的复杂程度发生了巨大变化,编程复杂度也相应增加。其次,模型变得非常细粒度,意味着你不能再只靠PyTorch写程序并保持效率。所以,即使对算法开发者来说,他们也必须转向这种大内核风格的编程,需要采用新的编程语言。这已经是前沿实验室的开发方式。
现在,随着新的编译器语言出现,这些新编译器正在取代并逐渐平衡CUDA的障碍,因为CUDA不再被前沿实验室视为重要,远不如两年前那么重要。这就是软件障碍的消解。我认为我们正在达到同等水平,甚至更接近 平衡。差距大大缩小了。
其次,芯片本身,我们有我们自己的优势,如我所说,UnifiedBus和嵌套BSP模型。这不仅仅是编程单个芯片,还涉及以便捷的方式编程大量芯片。我们正在提供这些。在芯片内部,我们吸取了教训,做了很多改进。
总的来说,我们正在缩小英伟达和昇腾之间的差距。我认为如今,主要差异已经小得多。当人们使用这些处理器进行开发时,不再感到那么陌生了。
问:下周,中国领导人将会见美国总统,AI将是他们讨论的一部分。作为中国企业家,你对那次会晤有什么样的合作期待?
徐直军:所有中国企业可能都有一个共同的愿望,那就是在市场竞争中和平共处,不受政府干预。我们以前生活在全球化和充分竞争的时代,企业依靠创新和产品赢得客户。但随着地缘政治影响日益加剧,全球化正在离我们远去。企业希望进入全球市场,通过创新和产品赢得客户,而不是被困在无法买卖自己想要的东西的境地。
过去30多年,华为依靠创新在市场上赢得了一席之地。我们依靠持续、大量的研发投入来提高产品竞争力,从而赢得客户的信任。2007年至2025年间,我们的累计研发投入超过1.8万亿元人民币。我们还承诺将其中10%的研发支出用于基础研究。正是因为我们大量的研发投入和对创新的强烈关注,才转化为更具竞争力的产品。我们在竞争激烈的市场中以创新驱动的方式,解释了华为如何成为今天的华为。
关注通信行业的记者朋友们可能知道华为过去几十年走过的历程。AI也是一样。我们只是走一条我们擅长、能够引领我们建立面向未来竞争力的道路。
问:考虑到中国大陆无法获得先进制程节点,UnifiedBus是中国大陆的独特路径吗?还是整个行业迟早都需要它?英伟达可能会朝你们的方向发展吗?
徐直军:UnifiedBus是一条创新之路,也是AI计算的未来之路。
因为只有借助UnifiedBus互连技术,你才有可能构建一台拥有百万处理器的巨型计算机。当一百万个处理器像一台计算机一样工作时,这为更好、更高效的AI训练和推理奠定了基础。因此,我将UnifiedBus视为未来AI时代的路径。我相信,在未来几年,其他参与者肯定会跟进。
这也是我们将UnifiedBus协议开放的原因。因为我们相信整个行业将朝着同一方向前进,我们期待全行业共同努力,迈向通用人工智能(AGI)。这也是廖博士发表论文介绍我们Peerium计算架构的原因,因为Peerium是AI时代的架构。对于960,它的规格与我去年介绍的基本相同,唯一的变化是市场供应的步伐更快了。HBM是960的一部分。没有HBM的改进,就不会有整个960的改进。
UnifiedBus互连技术是我们实施Peerium计算架构的基础。UnifiedBus互连技术和Peerium计算架构都是通往未来AI时代的路径。
我已经说过很多次,当我们看单个芯片时,华为面临的问题不是设计本身,而是中国大陆可用先进制程节点的限制。但如果我们互连大量芯片构建一台计算机,我认为我们在这方面已经取得了全球领先地位。这是建立在我们架构和互连技术创新基础上的。这些领域的努力始于美国限制之前,而不是之后。正是在2018年华为全连接大会上,我发布了华为的首款AI芯片以及我们的AI战略。2019年,我们发布了SuperPoD和集群。从那时起,我们就一直认为,为了支持AI训练和推理,行业需要新的架构和新的互连技术。也是从那时起,我们开始加大研发和创新投入。这为我们发布新的计算架构和UnifiedBus互连技术奠定了基础。
我相信整个行业都面临同样的问题。一旦你处于多计算卡或多加速器环境中,模型浮点运算利用率(MFU)就是一个非常关键的指标。当你进行大型AI模型训练时,一旦一张计算卡出现故障或性能下降,就会给整个AI训练带来重大损失。
基于UnifiedBus互连技术和Peerium计算架构,我们开发了SuperPoD和基于SuperPoD的SuperCluster。这些解决方案可以大幅提高MFU,这是已经得到验证的事实。这也是顶级模型提供商在使用昇腾950训练AI模型时最看重的。我们还可以提供原厂服务。这可以帮助进一步提高MFU,降低AI训练成本,并使AI训练迭代更快。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




