随着人工智能大模型竞争进入新阶段,全球范围内的超大规模模型如十万亿参数模型逐渐成型。国内也在迅速追赶,数万亿参数的模型不断涌现。为了培养出顶尖的SOTA模型,算力集群需从万卡提升至十万卡。然而,算力利用率的提升却未能与硬件扩展同步,华为的数据显示,十万卡集群中,卡间通信可能消耗超过40%的训练时间,算力利用率往往不足30%。对于需要数月训练的大型模型来说,算力成本和训练时间受微小提升影响极大。
为了解决这一问题,越来越多的企业开始探索新的算力组织方式——超节点。超节点通过紧密的互联、统一内存空间和低通信延迟,将数千张卡组成一个逻辑整体,区别于传统的分散计算集群。华为发布的昇腾960超节点正是针对十万卡时代的工程化解决方案。
自去年以来,超节点在AI算力领域获得迅速关注,华为的超节点方案引发行业广泛讨论。近年来,随着大模型参数规模增长,超节点已成为AI基础设施建设的必然选择。然而,真正的超节点是什么?如果只是大量服务器的简单相连,那它与传统集群有何不同呢?今年7月,在世界人工智能大会期间,发布的《超节点定义与实践白皮书》为其进行了明确界定。超节点被定义为多个计算节点通过高效互联协议连接,并具备跨物理节点统一内存编址能力的计算系统,逻辑上表现为“一台计算机”。
在像MoE这样的主流模型中,计算单元数量的增加意味着结果需在多个单元间频繁交换。集群规模越大,通信带来的开销越明显。因此,仅靠单纯增加计算单元而不改变连接与协作方式,算力提升效果甚微。超节点通过重组计算资源的连接与协作,使得硬件和软件层面更加统一。目前,符合白皮书定义的产品已逐步投入规模化应用,昇腾910C超节点已部署超过1000套,覆盖互联网、金融、教育等行业。
随着超节点规模扩大,数据交换需求增加,带宽、延迟和可靠性要求也随之提升,互联工程的难度加大。目前,大规模AI集群内部多依赖铜缆互连,而在速率逐步上升的情况下,传统电互联方案不再满足需求。行业开始把焦点转向光互连。以往的数据中心光互连依赖可插拔光模块,其虽然具备标准化和可维护性,但也存在电信号传输路径过长的问题。
近封装光学(NPO)技术试图改善这一局面,将光引擎放置在计算单元边缘,电信号尽早转化为光信号,从而提高传输效率。超节点的发展与实施正是为应对日益增加的算力需求,并优化数据中心互联方式。
发表评论