华为发布新一代AI算力底座 国产算力转向系统级创新

  9月17日,华为全联接大会在上海启幕。会上 ,华为发布了新一代AI算力基础设施昇腾960超节点 。这款算力设施比较多 搭载的算力卡数量从上一代的1024卡升级到4096卡,并且首次采用一项名为“NPO(近封装光学) ”的关键技术,可用于匹配10万亿参数模型训练和推理的需求。

华为发布新一代AI算力底座 国产算力转向系统级创新-第1张图片

  如果说数据是AI的燃料 ,那么算力就是AI的引擎。近年来,算力集群从万卡向10万卡乃至更大规模迈进,卡与卡之间的通信代价越来越高 ,超节点成为超大规模AI基础设施建设的必然选取  。据介绍,华为超节点的核心思路,是通过灵衢高速互联协议将成百上千张算力卡融为一体 ,实现“像一台计算机一样协同工作”的效果。

  “我们聚焦在算力这个领域 ,将持续通过系统架构创新,满足国内AI训练和推理上的爆发式增长需求。”华为副董事长、轮值董事长汪涛说,昇腾960芯片研发超预期 ,昇腾960风冷超节点和液冷超节点分别将于明年第二季度和第三季度上市 。

  汪涛表示,华为AI战略的核心是算力,坚持硬件变现 ,围绕“超节点+集群 ”,通过系统架构创新构建竞争力,坚持构建开源开放的算力生态 ,支持主流大模型基于昇腾原生训练 、积极拥抱“百模千态”。截至近来 ,昇腾910C超节点累计部署超1000套,昇腾950超节点也已实现商用。

  NPO是昇腾960超节点的一项关键技术 。传统的大规模算力系统内部主要依赖铜缆进行电互联 ,近封装光学技术可在算力卡边缘几厘米的距离实现电转光,突破铜缆传输距离与带宽的物理极限,降低互联功耗与延迟 ,并解决高密度算力系统下的布线与散热难题 。

  据了解 ,华为研发了新一代NPO形态的光互联产品——Hi-ONE,这是业界首个量产的NPO产品,是近来 行业最大传输能力的NPO产品 ,容量高达7.2T,也是唯一实现内置光源的NPO产品。昇腾960超节点用5500个Hi-ONE模块,替代原本需要的4.8万颗800G光模块 ,功耗降低超550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%。这款产品把“高带宽、高可靠”与“低时延、低功耗 ”融为一体 ,与灵衢高速互联协议一起构建可规模扩展的超节点互联系统 。

  “人工智能带来的变革之深 、之广、之快,远超想象,没有任何一家公司能独自支撑整个智能世界。”汪涛表示 ,华为聚焦AI基础设施,坚持打造硅基黑土地,让算力触手可及;坚持软件开源开放 ,让开发者释放潜能;坚持拥抱百模千态 ,让价值多元释放;坚持合作共赢,让客户成功、伙伴成长。

  国研新经济研究院创始院长 、智能经济首席专家朱克力表示,算力的竞争 ,不只是芯片的竞争,更是系统架构、软件生态和产业统筹的综合较量 。昇腾960超节点的发布,标志着国产算力竞争从单纯比拼单芯片性能 ,转向芯片-互联-存储-整机一体化的系统级创新。它通过近封装光学互联技术,实现数千卡规模的高效协同,解决大规模AI集群通信时延高、成本高 、可靠性不足的痛点。

  “华为发布新一代AI算力基础设施 ,一方面为国内大模型训练提供可落地的国产化底座,带动光通信 、液冷等上下游配套产业升级;另一方面,通过开放互联规范 ,有利于减少国内算力生态碎片化,推动国产算力集群工程化落地 。”朱克力表示。

  全球计算联盟秘书处首席技术官苗福友表示,中国在人工智能基础设施方面最大的优势是全产业链能力 ,从芯片、部件到整机再到供电、散热等机电产品全面覆盖 ,并且每个领域的发展都非常快,这和中国制造业的优势和强大的工程能力是分不开的。从技术的角度看,连接技术是中国比较突出的优势领域 ,这对于超节点和算力集群的可扩展性和整体效率提升起着关键作用 。

(文章来源:经济借鉴 报)