华为发布Peerium计算架构,百万级处理器成为一台计算机

来源:互联网 时间:2026-09-19

A5站长网9月19日消息,华为在上海全联接大会 2026 上发布面向 AI 时代的全新计算架构 Peerium。该架构基于嵌套并行、统一内存寻址与平等互联,目标是让百万级处理器作为一台计算机协同工作。华为轮值董事长徐直军表示,AI 时代华为将基于 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群。按官方介绍,这一架构突破了传统单机架构与主从模式,提出了名为 Nested BSP 的并行模型。

支撑这套架构的关键是互联技术。灵衢基于一个开放协议,可扩展地连接 CPU、NPU、内存、SSD、网卡与交换机,实现计算、存储与网络资源的平等互联。华为常务董事、ICT BG CEO 杨超斌介绍,灵衢把十余种互联协议统一为一种,互联带宽从百 GB 级提升至 TB 级,RTT 通信时延从 7 微秒压缩到 2 微秒,并支持超节点内全局内存统一编址。

产品侧,Atlas 950 超节点是 Peerium 计算架构的首代产品,包含 25.6 万张加速卡的集群已进入部署阶段,基于 NPO 的 Atlas 960 系统正在测试。华为同期发布基于灵衢互联的系列化一体机,覆盖从单卡工作站到万亿参数模型推理的不同档位。其中 Atlas 650 与 650E 通过双机灵衢直连,实现 16 卡 Full-Mesh 组网,官方称相比非灵衢方案推理吞吐提升 70% 以上、时延低至 10 毫秒,支持 1M 超长序列。

这套架构要解决的问题有具体数字。华为给出的判断是,在传统架构下集群规模扩大时资源利用率反而下降,十万卡集群的实际模型算力利用率仅约 20%,大量算力处于等待通信完成的状态。对应的做法是把 DDR 当作 NPU 的第二内存做分级存储与全局池化,降低万亿参数模型训练对单卡显存的容量需求;柜内互联刀片实现零电缆,官方称一个 4096 超节点可节省 196 公里铜缆。

生态与落地方面,华为在会上开源了 Agent 加速平台,集成推理加速库与智能体管理系统,支持客户端、即时通讯与推理接口等多种接入方式。截至目前,华为已联合 100 多家伙伴打造 10 大场景、200 余款产品,落地金融、能源、泛政府、教育、医疗等行业。对基础设施与运维团队来说,这类变化的落点在集群组网方式、互联协议与运维监控口径上;对多数站点而言,短期内更值得关注的是国产算力在开放互联协议上的标准化走向。

相关文章

标签:

A5创业网 版权所有