A5站长网8月30日消息,NVIDIA最近放出一项叫NVHBM的定制高带宽内存技术。思路很直接:把原本放在计算芯片上的内存控制器,下移到HBM堆栈底层的基础晶片里。过去GPU要同时管计算、内存调度和数据搬运;现在内存自己管自己,计算芯片只负责计算。
按NVIDIA公布的数据,和JEDEC标准HBM4e相比,NVHBM单堆栈内存带宽最高提升约30%,HBM部分功耗降低约15%。更夸张的是接口面积:物理接口和配套电路面积最多缩小67%。这些省下来的面积还给主芯片,能让主芯片用于计算或其他功能的面积增加25%到30%。
为什么这件事重要?因为大模型推理时,限制往往不是算力,而是数据怎么搬。权重、KV缓存、激活值在内存层级之间来回倒腾,单纯堆算力已经不能让token吞吐量线性增长。NVHBM把控制器放到底层晶片,等于让内存自己完成一部分调度,减少主芯片的协调开销。
效果会叠加。接口更窄,中介层布线更简单,整个封装可用硅面积也更大。NVIDIA说单颗加速器端到端性能大约提升30%。如果是一座1吉瓦数据中心,使用2000瓦级加速器,节省下来的功耗和散热余量理论上能多塞进约1.5万颗加速器。
这项技术目前主要面向NVLink Fusion合作伙伴,亚马逊Annapurna Labs已经表示会在下一代Trainium芯片里采用相关方案。它不会立刻取代标准HBM,而是给自研加速器的云厂商多一个高性能选项。定制内存控制器,可能会成为AI芯片军备竞赛的下一个山头。
A5创业网 版权所有