AMD MI455X架构曝光:VGPR翻倍、统一缓存、彻底抛弃图形功能

AMD MI455X架构曝光:VGPR翻倍、统一缓存、彻底抛弃图形功能

_

AMD即将在Advancing AI活动上发布MI400系列数据中心加速器,而芯片技术博客ChipsAndCheese通过逆向分析LLVM编译器代码,揭示了其中一款核心芯片GFX1250(商用名MI455X)的架构细节。

寄存器与缓存:大幅扩展

GFX1250最显著的改进在于寄存器架构:每个wave现在最多可寻址1024个矢量通用寄存器(VGPR),相比前代CDNA的512个(256 VGPR + 256累加VGPR)翻了一倍。这一改变将显著提升机器学习工作负载的并行计算能力,因为机器学习场景对寄存器压力远高于传统图形渲染。

同时,AMD终于统一了本地共享内存(LDS)和矢量L0缓存——此前NVIDIA和Intel早已采用这种设计,而AMD一直是分离架构。新设计将两者合并为448KB的WGP Cache,可根据编译器或程序员需求动态分配,这在一定程度上简化了软件层面的优化工作。本地内存最大可寻址空间也从此前的160kB提升至320kB。

计算模式:告别Wave64

GFX1250仅支持Wave32一种执行模式,而此前的CDNA GPU只支持Wave64,RDNA架构则两者兼可。这意味着部分从旧架构迁移过来的内核需要重新评估性能表现。此外,GFX1250每SIMD可同时运行20个wave,比RDNA4多出4个。

在机器学习矩阵计算方面,GFX1250放弃了CDNA系列的MFMA指令,转而采用与RDNA4相同的WMMA架构。不过奇怪的是,RDNA4大力宣传的动态VGPR分配功能在GFX1250上被标记为no-op——考虑到机器学习 workloads 的高寄存器压力,这个缺席令人意外。

纯计算定位

GFX1250进一步剥离了图形相关功能:不支持光栅化、纹理采样、光线追踪加速、像素着色器参数插值等指令,也移除了MTBUF和MUBUF等缓冲区指令。这使其成为比历代CDNA更“纯粹”的计算加速器,芯片面积可更专注于向量/矩阵运算单元。

编注:材料为技术博客基于LLVM代码逆向分析,覆盖GFX1250架构特性与CDNA/RDNA对比,未涉及MI400系列发布日期或定价信息。


国产算力厂商WAIC集体秀肌肉 超节点竞争转向系统集成能力 2026-07-19
Token工厂已是红海,厂商如何找到生存空间 2026-07-20