现代GPU已普遍采用多芯粒(chiplet)封装架构,但CUDA和HIP等主流编程模型仍暴露扁平的执行层次,无法有效表达芯粒级数据局部性,导致内存密集型负载——尤其是大语言模型推理——出现大量冗余访存。
AMD与中国高校研究者联合提出Fleet框架,通过引入“芯粒任务”(Chiplet-task)这一新抽象,将工作负载与数据绑定到特定芯粒,使同一芯粒上的计算单元共享L2缓存,从而实现协作式缓存复用。Fleet以持久化内核运行时方式实现,每个芯粒拥有独立调度器, worker 线程协同执行任务并协调缓存策略。
在AMD Instinct MI350上配合Qwen3-8B模型测试显示:小批量场景(batch 1-8)下decode延迟较vLLM降低30%至50%;当batch扩大至32和64时,通过协作式权重分块,L2缓存命中率分别从12%跃升至54%、从39%升至61%,HBM带宽占用减少37%,整体加速比达1.27至1.30倍。
这项工作填补了Wavefront级、CU级、设备级任务与芯粒级任务之间的空白,为未来多芯粒GPU的编程模型演进提供了新的设计思路。
编注:材料为arXiv预印本论文,测试环境为AMD MI350配合Qwen3-8B模型,未涉及NVIDIA平台或其它厂商GPU的兼容性验证。