Hugging Face 推出约束感知 GPU 分配器:同一集群利用率提升 33 个百分点,改变的只是分配顺序
Hugging Face 构建了一个约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比。在相同硬件与相同负载下,GPU 利用率最多提升 33 个百分点(如 8 GPU 训练型负载从 53.6% 升至 87.0%),优先级加权产出在每个场景均上升,最高达 105%,平均 52%。核心改法是把实时推理需求按曲线逐时间步分配、批类任务按优先级跨整个调度周期放置,而非按到达顺序分配。