Hasty Briefsbeta

双语

Characterizing Warp Divergence from Pascal to Blackwell

4 days ago
  • 自Volta的独立线程调度以来,NVIDIA GPU以固定方式处理warp分歧的假设已在Ampere、Hopper和Blackwell GPU上进行了测试,并以Pascal作为基线。
  • 在所有测试的世代中,分歧路径随路径数量线性序列化(T(k) ≈ sk),没有超线性重收敛惩罚。
  • Warp执行效率按32/k下降,惩罚与占用率无关,预测消除了序列化开销。
  • 相同的性能成本模型早于ITS,因为它出现在Pascal上。
  • 编译器生成的重收敛机制发生了变化:Pascal使用每warp的SSY/SYNC指令栈,而后续世代使用屏障寄存器指令。
  • 延迟重收敛超出直接后支配点的情况从Ampere上的29例下降至Blackwell上的2例。
  • Blackwell引入了两级收敛屏障分类、统一分支指令以及显式部分掩码warp同步,这些在Ampere或Hopper中不存在。
  • 受控的比特翻转实验表明,新的屏障分类是静态编译器分类,没有可观察到的运行时效果。
  • 总体而言,尽管控制流ISA和重收敛机制不断演变,分歧仍保持稳定且可预测的性能成本。

相关文章

加载中…