Hasty Briefsbeta

双语

Compiling Triton kernels without the Triton compiler

2 days ago
  • 由于不断发展的编程模型、工作负载和加速器,编译器后端的构建和维护成本高昂。
  • 本文探讨了用大型语言模型(LLM)替代传统编译器降级的过程,称为AI降级。
  • 通过使用LLM智能体和评估框架将Triton内核直接翻译为NVIDIA PTX,演示了AI降级。
  • 在Ada、Hopper和Blackwell GPU上的12个常见内核以及近期ML论文中的10个内核上测试,AI降级实现了自动调优Triton性能的0.83倍到3.34倍。
  • 性能提升来源于Triton流水线中未涉及的变换,例如将打包的二进制权重解码为Tensor Core操作数(BitDelta上3.34倍)以及重用重叠卷积窗口(最高2.23倍)。
  • 该方法扩展了Volta PTX验证器以支持现代GPU,包括具有托管内存和异步执行的Blackwell Tensor Core接口。
  • 研究结果表明,未来AI编译器将取代自定义中间表示和检查器,减少工程工作量。