TIRx: An Open Compiler Stack for Evolving Frontier ML Kernels6 days agohttps://tvm.apache.org/2026/06/22/tirxTIRx 是一个基于 Apache TVM 的开源、硬件原生 DSL 和编译器,用于 ML 内核,面向 GPU 和专用 AI 加速器。它提供了一个低级边界,将编排、同步和后端内建函数保留在源代码中,供专家控制。重复出现的图块原语暴露给编译器,以便在内核和后端之间实现可重用性。新的硬件支持首先作为内建函数引入,然后随着模式稳定而提升为图块原语。更多...
Fleet: Hierarchical Task-Based Abstraction for Megakernels on Multi-Die GPUs17 days agohttps://arxiv.org/abs/2604.15379Fleet是一种面向多芯片GPU的多级任务模型,引入了Chiplet任务以将工作和数据绑定到单个芯片单元,从而提升数据局部性和同步效率。它解决了平面化GPU编程模型(如CUDA/HIP)与芯片化设计之间的不匹配问题,减少了冗余内存流量并提升了缓存利用率。在搭载Qwen3-8B的AMD Instinct MI350平台上,Fleet在小批量解码时延迟降低1.3-1.5倍,并通过协作权重分片和更高的L2缓存命中率,在大批量处理时实现最高1.30倍的加速效果。
Show HN: Phobos – A tiny scale-free kernel language with tile-DAG supporta month agohttps://www.joa-ebert.com/posts/2026-07-07-phobos-lang/作者开发了Phobos,这是一种受Triton启发的微型内核语言,可编译为PTX并在NVIDIA GPU上运行。Phobos在RTX 2080 SUPER上实现了约76%的cuBLAS SGEMM性能,并采用了平铺和Tensor Core使用等优化。该语言抽象了线程级细节,专注于面向AI计算的平铺级操作,从而能够自然地扩展到分布式集群。该项目涉及学习底层GPU编程、使用MLIR和LLVM与Rust,并实现内核参数的自动调优。更多...
Matrix Multiplication on Blackwella month agohttps://www.modular.com/blog/matrix-multiplication-on-nvidias-blackwell-part-1-i...矩阵乘法是大型语言模型的核心运算,像Llama 8B这样的模型中超过83%的运行时间都花在各种矩阵乘法的变体上。GPU提供大规模并行性(例如B200最多可处理151,552个线程)和专用张量核心,通过MMA运算实现高效的矩阵乘法。Blackwell GPU引入了第五代张量核心,支持256x256x16 MMA运算,利用张量内存减少寄存器使用,并增强了流水线处理能力。GPU编程采用SIMT模型,线程并行计算元素,组织为warp、块(CTA)和集群以实现内存共享。更多...