Hasty Briefsbeta

双语

TIRx Harness: An Open Compiler Harness for Agentic GPU Programming

6 hours ago
  • TIRx Harness 是一个编译器框架,它结合了最小、稳定的编译器基础、知识库、工具和基准服务器,以帮助AI智能体开发正确且快速的GPU内核。
  • 在评估的工作负载上,Kimi Delta Attention (KDA) 内核相比 FlashKDA(前向)取得了2.94倍的几何平均加速,相比 Flash Linear Attention (FLA)(后向)取得了6.84倍的几何平均加速。
  • 关键组件包括贴近硬件的 TIRx Foundation 以实现可预测的编译、同步和数据竞争分析工具、包含超过60个可复用实现的内核动物园 (kernel zoo),以及用于可控评估的远程基准服务器 (KCoral)。
  • 该框架使智能体能够从 PTX 文档中发现新的优化方向,通过内核动物园跨内核传输策略,并通过超出通过/失败的详细反馈诊断不安全的候选方案。
  • 对 KDA、MSA、MLA 和 VSA 家族的评估显示,家族级别的几何平均加速范围从1.33倍到6.84倍,内核与优化的参考实现相比具有竞争力。
  • 该系统具有自我改进循环,成功的内核和工具修复成为未来运行环境的一部分,未来的工作包括适应新架构、进一步贴近硬件,以及扩展针对大规模内核的正确性工具。