Hasty Briefsbeta

双语

Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

3 hours ago
  • AMD MI355X 在 Kimi K3 上实现了约 952 tok/s/node,由于成本更低且 HBM 容量更高,在性价比上优于 B200。
  • Kimi K3 是一个 2.8T 参数的开源模型,无法在单个 B200 节点上容纳,需要两个节点或每个 GPU 配备 288GB VRAM 的 B300 节点。
  • AMD MI355X 提供了与 B300 相当的规格,每个 GPU 成本降低约 2.4 倍,使其成为高性价比的替代方案,尽管存在软件挑战。
  • ROCm 上的软件问题通过简单的修复得到解决(例如,为推测解码添加 top-k 重新归一化函数,为 MLA 预填充添加填充头数),不需要自定义内核。
  • 推测解码将单流吞吐量提高了约 2.2 倍,峰值聚合吞吐量提高了 18%,而预填充优化将首 token 时间缩短了 2-3 倍。
  • MI355X 的大容量 HBM 使其在像 Kimi K3 这样需要超过 1.5TB VRAM 用于权重和缓存的模型上比 B200 具有实际优势。

相关文章

加载中…