An Advanced System Architecture Breakdown of OpenAI's Jalapeno Accelerator
3 days ago
- OpenAI 推出了 Jalapeno 芯片,这是一款针对前沿模型工作负载优化的通用 AI 推理加速器,重点关注端到端延迟和能效,而非峰值浮点运算性能(FLOPs)。
- 该架构采用半扁平化有界两跳 Clos 拓扑,搭配 Broadcom Tomahawk 6 交换机,在张量并行和混合专家(MoE)并行之间取得平衡,并提供可预测的延迟。
- Jalapeno 采用空间架构,包含分块核心、专用 HBM4 内存(6 组堆叠,15.4 TB/s 带宽,216 GiB 容量),功耗为 700W,可实现高达 13 PFLOPS (fp4) 的性能。
- 该芯片基于台积电(TSMC)3nm 工艺制造,并集成推测解码与多 Token 预测技术,以克服内存带宽瓶颈。
- OpenAI 利用 AI 辅助的高层次综合方法(基于 Google XLS)以及智能体编码范式,加速芯片设计流程,但全流程智能体模式尚未成为主流。
- 一个包含 2,048 颗芯片的完整集群可提供 27 EFlops/s 算力、32 PB/s 内存带宽及 432 TiB 内存容量,占用 28 至 32 个机架。
- 关键设计权衡包括:内存带宽与容量的平衡、可编程性与效率的平衡,以及网络跳数与计算停顿等延迟来源的应对策略。