18 hours ago
- 本演讲解释了芯片如何从基本逻辑门工作到AI加速器,重点关注乘加(MAC)单元作为矩阵乘法的基础原语。
- Dadda乘法器使用与门和全加器高效执行乘法,全加器的数量等于位宽的乘积。
- 数据移动成本主导芯片设计——用于选择寄存器文件输入的多路复用器可能需要MAC本身门数的24倍,这促使使用脉动阵列以最大化每次通信的计算量。
- 脉动阵列将权重矩阵存储在本地,并临时存储向量输入,通过跨周期重用数据来减少带宽需求。
- 时钟周期通过流水线寄存器同步芯片逻辑,但循环(例如累加和)会限制速度,因为反馈循环在不改变计算的情况下无法进行流水线化。
- FPGA使用查找表(LUT)和多路复用器来模拟任意门,但由于可配置性带来的开销,其效率比ASIC低10倍。
- 芯片中的确定性延迟通常依赖于暂存器(显式内存访问)而非缓存(硬件管理),后者会引入非确定性。
- 由于分支预测器和大型缓存,CPU核心比GPU核心更大;GPU去除这些以增加并行计算单元。
- 大脑更慢且使用非结构化稀疏性,而芯片以高时钟频率运行以追求吞吐量;能耗随门开关(动态功耗)而缩放。
- GPU可以被视为许多小型TPU(流多处理器中的张量核心)的集合,每个都有本地内存,而TPU拥有更少但更大的脉动阵列和一个中央向量单元。