导语
在最新一期Dwarkesh Podcast中,MatX CEO Reiner Pope 为听众带来了一堂从零开始的“芯片设计黑板课”。他从最基础的逻辑门讲起,逐步构建出乘加运算单元、脉动阵列,并解释了时钟周期、流水线寄存器等关键概念。通过对比GPU、TPU和FPGA的架构设计,他揭示了芯片设计中“计算与通信权衡”这一核心主题,为理解现代AI芯片的工作原理提供了清晰的路径。
MatX CEO Reiner Pope 在访谈中从最底层的逻辑门开始,系统讲解了AI芯片的工作原理。他阐述了乘加运算作为核心原语的必然性、脉动阵列如何优化数据移动、时钟周期与流水线的权衡,以及GPU、TPU和FPGA在架构上的本质差异。
在最新一期Dwarkesh Podcast中,MatX CEO Reiner Pope 为听众带来了一堂从零开始的“芯片设计黑板课”。他从最基础的逻辑门讲起,逐步构建出乘加运算单元、脉动阵列,并解释了时钟周期、流水线寄存器等关键概念。通过对比GPU、TPU和FPGA的架构设计,他揭示了芯片设计中“计算与通信权衡”这一核心主题,为理解现代AI芯片的工作原理提供了清晰的路径。
展开「深读」看每一段讨论的问题与论据。
讨论的问题:为什么乘累加是AI芯片的自然计算原语?
论据 / 案例:矩阵乘法公式 output[i,k] += input[i,j] × other_input[j,k];四乘八位设计考虑了累加过程中的误差累积
讨论的问题:如何用逻辑门构建一个高效的乘累加电路?
论据 / 案例:24位输入通过16个全加器处理得到8位输出;电路规模为 p×q 个全加器
讨论的问题:数据移动在芯片设计中的隐性成本有多大?
论据 / 案例:8输入、p位宽的mux成本为24×p个AND门,而4×p位乘法器仅需4×p个门
讨论的问题:脉动阵列如何解决计算与通信的失衡问题?
论据 / 案例:权重矩阵本地存储,输入输出向量仅需 x 带宽;TPU使用128×128脉动阵列
讨论的问题:什么决定了芯片的时钟周期,如何优化?
论据 / 案例:流水线寄存器插入可将时钟频率提高一倍;TSMC 3nm工艺下逻辑门延迟约10皮秒
讨论的问题:为什么在高频交易等场景中选择FPGA而非ASIC?
论据 / 案例:首个FPGA成本约1万美元,而首个ASIC成本高达3000万美元;LUT实现4输入AND门需32个门,ASIC仅需3个
讨论的问题:为什么CPU缓存导致非确定性延迟,而TPU使用Scratchpad?
论据 / 案例:缓存比DDR快100倍但命中率取决于程序运行环境;TPU的Scratchpad提供确定性访问
讨论的问题:为什么CPU核心比GPU核心大得多?
论据 / 案例:CPU分支预测器和缓存占用大量面积;GPU核心移除了这些组件以容纳更多计算单元
讨论的问题:大脑和芯片在架构和能耗方面有何根本差异?
论据 / 案例:芯片动态能耗主要来自位翻转;大脑的低频操作节省能耗但无显著能效优势
讨论的问题:GPU和TPU在芯片组织上有什么根本区别?
论据 / 案例:GPU SM类似小型TPU;TPU矩阵单元更大但数据移动受限于周边布线