文献阅读《TPU v4: An optically reconfigurable supercomputer for machine learning with hardware support ...》
1. 内容简介 1.1 摘要 为了应对机器学习(ML)模型的创新,生产工作负载发生了翻天覆地的变化。TPU v4 是谷歌第五个特定领域架构(DSA),也是第三台用于此类 ML 模型的超级计算机。光路交换机(OCS)可以动态地重新配置其互连拓扑结构,以提高规模、可用性、利用率、模块化、部署、安全性、功耗和性能;如果需要,用户可以选择扭曲的三维环形拓扑结构。与 Infiniband 相比,OCS 的成本更低、功耗更小、速度更快,OCS 和底层光学元件占系统成本的比例小于 5%,占系统功耗的比例小于 3%。每个 TPU v4 都包含 SparseCores 数据流处理器,可将依赖嵌入的模型加速 5-7 倍,但仅占用 5% 的芯片面积和功耗。自 2020 年部署以来,TPU v4 的性能是 TPU v3 的 2.1 倍,性能/瓦特数提高了 2.7 倍。TPU v4 超级计算机的芯片数量为 4096 个,是 TPU v3 的 4 倍,因此整体速度提高了近 10 倍,再加上 OCS 的灵活性和可用性,大型语言模型的平均训练速度可达到峰值 FLOPS/second 的 60%。对于类似大小的系统,它比 Graphcore IPU Bow 快 4.3-4.5 倍,比 Nvidia A100 快 1.2-1.7 倍,功耗低 1.3-1.9 倍。谷歌云能源优化仓库规模计算机内的 TPU v4 与典型内部数据中心的当代 DSA 相比,能耗降低约 2-6 倍,二氧化碳排放量降低约 20 倍。 ...