<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Twisted Torus on zzudongxiang</title><link>https://www.zzudongxiang.com/tags/twisted-torus/</link><description>Recent content in Twisted Torus on zzudongxiang</description><generator>Hugo</generator><language>zh-cn</language><copyright>2026 zzudongxiang.com · 豫ICP备2022012018号-1 · 豫公网安备41160202000614号</copyright><lastBuildDate>Sat, 15 Jun 2024 00:00:00 +0000</lastBuildDate><atom:link href="https://www.zzudongxiang.com/tags/twisted-torus/index.xml" rel="self" type="application/rss+xml"/><item><title>文献阅读《TPU v4: An optically reconfigurable supercomputer for machine learning with hardware support ...》</title><link>https://www.zzudongxiang.com/posts/tpu-v4/</link><pubDate>Sat, 15 Jun 2024 00:00:00 +0000</pubDate><guid>https://www.zzudongxiang.com/posts/tpu-v4/</guid><description>&lt;div&gt;
&lt;h2 id="1-内容简介"&gt;1. 内容简介&lt;/h2&gt;
&lt;h3 id="11-摘要"&gt;1.1 摘要&lt;/h3&gt;
&lt;p&gt;为了应对机器学习（ML）模型的创新，生产工作负载发生了翻天覆地的变化。TPU v4 是谷歌第五个特定领域架构（DSA），也是第三台用于此类 ML 模型的超级计算机。&lt;strong&gt;光路交换机（OCS）可以动态地重新配置其互连拓扑结构，以提高规模、可用性、利用率、模块化、部署、安全性、功耗和性能；如果需要，用户可以选择扭曲的三维环形拓扑结构。与 Infiniband 相比，OCS 的成本更低、功耗更小、速度更快&lt;/strong&gt;，OCS 和底层光学元件占系统成本的比例小于 5%，占系统功耗的比例小于 3%。每个 TPU v4 都包含 SparseCores 数据流处理器，可将依赖嵌入的模型加速 5-7 倍，但仅占用 5% 的芯片面积和功耗。自 2020 年部署以来，TPU v4 的性能是 TPU v3 的 2.1 倍，性能/瓦特数提高了 2.7 倍。TPU v4 超级计算机的芯片数量为 4096 个，是 TPU v3 的 4 倍，因此整体速度提高了近 10 倍，再加上 OCS 的灵活性和可用性，大型语言模型的平均训练速度可达到峰值 FLOPS/second 的 60%。对于类似大小的系统，它比 Graphcore IPU Bow 快 4.3-4.5 倍，比 Nvidia A100 快 1.2-1.7 倍，功耗低 1.3-1.9 倍。谷歌云能源优化仓库规模计算机内的 TPU v4 与典型内部数据中心的当代 DSA 相比，能耗降低约 2-6 倍，二氧化碳排放量降低约 20 倍。&lt;/p&gt;</description></item></channel></rss>