TPU
Abkürzung für Tensor Processing Unit, ein Schaltkreis, der für neuronale Netze und Machine Learning optimiert ist.
TPU: Googles Custom-Silizium für KI-Workloads
Eine Tensor Processing Unit ist ein anwendungsspezifischer integrierter Schaltkreis (ASIC), den Google entwickelt hat, um die mathematischen Operationen zu beschleunigen, die neuronale Netze und Machine-Learning-Inferenz antreiben. Im Gegensatz zu universellen Prozessoren enthält eine TPU spezialisierte Hardware für Matrizenmultiplikation und Akkumulation, die Kernoperationen von Tensorberechnungen. Die erste Generation TPU, um 2016 in Googles Rechenzentren eingesetzt, lieferte je nach Präzision ungefähr 15 bis 30 Teraflops Leistung, eine erhebliche Beschleunigung gegenüber herkömmlichen CPUs und GPUs bei bestimmten Workloads.
TPUs sind in Googles Cloud-Infrastruktur integriert und werden über Google Cloud als Service verkauft; sie werden nicht als eigenständige Chips an andere Hersteller verkauft. Es sind verschiedene Generationen entstanden: die TPU v2 und v3 erhöhten die Speicherbandbreite und Floating-Point-Leistung, während spätere Versionen wie TPU v4 und v5e höheren Durchsatz und niedrigere Kosten pro Inferenz einführten. Jede Überarbeitung zielt auf spezifische Engpässe beim Training großer Modelle oder beim Bereitstellen von Vorhersagen in großem Maßstab ab. Die Chips arbeiten mit niedrigeren Taktraten als CPUs, typischerweise 700 MHz bis 1 GHz, erreichen aber durch massive Parallelität hohen Durchsatz.
Eine TPU glänzt bei Operationen, die in ihren eingeschränkten Befehlssatz passen: dichte Matrizenoperationen, Faltungen und Aufmerksamkeitsmechanismen, die in Transformern und Faltungsnetzen üblich sind. Ihre Speicherhierarchie mit On-Chip-SRAM und Verbindungen mit niedrigerer Latenz zum externen Speicher reduziert die Datenverschiebungsstrafe, die die GPU-Leistung bei bestimmten Problemen beeinträchtigt. Allerdings sind TPUs relativ unflexibel; Code muss in ihren Befehlssatz kompiliert werden, und Workloads, die von dichten Tensoroperationen abweichen, zeigen möglicherweise keinen Vorteil oder sogar eine Verschlechterung im Vergleich zu einer universellen GPU.
TPUs auf dem Markt
TPUs konkurrieren mit NVIDIA-GPUs und anderen KI-Beschleunigern in Cloud-Machine-Learning-Plattformen. Die GPU-Nutzung ist breiter, weil GPUs eine größere Bandbreite von Algorithmen und Frameworks auf verschiedenster Hardware unterstützen, während TPU an Google Cloud gebunden und primär für TensorFlow optimiert ist. TPUs haben einen erheblichen Anteil an Googles eigenen Inferenz-Workloads erobert, einschließlich Suchranking, Übersetzung und Empfehlungssystemen, wo die Wirtschaftlichkeit von Custom-Silizium die Entwicklungskosten rechtfertigt.
Für industrielle Anwender hängt die Wahl zwischen TPU und GPU von den Workload-Eigenschaften und der Toleranz für Infrastructure Lock-in ab. TPUs bieten niedrigere Kosten pro Inferenz bei entsprechenden Workloads, die kontinuierlich in Google Cloud ausgeführt werden; GPUs bieten Portabilität und ein reicheres Ökosystem. Der Begriff TPU ist in der Industriediskussion über KI-Beschleuniger zum Gattungsbegriff geworden, bezieht sich aber spezifisch auf Googles Produktlinie; Konkurrenten wie AWS (Trainium, Inferentia) und andere haben ihr eigenes Custom-Silizium mit ähnlichen Designzielen entwickelt.