SpracheEnglishDeutsch
Industrieelektronik

Neural Processing Unit

Englisch: neural processing unit

Spezialisierter Hardwareschaltkreis zur Beschleunigung von Anwendungen des maschinellen Lernens.

Neural Processing Unit: Silizium für KI-Berechnungen

Eine Neural Processing Unit (NPU) ist ein Prozessorkern oder eigenständiger Chip, der für die Matrizenmultiplikationen und Tensoroperationen optimiert ist, die Machine-Learning-Modelle erfordern. Anders als eine universelle CPU oder GPU ist eine NPU mit Datenpfaden, Speicherhierarchien und Befehlssätzen fest verdrahtet, die speziell auf Inference- und Training-Workloads abgestimmt sind. Sie tauschen Flexibilität gegen maximalen Durchsatz bei diesen engen, repetitiven Aufgaben ein.

NPUs erscheinen in zwei Hauptformen in der Fertigung. Integrierte NPUs sitzen neben CPU- und GPU-Kernen in System-on-Chip-Designs, die in Edge-Geräten wie Industriekameras, Robotik-Controllern und eingebetteten Bildverarbeitungssystemen zu finden sind, wo Latenz und Stromverbrauch wichtiger sind als Spitzenleistung. Diskrete NPU-Karten stecken in Servern für Datacenter-Inference und bieten je nach Architektur und Genauigkeit 50 bis 200 Billionen Operationen pro Sekunde (TOPS). Die meisten industriellen NPUs arbeiten mit 8-Bit- oder 16-Bit-Festkomma-Ganzzahlen anstelle von 32-Bit-Gleitkommazahlen, was die Speicherbandbreite reduziert und die Berechnung beschleunigt, ohne signifikante Genauigkeitsverluste bei trainierten Modellen zu verursachen.

Wo NPUs in den Workflow passen

Eine Fabrik, die Computer Vision zur Qualitätskontrolle einsetzt, könnte das Modelltraining auf einer Datacenter-GPU durchführen und das optimierte Modell dann auf eine Edge-NPU in einer Zeilenkamera oder einem Edge-Compute-Modul exportieren. Die NPU führt Inference mit 5 bis 100 Bildern pro Sekunde aus und verbraucht dabei nur wenige Watt, während eine vollständige GPU überdimensioniert wäre und Wärme in einem engen Gehäuse erzeugen würde. Automobilzulieferer setzen NPUs in autonomen Systemen ein; Verpackungslinien nutzen sie zur Fehlererkennung; Halbleiterfabriken verwenden sie zur Wafer-Inspektion.

Häufige Probleme entstehen, wenn Mitarbeiter davon ausgehen, dass eine NPU wie eine GPU mit einfacherer Programmierung funktioniert. Modellquantisierung, Layer Fusion und Speicherlayout-Optimierung werden kritisch; ein Modell, das auf FP32 einwandfrei läuft, kann auf INT8 ohne Neutraining schlechte Ergebnisse liefern. Thermisches Drosseln ist selten, kann aber in dichten Server-Racks auftreten. Das Versorgungskettenrisiko ist real: Große NPU-Hersteller haben begrenzte Kapazität, und die Verfügbarkeit von Edge-NPUs hinkt oft um sechs Monate bis ein Jahr hinter Datacenter-Chips hinterher.

Der Begriff "Neural Processing Unit" wurde um 2017 formalisiert, als sich der Markt spezialisierte KI-Beschleuniger von traditionellen GPUs trennte. Konkurrenten sind Tensor Processing Units (TPUs, Google), spezialisierte Beschleuniger von Qualcomm, MediaTek und SambaNova sowie Field-Programmable Gate Arrays (FPGAs), die für Inference konfiguriert sind. Die Kategorie überschneidet sich mit "KI-Beschleuniger" und "Inference-Engine", aber NPU bezeichnet typischerweise ein festgelegtes Silizium anstelle von rekonfigurierbarer Hardware.

Mehr aus Industrial electronics

Alle ansehen

Get the Word of the Day

One industrial term every day, with the trade it belongs to and why it is worth knowing. No advertising.