unité de traitement neuronal
Anglais: neural processing unit
Un circuit matériel spécialisé conçu pour accélérer les applications d'apprentissage automatique.
Unité de traitement neuronal : silicium conçu pour les calculs d'IA
Une unité de traitement neuronal (NPU) est un cœur de processeur ou une puce autonome optimisée pour effectuer les multiplications matricielles et les opérations tensorielles requises par les modèles d'apprentissage automatique. Contrairement à un CPU ou un GPU à usage général, une NPU est câblée avec des chemins de données, des hiérarchies de mémoire et des jeux d'instructions spécifiquement adaptés aux charges de travail d'inférence et d'entraînement, échangeant la flexibilité contre un débit brut sur ces tâches étroites et répétitives.
Les NPU apparaissent sous deux formes principales en usine. Les NPU intégrées se trouvent aux côtés des cœurs de CPU et de GPU dans les conceptions de systèmes sur puce, que l'on trouve dans les appareils périphériques tels que les caméras industrielles, les contrôleurs robotiques et les systèmes de vision embarqués où la latence et la puissance sont plus importantes que les performances de pointe. Les cartes NPU discrètes s'insèrent dans les serveurs pour l'inférence en centre de données, offrant de 50 à 200 billions d'opérations par seconde (TOPS) selon l'architecture et la précision. La plupart des NPU industrielles fonctionnent sur des entiers à virgule fixe de 8 ou 16 bits plutôt que sur des flottants de 32 bits, ce qui réduit la bande passante mémoire et accélère le calcul sans perte significative de précision sur les modèles entraînés.
Où les NPU s'intègrent-elles dans le flux de travail
Une usine déployant la vision par ordinateur pour l'inspection qualité pourrait exécuter l'entraînement du modèle sur un GPU de centre de données, puis exporter le modèle optimisé vers une NPU périphérique dans une caméra de ligne ou un module de calcul périphérique. La NPU exécute l'inférence à 5 à 100 images par seconde tout en consommant quelques watts, alors qu'un GPU complet serait excessif et générerait de la chaleur dans un boîtier exigu. Les fournisseurs automobiles utilisent les NPU dans les systèmes autonomes ; les lignes d'emballage les utilisent pour la détection des défauts ; les usines de semi-conducteurs les utilisent pour l'inspection des tranches.
Des pièges courants apparaissent lorsque les travailleurs supposent qu'une NPU fonctionne comme un GPU avec une programmation plus simple. La quantification du modèle, la fusion des couches et l'optimisation de la disposition de la mémoire deviennent critiques ; un modèle qui fonctionne bien sur FP32 peut produire de mauvais résultats sur INT8 sans réentraînement. La limitation thermique est rare mais peut survenir dans les racks de serveurs denses. Le risque de la chaîne d'approvisionnement est réel : les principaux fabricants de NPU ont une capacité limitée, et la disponibilité des NPU périphériques est souvent en retard sur les puces de centre de données de six mois à un an.
Le terme « unité de traitement neuronal » a été officialisé vers 2017 alors que le marché séparait les accélérateurs d'IA spécialisés des GPU traditionnels. Les concurrents incluent les unités de traitement tensoriel (TPU, Google), les accélérateurs dédiés de Qualcomm, MediaTek et SambaNova, et les réseaux de portes programmables sur le terrain (FPGA) configurés pour l'inférence. La catégorie chevauche les termes « accélérateur d'IA » et « moteur d'inférence », mais NPU implique généralement un silicium à fonction fixe plutôt qu'un matériel reconfigurable.
Sources
- Source de la définitionWiktionary