Español
Electrónica industrial

unidad de procesamiento neuronal

Inglés: neural processing unit

Un circuito de hardware especializado diseñado para acelerar las aplicaciones de aprendizaje automático.

Unidad de procesamiento neuronal: silicio diseñado para las matemáticas de la IA

Una unidad de procesamiento neuronal (NPU) es un núcleo de procesador o un chip independiente optimizado para realizar las multiplicaciones de matrices y las operaciones de tensores que requieren los modelos de aprendizaje automático. A diferencia de una CPU o GPU de propósito general, una NPU está cableada con rutas de datos, jerarquías de memoria y conjuntos de instrucciones ajustados específicamente para cargas de trabajo de inferencia y entrenamiento, sacrificando la flexibilidad por un rendimiento bruto en esas tareas estrechas y repetitivas.

Las NPU aparecen en dos formas principales en la planta de producción. Las NPU integradas se sitúan junto a los núcleos de CPU y GPU en diseños de sistema en chip, que se encuentran en dispositivos de borde como cámaras industriales, controladores de robótica y sistemas de visión embebidos donde la latencia y la potencia importan más que el rendimiento máximo. Las tarjetas NPU discretas se insertan en servidores para la inferencia en centros de datos, ofreciendo de 50 a 200 billones de operaciones por segundo (TOPS) dependiendo de la arquitectura y la precisión. La mayoría de las NPU industriales operan con enteros de punto fijo de 8 o 16 bits en lugar de flotantes de 32 bits, lo que reduce el ancho de banda de la memoria y acelera el cálculo sin una pérdida significativa de precisión en los modelos entrenados.

Dónde encajan las NPU en el flujo de trabajo

Una fábrica que implementa visión artificial para la inspección de calidad podría ejecutar el entrenamiento del modelo en una GPU de centro de datos, luego exportar el modelo optimizado a una NPU de borde en una cámara de línea o módulo de cómputo de borde. La NPU ejecuta la inferencia a 5 a 100 cuadros por segundo mientras consume unos pocos vatios, mientras que una GPU completa sería excesiva y generaría calor en un recinto cerrado. Los proveedores automotrices utilizan NPU en sistemas autónomos; las líneas de empaque las utilizan para la detección de defectos; las fábricas de semiconductores las utilizan para la inspección de obleas.

Surgen problemas comunes cuando los trabajadores asumen que una NPU funciona como una GPU con una programación más sencilla. La cuantificación del modelo, la fusión de capas y la optimización del diseño de la memoria se vuelven críticas; un modelo que funciona bien en FP32 puede producir malos resultados en INT8 sin reentrenamiento. La limitación térmica es rara, pero puede ocurrir en racks de servidores densos. El riesgo de la cadena de suministro es real: los principales fabricantes de NPU tienen una capacidad limitada, y la disponibilidad de NPU de borde a menudo se retrasa con respecto a los chips de centro de datos entre seis meses y un año.

El término "unidad de procesamiento neuronal" se formalizó alrededor de 2017 a medida que el mercado separaba los aceleradores de IA especializados de las GPU tradicionales. Los competidores incluyen las Unidades de Procesamiento de Tensores (TPU, Google), aceleradores dedicados de Qualcomm, MediaTek y SambaNova, y matrices de puertas programables en campo (FPGA) configuradas para inferencia. La categoría se superpone con "acelerador de IA" y "motor de inferencia", pero NPU generalmente implica un silicio de función fija en lugar de hardware reconfigurable.

Fuentes

Entrada IG669004/07/2014

Más de Electrónica industrial

Ver todo

Reciba la palabra del día

Un término industrial cada día, con el oficio al que pertenece y por qué vale la pena conocerlo. Sin publicidad.