Español
Electrónica industrial

TPU

Siglas de Tensor Processing Unit, un circuito optimizado para el aprendizaje automático de redes neuronales.

TPU: el silicio personalizado de Google para cargas de trabajo de IA

Una Unidad de Procesamiento Tensorial (TPU) es un circuito integrado de aplicación específica (ASIC) diseñado por Google para acelerar las operaciones matemáticas que impulsan las redes neuronales y la inferencia de aprendizaje automático. A diferencia de los procesadores de propósito general, una TPU contiene hardware especializado para la multiplicación y acumulación de matrices, las operaciones centrales de los cálculos tensoriales. La primera generación de TPU, implementada en los centros de datos de Google alrededor de 2016, ofreció aproximadamente de 15 a 30 teraflops de rendimiento, dependiendo de la precisión, una aceleración significativa sobre las CPU y GPU convencionales para ciertas cargas de trabajo.

Las TPU están integradas en la infraestructura de la nube de Google y se venden a través de Google Cloud como un servicio; no se venden como chips independientes a otros fabricantes. Han surgido diferentes generaciones: la TPU v2 y v3 aumentaron el ancho de banda de la memoria y el rendimiento de punto flotante, mientras que versiones posteriores como la TPU v4 y v5e introdujeron un mayor rendimiento y un costo reducido por inferencia. Cada revisión aborda cuellos de botella específicos, ya sea en el entrenamiento de modelos grandes o en la entrega de predicciones a escala. Los chips operan a velocidades de reloj más bajas que las CPU, típicamente de 700 MHz a 1 GHz, pero logran un alto rendimiento a través de un paralelismo masivo.

Una TPU sobresale en operaciones que se ajustan a su conjunto de instrucciones limitado: operaciones de matriz densa, convoluciones y mecanismos de atención comunes en transformadores y redes convolucionales. Su jerarquía de memoria, con SRAM en el chip e interconexiones de menor latencia a la memoria externa, reduce la penalización por movimiento de datos que dificulta el rendimiento de la GPU en ciertos problemas. Sin embargo, las TPU son relativamente inflexibles; el código debe compilarse para su conjunto de instrucciones, y las cargas de trabajo que se desvían de las operaciones tensoriales densas pueden no ver ninguna ventaja o incluso una degradación en comparación con una GPU de propósito general.

Posición de las TPU en el mercado

Las TPU compiten con las GPU de NVIDIA y otros aceleradores de IA en plataformas de aprendizaje automático en la nube. La adopción de GPU sigue siendo más amplia porque las GPU admiten una gama más amplia de algoritmos y marcos que se ejecutan en hardware diverso, mientras que la TPU está ligada a Google Cloud y optimizada principalmente para TensorFlow. Las TPU han capturado una participación significativa en las propias cargas de trabajo de inferencia de Google, incluida la clasificación de búsqueda, la traducción y los sistemas de recomendación, donde la economía del silicio personalizado justifica el costo de desarrollo.

Para los usuarios industriales, la elección entre TPU y GPU depende de las características de la carga de trabajo y la tolerancia al bloqueo de infraestructura. Las TPU ofrecen un menor costo por inferencia en cargas de trabajo apropiadas que se ejecutan continuamente en Google Cloud; las GPU ofrecen portabilidad y un ecosistema más rico. El término TPU se ha vuelto genérico en la discusión industrial de los aceleradores de IA, aunque se refiere específicamente a la línea de Google; competidores como AWS (Trainium, Inferentia) y otros han desarrollado su propio silicio personalizado con objetivos de diseño similares.

Fuentes

Entrada IG766703/08/2015

Más de Electrónica industrial

Ver todo

Reciba la palabra del día

Un término industrial cada día, con el oficio al que pertenece y por qué vale la pena conocerlo. Sin publicidad.