Clicked Gallery

¿Qué es una unidad de procesamiento tensorial (TPU)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

The paper credited the speedup to running the model on tensor processing units rather than general-purpose hardware.

El lector subrayó una palabra en la documentación. Clicked explicó el término técnico «tensor processing units» en lenguaje sencillo:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Una unidad de procesamiento tensorial, o TPU, es un chip diseñado por Google para hacer un solo tipo de aritmética: multiplicar rejillas de números. Ese es el trabajo en el que las redes neuronales pasan casi todo su tiempo. Un tensor no es más que una rejilla así, de modo que el chip lleva el nombre de aquello que multiplica. Los chips ocupan los peldaños de una escalera, y cada peldaño cede flexibilidad a cambio de más velocidad en una sola tarea. Una CPU conserva unos pocos núcleos lo bastante listos para cualquier cosa; una GPU conserva miles de núcleos simples para trabajo en paralelo; una TPU graba la única operación en su propio cableado.
●○○

Overview

Una unidad de procesamiento tensorial, TPU, es lo que pasó cuando Google miró su factura de IA y dejó de pagar por la versatilidad. En un chip normal, el cálculo de verdad ocupa quizá 1 parte de cada 10 del silicio; el resto es maquinaria para estar listo ante lo que se le eche encima. La carga de trabajo para la que se construyó la TPU pide un solo favor: multiplica la rejilla, otra vez, para siempre. Así que la TPU se queda con el motor de rejillas, tira casi todo lo demás y hace su único truco a volumen mayorista. ¿Versátil? En absoluto. ¿Barata en el único trabajo que importa? Esa es toda la idea. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Una unidad de procesamiento tensorial es un chip que hace un solo tipo de aritmética, la multiplicación de rejillas sobre la que se construyen las redes neuronales, y casi nada más. Google lo diseñó así. Toda capacidad que un chip conserva cuesta espacio y energía aunque esté sin usar: circuitos para decidir qué se ejecuta después, para manejar cualquier clase de programa. Quítalos y el espacio liberado alberga más unidades de multiplicación. La primera TPU, en los centros de datos de Google desde 2015, muestra lo que eso compra. Una unidad de multiplicación hace un trabajo diminuto: multiplica un par de números. Aquel chip llevaba 65.536 funcionando a la vez y barría una rejilla entera de una pasada, donde un procesador corriente avanza de unos pocos números en unos pocos números. El diseño tiene un precio. Una TPU no se puede apuntar lejos de su única operación, así que se gana el sueldo allí donde esa operación corre a un volumen enorme. Google, que ejecuta redes neuronales todo el día, es uno de esos sitios, y por eso una empresa de búsqueda diseña chips. La mayor parte del resto del trabajo de IA sigue corriendo en chips más flexibles, en parte porque las TPU se alquilan sobre todo a través de la nube de Google, y en parte porque la flexibilidad es más segura mientras los modelos siguen cambiando. Las primeras generaciones solo podían ejecutar modelos ya terminados, recibir preguntas y producir respuestas; las posteriores también hacen el entrenamiento. Lo que nunca ha cambiado es el intercambio: las capacidades que quedaron fuera del cableado no se pueden volver a añadir.
●●○

Detail

Una unidad de procesamiento tensorial es lo que queda de un chip cuando borras todo salvo el trabajo. El silicio es superficie de suelo. En la TPU número uno, la parte que decide qué pasa después ocupaba 2 de cada 100 unidades de ese suelo, y el cálculo más los datos que lo alimentan ocupaban casi dos tercios. Un procesador general está más cerca de lo contrario: casi todo su suelo se va en flexibilidad, en planificar, predecir y mover cosas, y al cálculo honesto le toca un rincón. Ninguna de las dos plantas está mal. Ambas son apuestas honestas sobre futuros distintos. El chip general apuesta a que tu próxima tarea es desconocida, así que se aferra a cada herramienta. La TPU apuesta a que tu próxima tarea es igual que el último millón, así que atornilla una herramienta al suelo y despeja el resto. Sin cajones, sin repuestos, sin por si acaso. Cuando la apuesta sale, obtienes más cálculo por vatio del que el chip flexible podría darte. Cuando el trabajo se va a otra parte, la TPU se queda ahí sosteniendo su única herramienta, esperando a que el trabajo viejo vuelva. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Una unidad de procesamiento tensorial es una imprenta, donde un procesador corriente es una mano que escribe. La mano produce cualquier página que le pidas, al ritmo de una mano. La imprenta produce exactamente una página, la que está montada en sus tipos, y montar esos tipos es lento y caro. Pero una vez montados, las copias salen de la máquina por millares, más rápido que cualquier cantidad de manos. Cambia la página y hay que volver a montar la imprenta; pídele un poema a media tirada y no puede complacerte. Las imprentas nunca sustituyeron a las plumas. Se quedaron con la única situación que compensa el montaje: la misma página, pedida en cantidades enormes. Eso es la TPU: una página, montada en silicio, impresa todo el día.
●●●

Analogy

Una unidad de procesamiento tensorial es la gofrera en una cocina llena de sartenes. Una sartén cocina cualquier cosa, huevos, filete, tortitas, lo que pida la mañana, porque la sartén no da nada por supuesto. La gofrera da un supuesto enorme: que solo le van a pedir gofres. La receta está fundida en el propio metal, así que saca gofres perfectos más rápido de lo que la sartén podría, y es una herramienta cómicamente mala para todo lo demás. Cómprala solo si de verdad comes tantos gofres. Eso es la TPU: un plato, integrado en la máquina, para una cocina que lo sirve todo el día. 😎

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Una unidad de procesamiento tensorial (TPU) es un circuito integrado de aplicación específica, un ASIC, desarrollado por Google para acelerar cargas de trabajo de redes neuronales, cuya fabricación corre a cargo de socios industriales. Su núcleo es una matriz sistólica: una gran rejilla de unidades de multiplicación y acumulación por la que los datos fluyen paso a paso, de modo que la multiplicación de matrices avanza sin volver a memoria entre operaciones. La primera generación, desplegada en los centros de datos de Google en 2015 y descrita públicamente en 2017, usaba una matriz de 256 por 256 con aritmética de 8 bits y servía solo inferencia; las generaciones posteriores añadieron soporte de entrenamiento y formatos de mayor precisión. Las TPU se ofrecen a clientes externos principalmente a través de los servicios en la nube de Google.

¿Quieres que Clicked te explique términos como «tensor processing units» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito