Clicked Gallery

¿Qué es un transformer en bucle (looped transformer)?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

The new model is reported to be a looped transformer, running two passes through its layers instead of three.

El lector subrayó una palabra en la documentación. Clicked explicó el término técnico «looped transformer» en términos simples:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Un transformer en bucle (looped transformer) es un modelo de IA que pasa cada pregunta por el mismo bloque de capas más de una vez, en vez de darle a cada paso su propia capa. Una capa es un paso de cálculo: entran datos, los parámetros de la capa los transforman y salen datos nuevos. Los parámetros son números aprendidos en el entrenamiento. Un modelo normal de 24 capas pasa los datos por cada capa una vez. Un modelo en bucle de 12 capas pasa los datos por las 12 y luego manda la salida otra vez por las mismas 12. Los parámetros no cambian entre pasadas; los datos sí, porque la segunda pasada parte de la salida de la primera. El mismo bucle corre en el entrenamiento, donde los parámetros se están ajustando, y en la inferencia, donde los parámetros están fijos. Un modelo en bucle consigue así 24 pasos de procesamiento con los parámetros de 12 capas, que es la mitad.
●○○

Overview

Un transformer en bucle (looped transformer) es una IA que pasa una pregunta por sus capas dos o tres veces en vez de tener más capas. Una capa es una ronda de machacar números: entran datos, unos números aprendidos en el entrenamiento los trituran, salen datos. Los parámetros son esos números, y son la parte que se come la memoria. Digamos que el modelo tiene 6 capas. Una pregunta recorre las 6, luego la salida se mete otra vez en la primera capa para una segunda vuelta, y una tercera. Los números se quedan quietos entre vuelta y vuelta; los datos avanzan, porque la vuelta dos arranca donde se quedó la vuelta uno. El entrenamiento da las mismas vueltas mientras los números todavía se están retocando; la inferencia las da una vez que los números están fijados. Son 18 rondas de triturar, 6 por 3, con los parámetros de 6 capas. La pega: tres vueltas tardan el triple. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Un transformer en bucle (looped transformer) es un modelo de IA que pasa cada pregunta por el mismo bloque de capas dos o más veces, y cada pasada toma como entrada la salida de la anterior. Una capa es un paso de cálculo: entran datos, los parámetros de la capa los transforman y salen datos nuevos. Los parámetros son números aprendidos en el entrenamiento. La profundidad es cuántos pasos de esos recibe una pregunta, y el bucle compra profundidad sin parámetros nuevos. El mismo bucle corre en el entrenamiento y en la inferencia. En el entrenamiento los parámetros se ajustan después de comprobar cada respuesta, así que solo sobreviven los parámetros que funcionan cuando se aplican otra vez a su propia salida. En la inferencia los parámetros están fijos y solo los datos cambian de pasada en pasada. Google Research midió lo que esto aporta (ICLR 2025). Sumando ocho números de tres cifras, un modelo de 1 capa acertó el 0,1 %, el mismo modelo de 1 capa entrenado para dar 12 vueltas acertó el 99,9 %, y un modelo de 12 capas acertó el 100 %. El coste es tiempo, porque cada pasada es un recorrido completo por el bloque: un modelo de 12 capas con dos vueltas tarda más o menos lo mismo que uno de 24 capas. Lo que se pierde es sitio para los datos de memoria. En el mismo estudio, un modelo de 12 capas con dos vueltas ganó a uno de 24 capas en problemas cortos de matemáticas escritos en palabras, 34,3 frente a 29,3. El modelo en bucle perdió en preguntas de cultura general, 9,3 frente a 11,2, porque los hechos se guardan en los parámetros y el modelo en bucle tenía más o menos la mitad. Google fijó el número de vueltas antes del entrenamiento. Otros modelos en bucle se entrenan con el número variado, de modo que el número de pasadas se puede elegir en la inferencia. En cualquier caso el bucle corre dentro del modelo, antes de la primera palabra de la respuesta, y eso es lo que separa el bucle del chain-of-thought, donde el modelo escribe sus pasos en palabras.
●●○

Detail

Un transformer en bucle (looped transformer) es una IA que empuja una pregunta por las mismas capas otra vez en lugar de por capas nuevas. Una capa es una ronda de machacar números: entran datos, los números aprendidos en el entrenamiento los trituran, salen datos. Los parámetros son esos números, y son lo que pagas en memoria y almacenamiento. Así que deja de añadir capas y reutiliza las 6 que tienes, tres veces seguidas. Los números se quedan quietos entre vueltas; los datos avanzan, así que la vuelta dos recoge donde la vuelta uno lo dejó. El entrenamiento y la inferencia dan las mismas tres vueltas. En el entrenamiento los números se retocan después de corregir cada respuesta; en la inferencia los números están fijados. 18 rondas de triturar, 6 por 3, con los parámetros de 6 capas. La factura llega igual: tres vueltas son tres tandas de cálculo, más o menos lo que tardaría un modelo de 18 capas. El trato: en el estudio de Google los modelos en bucle fueron mejores en sumas y en responder a partir de un texto, y peores en preguntas de trivial, porque los hechos viven en los parámetros y un modelo en bucle tiene menos. Algunos modelos en bucle se entrenan con el número de vueltas mezclado a propósito, así que puedes elegir 2 vueltas o 3 en la inferencia. El chain-of-thought es un modelo escribiendo sus pasos en palabras antes de responder. El bucle son esos pasos extra pasando por dentro, sin escribir nada, y el número de vueltas se está convirtiendo en lo que la gente pregunta de un modelo nuevo, no solo el número de parámetros. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Un transformer en bucle (looped transformer) es un modelo de IA que pasa una pregunta por el mismo bloque de capas más de una vez, de modo que la segunda pasada trabaja sobre lo que produjo la primera. Corregir tu propia redacción funciona igual. La lees una vez y arreglas lo que ves. Luego la lees otra vez. Tus ojos y tus conocimientos no han cambiado, pero el texto sí, y los arreglos de la primera lectura destapan errores que antes estaban escondidos. Esa segunda lectura es el bucle: tú eres el bloque de capas, y cada lectura es una pasada. La alternativa es darle el texto a dos lectores distintos, uno detrás de otro. Cada lector aporta conocimientos que tú no tienes, así que dos lectores son el modelo apilado, con un juego de parámetros nuevo en cada paso. Dos lectores cazan más errores de datos, y dos lectores cuestan dos personas en vez de una. Dónde se rompe la imagen: una segunda lectura solo te cuesta tiempo, mientras que una segunda pasada por un modelo cuesta tanto cálculo como una capa extra.
●●●

Analogy

Un transformer en bucle (looped transformer) es una IA que pasa sus datos por las mismas capas una y otra vez en lugar de añadir más capas. Una capa es una ronda de machacar números, y los números con los que tritura son los parámetros, aprendidos en el entrenamiento. Una secadora es lo mismo. La ropa sale húmeda. Nadie compra una segunda secadora y pasa la ropa de una a otra. Cierras la puerta y pones el mismo tambor otros 20 minutos. Misma máquina, mismo programa; solo la ropa es distinta. El tambor es el bloque de capas, un ciclo es una pasada, y comprar una secadora más grande es apilar más capas. Cuando la ropa ya está seca, otro ciclo no hace nada y sigue gastando luz, y ese es el límite de cuántas vueltas merecen la pena. Dónde se desmonta: una secadora no es más lista en el segundo ciclo, solo tiene más tiempo, mientras que la segunda pasada de un modelo en bucle arranca más adelante que la primera. Y una secadora nunca tuvo datos que olvidar. 😎

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Un transformer en bucle (looped transformer; también descrito como transformer de recurrencia en profundidad o de pesos compartidos) es una arquitectura transformer en la que un bloque de una o más capas se aplica repetidamente a su propia salida, compartiendo los mismos parámetros en todas las iteraciones, de modo que la profundidad efectiva es la profundidad del bloque multiplicada por el número de bucles mientras el número de parámetros se mantiene fijo. La idea desciende de los Universal Transformers (Dehghani et al., 2018). El cómputo por pasada coincide con el de un modelo sin bucle de la misma profundidad efectiva (la referencia iso-FLOP), por lo que el bucle intercambia parámetros por cómputo secuencial en lugar de reducir el coste de inferencia. Una variante común, el bucle intermedio, mantiene capas separadas de preludio y coda y solo repite el bloque central. Saunshi et al. (ICLR 2025) informan de que los modelos en bucle igualan a las referencias iso-FLOP en tareas de razonamiento con muchos menos parámetros, muestran peor perplejidad y peor memoria de hechos, y pueden simular el chain-of-thought con pasos intermedios latentes en lugar de escritos; el número de bucles puede variarse en la inferencia.

¿Quieres que Clicked te explique términos como «looped transformer» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito