Clicked Gallery

O que é um transformer em loop (looped transformer)?

Sublinhado num documento técnico real. Explicado pelo Clicked.

Usado numa frase

Engineering Notes · AI Systems

The new model is reported to be a looped transformer, running two passes through its layers instead of three.

O leitor sublinhou uma palavra na documentação. O Clicked explicou o termo técnico «looped transformer» em termos simples:

Explicado em três níveis

Os mesmos fatos, outra vibe — Modo slang 😎

O método Clicked

●○○

Overview

Um transformer em loop (looped transformer) é um modelo de IA que passa cada pergunta pelo mesmo bloco de camadas mais de uma vez, em vez de dar a cada etapa uma camada própria. Uma camada é uma etapa de cálculo: entram dados, os parâmetros da camada transformam esses dados e saem dados novos. Os parâmetros são números aprendidos no treinamento. Um modelo comum com 24 camadas passa os dados por cada camada uma vez. Um modelo em loop com 12 camadas passa os dados pelas 12 e depois manda a saída de volta pelas mesmas 12. Os parâmetros não mudam entre as passadas; os dados mudam, porque a segunda passada parte da saída da primeira. O mesmo loop roda no treinamento, onde os parâmetros estão sendo ajustados, e na inferência, onde os parâmetros estão fixos. Um modelo em loop consegue assim 24 etapas de processamento com os parâmetros de 12 camadas, que é a metade.
●○○

Overview

Um transformer em loop (looped transformer) é uma IA que passa uma pergunta pelas suas camadas duas ou três vezes em vez de ter mais camadas. Uma camada é uma rodada de mastigar números: entram dados, números aprendidos no treinamento mastigam tudo, saem dados. Os parâmetros são esses números, e eles são a parte que come memória. Digamos que o modelo tem 6 camadas. Uma pergunta atravessa as 6, depois a saída vai direto de volta para a primeira camada para uma segunda volta, e uma terceira. Os números ficam parados entre as voltas; os dados seguem em frente, porque a volta dois começa de onde a volta um chegou. O treinamento roda as mesmas voltas enquanto os números ainda estão sendo ajustados; a inferência roda depois que os números estão fixos. São 18 rodadas de mastigar, 6 vezes 3, com os parâmetros de 6 camadas. A pegadinha: três voltas levam o triplo do tempo. 😎

Uma ideia rápida — muitas vezes é tudo de que você precisa.

●●○

Detail

Um transformer em loop (looped transformer) é um modelo de IA que passa cada pergunta pelo mesmo bloco de camadas duas ou mais vezes, com cada passada recebendo como entrada a saída da anterior. Uma camada é uma etapa de cálculo: entram dados, os parâmetros da camada transformam esses dados e saem dados novos. Os parâmetros são números aprendidos no treinamento. Profundidade é quantas etapas dessas uma pergunta recebe, e o loop compra profundidade sem parâmetros novos. O mesmo loop roda no treinamento e na inferência. No treinamento os parâmetros são ajustados depois que cada resposta é conferida, então só sobrevivem os parâmetros que funcionam quando aplicados de novo à própria saída. Na inferência os parâmetros estão fixos, e só os dados mudam de uma passada para outra. O Google Research mediu o que isso rende (ICLR 2025). Somando oito números de três dígitos, um modelo de 1 camada acertou 0,1%, o mesmo modelo de 1 camada treinado para dar 12 voltas acertou 99,9%, e um modelo de 12 camadas acertou 100%. O custo é tempo, porque cada passada é uma volta completa pelo bloco: um modelo de 12 camadas com duas voltas leva mais ou menos o mesmo tempo que um de 24 camadas. A perda é espaço para fatos. No mesmo estudo, um modelo de 12 camadas com duas voltas venceu um de 24 camadas em problemas curtos de matemática escritos em palavras, 34,3 contra 29,3. O modelo em loop perdeu em perguntas de conhecimentos gerais, 9,3 contra 11,2, porque os fatos ficam guardados nos parâmetros e o modelo em loop tinha mais ou menos a metade. O Google fixou o número de voltas antes do treinamento. Outros modelos em loop são treinados com o número variado, de modo que o número de passadas pode ser escolhido na inferência. De todo modo o loop roda dentro do modelo, antes da primeira palavra da resposta, e é isso que separa o loop do chain-of-thought, em que o modelo escreve seus passos em palavras.
●●○

Detail

Um transformer em loop (looped transformer) é uma IA que empurra uma pergunta de novo pelas mesmas camadas em vez de por camadas novas. Uma camada é uma rodada de mastigar números: entram dados, os números aprendidos no treinamento mastigam tudo, saem dados. Os parâmetros são esses números, e eles são a parte que você paga em memória e armazenamento. Então pare de acrescentar camadas e reaproveite as 6 que você tem, três vezes seguidas. Os números ficam parados entre as voltas; os dados seguem em frente, então a volta dois continua de onde a volta um parou. Treinamento e inferência dão as mesmas três voltas. No treinamento os números são ajustados depois que cada resposta é corrigida; na inferência os números estão fixos. 18 rodadas de mastigar, 6 vezes 3, com os parâmetros de 6 camadas. A conta chega do mesmo jeito: três voltas são três porções de cálculo, mais ou menos o que um modelo de 18 camadas levaria. A troca: no estudo do Google, os modelos em loop foram melhores em contas e em responder a partir de um texto, e piores em perguntas de quiz, porque os fatos moram nos parâmetros e um modelo em loop tem menos deles. Alguns modelos em loop são treinados com o número de voltas misturado de propósito, então você pode escolher 2 voltas ou 3 na inferência. Chain-of-thought é um modelo escrevendo seus passos em palavras antes de responder. O loop são esses passos extras acontecendo por dentro, sem nada escrito, e o número de voltas está virando a pergunta que se faz sobre um modelo novo, e não só o número de parâmetros. 😎

Quer mais? Um clique aprofunda.

●●●

Analogy

Um transformer em loop (looped transformer) é um modelo de IA que passa uma pergunta pelo mesmo bloco de camadas mais de uma vez, de modo que a segunda passada trabalha sobre o que a primeira produziu. Revisar a própria redação funciona do mesmo jeito. Você lê a redação uma vez e conserta o que consegue ver. Depois lê de novo. Seus olhos e seu conhecimento não mudaram, mas a redação mudou, e os consertos da primeira leitura expõem erros que antes estavam escondidos. Essa segunda leitura é o loop: você é o bloco de camadas, e cada leitura é uma passada. A alternativa é entregar a redação a dois leitores diferentes, um depois do outro. Cada leitor traz um conhecimento que você não tem, então dois leitores são o modelo empilhado, com um conjunto novo de parâmetros a cada etapa. Dois leitores pegam mais erros de fatos, e dois leitores custam duas pessoas em vez de uma. Onde a imagem quebra: uma segunda leitura só custa o seu tempo, enquanto uma segunda passada por um modelo custa tanto cálculo quanto uma camada a mais.
●●●

Analogy

Um transformer em loop (looped transformer) é uma IA que passa seus dados pelas mesmas camadas de novo e de novo em vez de acrescentar mais camadas. Uma camada é uma rodada de mastigar números, e os números com que ela mastiga são os parâmetros, aprendidos no treinamento. Uma secadora é a mesma coisa. A roupa sai úmida. Ninguém compra uma segunda secadora e transfere a roupa de uma para a outra. Você fecha a porta e roda o mesmo tambor por mais 20 minutos. Mesma máquina, mesmas configurações; só a roupa é diferente. O tambor é o bloco de camadas, um ciclo é uma passada, e comprar uma secadora maior é empilhar mais camadas. Depois que a roupa secou, outro ciclo não faz nada e ainda gasta energia, e esse é o limite de quantas voltas valem a pena. Onde desmonta: a secadora não fica mais esperta no segundo ciclo, só ganha mais tempo, enquanto a segunda passada de um modelo em loop começa mais adiante que a primeira. E a secadora nunca teve fatos para esquecer. 😎

Conceito novo? Um exemplo do dia a dia faz clicar — novas analogias quando quiser.

Explicações de IA podem conter erros · Não é aconselhamento profissional

Definição formal — O mesmo termo, explicado da forma habitual

Um transformer em loop (looped transformer; também descrito como transformer com recorrência em profundidade ou com pesos compartilhados) é uma arquitetura transformer em que um bloco de uma ou mais camadas é aplicado repetidamente à própria saída, compartilhando os mesmos parâmetros em todas as iterações, de modo que a profundidade efetiva é a profundidade do bloco multiplicada pelo número de loops enquanto a contagem de parâmetros permanece fixa. A ideia descende dos Universal Transformers (Dehghani et al., 2018). O cômputo por passada equivale ao de um modelo sem loop com a mesma profundidade efetiva (a referência iso-FLOP), de modo que o loop troca parâmetros por computação sequencial em vez de reduzir o custo de inferência. Uma variante comum, o loop intermediário, mantém camadas separadas de prelúdio e coda e repete apenas o bloco do meio. Saunshi et al. (ICLR 2025) relatam que modelos em loop igualam referências iso-FLOP em tarefas de raciocínio com muito menos parâmetros, apresentam pior perplexidade e pior memória de fatos, e conseguem simular chain-of-thought com passos intermediários latentes em vez de escritos; o número de loops pode variar na inferência.

Quer que o Clicked explique termos como “looped transformer” direto no seu navegador, inclusive em PDFs?

Adicionar ao Chrome — Grátis

50 explicações grátis · Sem cartão de crédito