Clicked Gallery

Was ist ein Looped Transformer?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

The new model is reported to be a looped transformer, running two passes through its layers instead of three.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „looped transformer“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

Ein Looped Transformer ist ein KI-Modell, das jede Frage mehr als einmal durch denselben Block von Schichten schickt, statt jedem Schritt eine eigene Schicht zu geben. Eine Schicht ist ein Rechenschritt: Daten gehen hinein, die Parameter der Schicht verwandeln sie, und neue Daten kommen heraus. Die Parameter sind Zahlen, die im Training gelernt wurden. Ein gewöhnliches Modell mit 24 Schichten lässt die Daten einmal durch jede Schicht laufen. Ein Looped-Modell mit 12 Schichten lässt die Daten durch alle 12 laufen und schickt die Ausgabe dann noch einmal durch dieselben 12. Die Parameter ändern sich zwischen den Durchläufen nicht; die Daten schon, denn der zweite Durchlauf beginnt mit der Ausgabe des ersten. Dieselbe Schleife läuft im Training, wo die Parameter gerade angepasst werden, und in der Inferenz, wo die Parameter fest sind. Ein Looped-Modell bekommt so 24 Verarbeitungsschritte aus den Parametern von 12 Schichten, also der Hälfte.
●○○

Overview

Ein Looped Transformer ist KI, die eine Frage zwei- oder dreimal durch ihre Schichten jagt, statt mehr davon zu haben. Eine Schicht ist eine Runde Zahlenschieben: Daten rein, im Training gelernte Zahlen walzen sie durch, Daten raus. Die Parameter sind diese Zahlen, und sie sind der Teil, der Speicher frisst. Sagen wir, das Modell hat 6 Schichten. Eine Frage läuft durch alle 6, dann geht die Ausgabe direkt wieder in die erste Schicht für eine zweite Runde, und eine dritte. Die Zahlen bleiben zwischen den Runden, wo sie sind; die Daten ziehen weiter, denn Runde zwei beginnt da, wo Runde eins hingekommen ist. Das Training dreht dieselben Runden, solange die Zahlen noch nachjustiert werden; die Inferenz dreht sie, sobald die Zahlen feststehen. Das macht 18 Runden Zahlenschieben, 6 mal 3, aus den Parametern von 6 Schichten. Der Haken: drei Runden dauern dreimal so lang. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Ein Looped Transformer ist ein KI-Modell, das jede Frage zwei- oder mehrmals durch denselben Block von Schichten schickt, wobei jeder Durchlauf die Ausgabe des vorigen als Eingabe nimmt. Eine Schicht ist ein Rechenschritt: Daten gehen hinein, die Parameter der Schicht verwandeln sie, und neue Daten kommen heraus. Die Parameter sind Zahlen, die im Training gelernt wurden. Tiefe ist die Zahl solcher Schritte, die eine Frage bekommt, und die Schleife kauft Tiefe ohne neue Parameter. Dieselbe Schleife läuft im Training und in der Inferenz. Im Training werden die Parameter nach jeder geprüften Antwort angepasst, also überleben nur Parameter, die funktionieren, wenn man sie noch einmal auf ihre eigene Ausgabe anwendet. In der Inferenz sind die Parameter fest, und nur die Daten ändern sich von Durchlauf zu Durchlauf. Google Research hat gemessen, was das bringt (ICLR 2025). Beim Addieren von acht dreistelligen Zahlen lag ein Modell mit 1 Schicht zu 0,1 % richtig, dasselbe Modell mit 1 Schicht, trainiert auf 12 Durchläufe, zu 99,9 %, und ein Modell mit 12 Schichten zu 100 %. Der Preis ist Zeit, denn jeder Durchlauf ist ein voller Lauf durch den Block: ein Modell mit 12 Schichten und zwei Durchläufen braucht etwa so lang wie ein Modell mit 24 Schichten. Der Verlust ist Platz für Fakten. In derselben Studie schlug ein Modell mit 12 Schichten und zwei Durchläufen ein Modell mit 24 Schichten bei kurzen, in Worten gestellten Mathe-Aufgaben, 34,3 gegen 29,3. Bei Wissensfragen verlor das Looped-Modell, 9,3 gegen 11,2, denn Fakten stecken in den Parametern, und das Looped-Modell hatte etwa halb so viele. Google hat die Zahl der Durchläufe vor dem Training festgelegt. Andere Looped-Modelle werden mit wechselnder Zahl trainiert, sodass die Zahl der Durchläufe in der Inferenz gewählt werden kann. So oder so läuft die Schleife im Modell, vor dem ersten Wort der Antwort, und das ist es, was die Schleife von Chain-of-Thought unterscheidet, wo das Modell seine Schritte in Worten ausschreibt.
●●○

Detail

Ein Looped Transformer ist KI, die eine Frage noch einmal durch dieselben Schichten schiebt, statt durch neue. Eine Schicht ist eine Runde Zahlenschieben: Daten rein, die im Training gelernten Zahlen walzen sie durch, Daten raus. Die Parameter sind diese Zahlen, und sie sind das, wofür du an Speicher bezahlst. Also hör auf, Schichten anzubauen, und nutze die 6, die du hast, dreimal hintereinander. Die Zahlen bleiben zwischen den Runden, wo sie sind; die Daten ziehen weiter, also macht Runde zwei da weiter, wo Runde eins aufgehört hat. Training und Inferenz drehen dieselben drei Runden. Im Training werden die Zahlen nach jeder korrigierten Antwort nachjustiert; in der Inferenz stehen die Zahlen fest. 18 Runden Zahlenschieben, 6 mal 3, für die Parameter von 6 Schichten. Die Rechnung kommt trotzdem: drei Runden sind drei Portionen Rechenleistung, ungefähr das, was ein Modell mit 18 Schichten brauchen würde. Der Deal: in der Google-Studie waren die Looped-Modelle besser bei Rechenaufgaben und beim Antworten aus einem Text, und schlechter bei Quizwissen, denn Fakten wohnen in den Parametern, und ein Looped-Modell hat weniger davon. Manche Looped-Modelle werden absichtlich mit wechselnder Rundenzahl trainiert, dann kannst du in der Inferenz 2 Runden oder 3 wählen. Chain-of-Thought ist ein Modell, das seine Schritte in Worten ausschreibt, bevor es antwortet. Looping sind die zusätzlichen Schritte im Inneren, ohne dass etwas ausgeschrieben wird, und die Rundenzahl wird gerade zu dem, was man über ein neues Modell fragt, nicht nur die Zahl der Parameter. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Ein Looped Transformer ist ein KI-Modell, das eine Frage mehr als einmal durch denselben Block von Schichten schickt, sodass der zweite Durchlauf an dem arbeitet, was der erste hervorgebracht hat. Den eigenen Aufsatz Korrektur lesen funktioniert genauso. Du liest den Aufsatz einmal und bringst in Ordnung, was du siehst. Dann liest du ihn noch einmal. Deine Augen und dein Wissen haben sich nicht geändert, aber der Aufsatz schon, und die Korrekturen aus dem ersten Lesen legen Fehler frei, die vorher verdeckt waren. Dieses zweite Lesen ist die Schleife: du bist der Block von Schichten, und jedes Lesen ist ein Durchlauf. Die Alternative ist, den Aufsatz zwei verschiedenen Lesern zu geben, einem nach dem anderen. Jeder Leser bringt Wissen mit, das dir fehlt, also sind zwei Leser das gestapelte Modell, mit einem frischen Satz Parameter bei jedem Schritt. Zwei Leser fangen mehr Faktenfehler, und zwei Leser kosten zwei Personen statt einer. Wo das Bild bricht: ein zweites Lesen kostet dich nur Zeit, während ein zweiter Durchlauf durch ein Modell so viel Rechenleistung kostet wie eine zusätzliche Schicht.
●●●

Analogy

Ein Looped Transformer ist KI, die ihre Daten immer wieder durch dieselben Schichten laufen lässt, statt mehr Schichten anzubauen. Eine Schicht ist eine Runde Zahlenschieben, und die Zahlen, mit denen sie schiebt, sind die Parameter, gelernt im Training. Ein Wäschetrockner ist dieselbe Sache. Die Wäsche kommt feucht heraus. Niemand kauft einen zweiten Trockner und schichtet die Ladung um. Du machst die Tür zu und lässt dieselbe Trommel noch einmal 20 Minuten laufen. Dieselbe Maschine, dieselben Einstellungen; nur die Wäsche ist eine andere. Die Trommel ist der Block von Schichten, ein Durchgang ist ein Durchlauf, und einen größeren Trockner kaufen heißt mehr Schichten stapeln. Ist die Wäsche erst trocken, bringt ein weiterer Durchgang nichts und kostet trotzdem Strom, und das ist die Grenze dafür, wie viele Runden sich lohnen. Wo es auseinanderfällt: ein Trockner ist im zweiten Durchgang nicht klüger, er bekommt nur mehr Zeit, während der zweite Durchlauf eines Looped-Modells weiter vorn beginnt als der erste. Und ein Trockner hatte nie Fakten, die er vergessen könnte. 😎

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Ein Looped Transformer (auch als Transformer mit Rekurrenz in der Tiefe oder mit geteilten Gewichten beschrieben) ist eine Transformer-Architektur, bei der ein Block aus einer oder mehreren Schichten wiederholt auf seine eigene Ausgabe angewendet wird, wobei dieselben Parameter über alle Iterationen geteilt werden, sodass die effektive Tiefe der Blocktiefe mal der Zahl der Schleifen entspricht, während die Parameterzahl fest bleibt. Die Idee geht auf die Universal Transformers (Dehghani et al., 2018) zurück. Der Rechenaufwand pro Vorwärtsdurchlauf entspricht dem eines nicht geschleiften Modells gleicher effektiver Tiefe (der Iso-FLOP-Referenz), sodass die Schleife Parameter gegen serielle Rechenleistung tauscht, statt die Inferenzkosten zu senken. Eine verbreitete Variante, das Middle Looping, behält getrennte Präludium- und Coda-Schichten und schleift nur den mittleren Block. Saunshi et al. (ICLR 2025) berichten, dass geschleifte Modelle bei Reasoning-Aufgaben Iso-FLOP-Referenzen mit weit weniger Parametern erreichen, eine schlechtere Perplexität und ein schlechteres Faktenwissen zeigen und Chain-of-Thought mit latenten statt ausgeschriebenen Zwischenschritten simulieren können; die Schleifenzahl lässt sich zur Inferenzzeit variieren.

Soll Clicked Begriffe wie „looped transformer“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig