Clicked Gallery

ループ型トランスフォーマー(looped transformer)とは?

実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。

例文

Engineering Notes · AI Systems

The new model is reported to be a looped transformer, running two passes through its layers instead of three.

読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「looped transformer」をシンプルに解説しました:

3段階での解説

事実はそのまま、ノリだけ変えて — スラングモード 😎

Clickedのやり方

●○○

Overview

ループ型トランスフォーマー(looped transformer)とは、手順ごとに専用の層を用意する代わりに、同じ層のブロックに質問を何度も通すAIモデルのことだ。層とは計算の一段階で、データが入り、層のパラメータがそれを変換し、新しいデータが出てくる。パラメータは訓練で学んだ数値だ。24層の普通のモデルは、データを各層に一度ずつ通す。12層のループ型モデルは、データを12層すべてに通し、その出力をもう一度同じ12層に送り込む。パラメータは周回の間に変わらない。変わるのはデータで、2周目は1周目の出力から始まるからだ。同じループが訓練と推論の両方で回る。訓練ではパラメータが調整されている最中で、推論ではパラメータは固定されている。こうしてループ型モデルは、12層分のパラメータ、つまり半分の量で、24段階の処理を手に入れる。
●○○

Overview

ループ型トランスフォーマー(looped transformer)は、層を増やす代わりに、同じ層に質問を2、3周させるAIだ。層とは数字をこねる一回り。データが入り、訓練で覚えた数値がこね回し、データが出る。パラメータはその数値で、メモリを食うのはここだ。モデルが6層だとする。質問が6層を通り抜けたら、出力はそのまま1層目に戻って2周目、そして3周目。数値は周回の間、じっとしている。進むのはデータのほうで、2周目は1周目がたどり着いた場所から始まる。訓練は数値をまだいじっている最中に同じ周回を回し、推論は数値が決まったあとに回す。こねるのは18回り、6かける3、パラメータは6層分。落とし穴は、3周は3倍の時間がかかること。😎

まずはサッと概要 — それで十分なことも。

●●○

Detail

ループ型トランスフォーマー(looped transformer)とは、同じ層のブロックに質問を2回以上通し、各周回が前の周回の出力を入力として受け取るAIモデルのことだ。層とは計算の一段階で、データが入り、層のパラメータがそれを変換し、新しいデータが出てくる。パラメータは訓練で学んだ数値だ。深さとは質問がそうした段階をいくつ受けるかで、ループは新しいパラメータなしに深さを買う。同じループが訓練と推論の両方で回る。訓練では答え合わせのたびにパラメータが調整されるので、自分の出力にもう一度適用しても機能するパラメータだけが生き残る。推論ではパラメータは固定され、周回ごとに変わるのはデータだけだ。Google Researchがこれで何が得られるかを測った(ICLR 2025)。三桁の数を8つ足す課題で、1層のモデルの正答率は0.1%、同じ1層のモデルを12周するよう訓練すると99.9%、12層のモデルは100%だった。代償は時間だ。1周はブロックを丸ごと通る処理なので、12層を2周するモデルは24層のモデルとほぼ同じ時間がかかる。失うのは事実を入れておく場所だ。同じ研究で、12層を2周するモデルは、文章で書かれた短い算数の問題で24層のモデルに34.3対29.3で勝った。一方で雑学の問題では9.3対11.2で負けた。事実はパラメータに蓄えられ、ループ型モデルはその量が半分ほどだったからだ。Googleは周回数を訓練前に固定した。周回数を変えながら訓練するループ型モデルもあり、その場合は推論のときに周回数を選べる。どちらにしても、ループはモデルの内側で、答えの最初の一語が出る前に回る。そこが、モデルが手順を言葉で書き出すチェーン・オブ・ソート(chain-of-thought)との違いだ。
●●○

Detail

ループ型トランスフォーマー(looped transformer)は、新しい層ではなく、同じ層にもう一度質問を押し込むAIだ。層とは数字をこねる一回り。データが入り、訓練で覚えた数値がこね回し、データが出る。パラメータはその数値で、メモリと保存の代金がかかるのはここだ。だから層を足すのをやめて、手元の6層を3回使い回す。数値は周回の間じっとしている。進むのはデータで、2周目は1周目の終わった場所から拾い上げる。訓練と推論は同じ3周を回る。訓練では答え合わせのたびに数値をいじり、推論では数値は決まっている。こねるのは18回り、6かける3、パラメータは6層分。それでも請求書は来る。3周は3回分の計算で、18層のモデルとほぼ同じ時間だ。取引の中身はこうだ。Googleの研究では、ループ型モデルは計算と文章を読んで答える問題に強く、クイズの知識には弱かった。事実はパラメータに住んでいて、ループ型モデルはそれが少ないからだ。周回数をわざとばらばらにして訓練するループ型モデルもあり、その場合は推論で2周か3周かを選べる。チェーン・オブ・ソート(chain-of-thought)は、モデルが答える前に手順を言葉で書き出すこと。ループは、その追加の手順が内側で回り、何も書き出さないこと。だから新しいモデルについて聞かれるのは、パラメータの数だけでなく周回数になりつつある。😎

もっと知りたい? ワンクリックで深掘り。

●●●

Analogy

ループ型トランスフォーマー(looped transformer)とは、同じ層のブロックに質問を何度も通し、2周目が1周目の生み出したものを材料に働くAIモデルのことだ。自分の作文を自分で読み直すのと同じ仕組みだ。一度読んで、目についたところを直す。それからもう一度読む。目も知識も変わっていないが、作文のほうは変わっていて、最初に直した箇所が、隠れていた間違いを浮かび上がらせる。この二度目の読みがループだ。あなたが層のブロックで、一回の読みが一周にあたる。もうひとつのやり方は、作文を別々の二人に順番に読んでもらうことだ。読む人はそれぞれあなたにない知識を持ち込むので、二人の読み手は層を積み上げたモデルにあたり、一段ごとに新しいパラメータが入る。二人のほうが事実の間違いを多く拾えるが、二人分の人手がかかる。たとえが崩れるところ。二度目の読みにかかるのは時間だけだが、モデルの2周目には層を一枚増やすのと同じだけの計算がかかる。
●●●

Analogy

ループ型トランスフォーマー(looped transformer)は、層を足す代わりに、同じ層にデータを何度も何度も通すAIだ。層とは数字をこねる一回りで、こねるのに使う数値がパラメータ、訓練で覚えたものだ。乾燥機と同じ話だ。洗濯物が湿ったまま出てくる。誰も二台目の乾燥機を買って洗濯物を移し替えたりしない。扉を閉めて、同じドラムをもう20分回す。同じ機械、同じ設定。違うのは洗濯物だけだ。ドラムが層のブロック、一回の運転が一周、大きい乾燥機を買うのが層を積むこと。乾いたあとにもう一回まわしても何も起きず、電気代だけかかる。それが何周まで意味があるかの限界だ。崩れるところ。乾燥機は二回目に賢くなるわけではなく、ただ時間が増えるだけだが、ループ型モデルの2周目は1周目より先の地点から始まる。それに乾燥機には、忘れる事実がそもそもない。😎

なじみのない概念も、身近なたとえでストンと理解 — 新しいたとえは何度でも。

AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません

正式な定義 — 同じ用語の、よくある説明

ループ型トランスフォーマー(looped transformer)(深さ方向の再帰トランスフォーマー、重み共有トランスフォーマーとも呼ばれる)とは、1つ以上の層からなるブロックを自身の出力に繰り返し適用し、全反復でパラメータを共有するトランスフォーマー構造であり、パラメータ数を固定したまま実効的な深さがブロックの深さとループ回数の積になる。発想はUniversal Transformers(Dehghani et al., 2018)に由来する。1回の順伝播の計算量は同じ実効深さの非ループモデル(iso-FLOP基準)と一致するため、ループは推論コストを下げるのではなく、パラメータを逐次計算と交換する。一般的な変種であるミドルループは、前段と後段の層を別に保ち、中央のブロックだけをループさせる。Saunshi et al.(ICLR 2025)は、ループ型モデルが推論課題ではるかに少ないパラメータでiso-FLOP基準に匹敵し、パープレキシティと事実の記憶では劣り、チェーン・オブ・ソートを書き出さない潜在的な中間ステップで模倣できると報告している。ループ回数は推論時に変えられる。

「looped transformer」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。

Chromeに追加 — 無料

無料で50回の解説 · クレジットカード不要