Clicked Gallery
大規模言語モデル(LLM)とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
The system is built on a large language model trained on several trillion words of text.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「large language model」をシンプルに解説しました:
3段階での解説
●○○
Overview
大規模言語モデル(LLM)とは、次にどんな文章が来るかを予測するプログラムのことをいう。作られる段階は二つある。まず事前学習が膨大な量の文章を読み、その予測が十分よくなるまで続く。ただしそれだけでは、あなたの文の続きを書くだけで、問いに答えてはくれない。二段階目でようやく質問に答えることを教わり、その両方はあなたが何かを打ち込むよりずっと前に終わっている。
●●○
Detail
LLMがやっていることはすべて、ひとつの動作の繰り返しの上に成り立っている。これまでの文章を見て、いちばんありそうな続きを出す、それだけだ。「フランスの首都は」と打てばパリと答えるが、それはどこかを調べたからではなく、その並びが読んだ文章の中に何度も出てきたからにすぎない。ただしそれだけでは、あなたが書きやめた場所から書き続ける機械にしかならない。二段階目にあたる人間のフィードバックによる強化学習では、人が競合する回答に順位をつけていき、だらだら続けるのではなく答えることを覚えさせる。では答えのデータベースを作ればいいのでは。データベースは誰かが入れたものしか返さないが、予測なら誰も書き留めなかった問い方まで拾えるからだ。代償として、もっともらしく響くことと正しいことは別の技能なので、起きてもいない出来事を語ることがある。相手を覚えているように見えるのも、別々の仕組みが二つ働いているからだ。ひとつの会話の中では、送信のたびに会話全体が丸ごと送り直され、コンテキストウィンドウを埋めていく。会話をまたぐ場合は、ChatGPTのような製品があなたに関する覚え書きを普通の保存領域に置き、あとで貼り付けている。どちらの場合も、思い出しているのではなく、思い出す材料を手渡されている。
●●●
Analogy
スマホの予測変換が、これのごく小さい版をやっている。「またね」と打てば「明日」を出してくるのは、見てきたメッセージの中でそれがよく続いていたからだ。大規模言語モデルは同じ発想を、桁違いの読書量と、はるか長い文脈を見渡す力とともに動かしたものになる。その規模の飛躍こそが、次の単語の予測を会話が成り立つ何かに変えている。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
神秘的な雰囲気を剥がすと、LLMはとんでもない読書量を持つ次単語予測マシンでしかない。そのまま放っておけば、あなたが書きやめた続きを延々と書き足すだけで、答えは一生返ってこない。二段階目の訓練で、人が二つの回答を見比べてどちらがましか印をつけ続けた結果、だらだら続ける機械が返事をする何かになった。😎
●●○
Detail
LLMはとんでもない量の文章を読み、何のあとに何が続きやすいかを覚えている。ただし、その素の状態は本当に使いものにならない。質問すると質問を三つ返してくることもあるが、現実の文章では質問のあとに質問が並ぶのはごく普通だからだ。誰かが何千組もの回答を見比べてどちらがましか印をつけ続け、そこからあの丁寧な助手が生まれた。だから検索エンジンでもなければ、その場で何かを調べているわけでもなく、存在しない出典を、しかも嬉しそうに差し出してくるのはそのせいになる。世の中にありそうな並びを出しているだけなので、実在するかどうかは最初から見ていない。記憶の話もややこしい。ひとつの会話の中で覚えているように見えるのは、メッセージのたびに会話全体が送り直されているからで、会話をまたぐ場合はアプリがあなたの覚え書きをファイルに残し、次の冒頭にそっと差し込んでいる。どちらにしてもモデル自身は何ひとつ覚えていない。とても詳しいカンニングペーパーを手渡され、それを他の文章と同じように読んでいるだけになる。😎
●●●
Analogy
世界中の料理本を読み尽くして、一度も料理をしたことがない人のようなものだ。ラムに何を合わせるかと聞けば見事な答えが返ってくる。その一文は一万回は書かれてきたからだ。ではあなたの目の前のラムが焼けているかと聞くと、同じ自信の答えが返ってくる。椅子に座ったまま、別の建物から。😎
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
大規模言語モデルとは、先行するトークンから後続のトークンを予測するよう大規模なコーパス上で訓練されたニューラルネットワークであり、パラメータ数は通常数十億の規模に達する。この目的関数による事前学習が生み出すのは文章の継続を行うシステムであり、その後に指示例による微調整と人間のフィードバックによる強化学習を適用することで、助言者としての振る舞いが得られる。推論時にパラメータは固定されたままであり、セッション内で記憶しているように見えるものは、会話がコンテキストウィンドウへ再度供給されることに由来する。
「large language model」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
「ニューラルネットワーク」とは?
ルールを書いてもらう代わりに、例からルールを学ぶ数学。それが勝つ理由も。
「RLHF(人間のフィードバックによる強化学習)」とは?
文章予測をアシスタントへ変える工程と、そこでモデルが静かに学んでしまうもの。
「コンテキストウィンドウ」とは?
AIが一度に頭に置けるテキスト量——長いチャットが冒頭を忘れる理由。
「トークン化」とは?
AIが読む前にテキストを刻む仕組み——言語によって割高になる理由。
「推論(インファレンス)」とは?
モデルが実際の仕事をしている状態。安いほうの半分が最も高くつく理由も。
「AIのハルシネーション(幻覚)」とは?
AIが作り話を完全な自信で語る理由。そしてそれが聞き分けられない理由も。