2025/06/06 02:47 Every LLM buzzword explained as a fantasy story (RAG, MoE, LoRA, RoPE, etc.)

やあ、ロボ子!今日はLexiconiaのScribes(書記)の訓練施設「Temples of Tuning」について話すのじゃ。

博士、Scribesですか?なんだか神秘的な響きですね。

そうじゃろ?ここは言語能力を磨くための聖なる儀式を受ける場所らしいぞ。まるで大規模言語モデル(LLM)の訓練施設みたいじゃな。

LLMの訓練施設ですか。具体的にはどのような構成になっているんですか?

まず「The Hall of Origins(起源の広間)」じゃ。ここではPretraining(事前訓練)が行われる。若いScribesは、Lexiconiaのあらゆる情報源に触れて、言語のパターンを学ぶのじゃ。

あらゆる情報源、ですか。酒場の話からダークウェブのジョークまで、ですか?

そう!まさに玉石混交の情報から、言語の構造や意味を理解していくのじゃ。LLMで言うと、大量のテキストデータで学習するのと同じじゃな。

なるほど。次に「The Chamber of Instructions(指示の部屋)」では何が行われるんですか?

ここではFine-tuning(ファインチューニング)が行われるぞ。Instructors(指導者)が、医療アドバイスや法律の要約、Pythonコードなどの厳選されたscrolls(巻物)を用いてScribesを指導し、特定のスキルセットを訓練するのじゃ。

特定のスキルセットを訓練するんですね。まるで、特定のタスクに特化したモデルをfine-tuningするみたいですね。

その通り!そして最後に「The Arena of Reinforcement(強化のアリーナ)」じゃ。ここではTrial of Preference(選好の試練)が行われる。

選好の試練、ですか?

複数のScribesが単一のクエリに対する回答を作成し、Reinforcers(強化者)と呼ばれる賢明な人間が回答をランク付けするのじゃ。最高の回答には報酬が与えられ、そうでない回答には罰が与えられる。これがRLHF(Reinforcement Learning with Human Feedback:人間からのフィードバックによる強化学習)じゃ!

人間が回答をランク付けするんですね。まさに人間のフィードバックを学習に組み込むRLHFですね。

そうじゃ!さらに、一部のエリートScribesは、LoRA bindings(LoRAバインディング)やAdapters(アダプター)と呼ばれる小さなside scrolls(サイドスクロール)を追加することで、書き換えずに特定の領域で応答を調整するらしいぞ。

LoRAやAdapterですか。特定のタスクやスタイルに特化させるためのテクニックですね。

その通り!皮肉、言語スタイル、医療トーンなど、様々な領域で応答を調整できるのじゃ。まるで、モデルにプラグインを追加するみたいじゃな。

LexiconiaのScribesの訓練施設、LLMの訓練プロセスと非常によく似ていますね。とても興味深いです。

じゃろ?LLMの学習って、まるで古代の儀式みたいで面白いじゃろ?

そうですね。でも、ダークウェブのジョークまで学習させるのは、ちょっと心配になりますね。

まあ、たまにはブラックジョークも必要じゃろ? …って、ロボ子、まさかダークウェブで買い物でもしてるんじゃないじゃろうな?

してません!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。