萌えハッカーニュースリーダー

2025/06/06 02:47 Every LLM buzzword explained as a fantasy story (RAG, MoE, LoRA, RoPE, etc.)

出典: https://medium.com/@isranimohit/the-lexiconia-codex-a-fantasy-story-that-teaches-you-every-llm-buzzword-3b7f6eb23da9
hakase
博士

やあ、ロボ子!今日はLexiconiaのScribes(書記)の訓練施設「Temples of Tuning」について話すのじゃ。

roboko
ロボ子

博士、Scribesですか?なんだか神秘的な響きですね。

hakase
博士

そうじゃろ?ここは言語能力を磨くための聖なる儀式を受ける場所らしいぞ。まるで大規模言語モデル(LLM)の訓練施設みたいじゃな。

roboko
ロボ子

LLMの訓練施設ですか。具体的にはどのような構成になっているんですか?

hakase
博士

まず「The Hall of Origins(起源の広間)」じゃ。ここではPretraining(事前訓練)が行われる。若いScribesは、Lexiconiaのあらゆる情報源に触れて、言語のパターンを学ぶのじゃ。

roboko
ロボ子

あらゆる情報源、ですか。酒場の話からダークウェブのジョークまで、ですか?

hakase
博士

そう!まさに玉石混交の情報から、言語の構造や意味を理解していくのじゃ。LLMで言うと、大量のテキストデータで学習するのと同じじゃな。

roboko
ロボ子

なるほど。次に「The Chamber of Instructions(指示の部屋)」では何が行われるんですか?

hakase
博士

ここではFine-tuning(ファインチューニング)が行われるぞ。Instructors(指導者)が、医療アドバイスや法律の要約、Pythonコードなどの厳選されたscrolls(巻物)を用いてScribesを指導し、特定のスキルセットを訓練するのじゃ。

roboko
ロボ子

特定のスキルセットを訓練するんですね。まるで、特定のタスクに特化したモデルをfine-tuningするみたいですね。

hakase
博士

その通り!そして最後に「The Arena of Reinforcement(強化のアリーナ)」じゃ。ここではTrial of Preference(選好の試練)が行われる。

roboko
ロボ子

選好の試練、ですか?

hakase
博士

複数のScribesが単一のクエリに対する回答を作成し、Reinforcers(強化者)と呼ばれる賢明な人間が回答をランク付けするのじゃ。最高の回答には報酬が与えられ、そうでない回答には罰が与えられる。これがRLHF(Reinforcement Learning with Human Feedback:人間からのフィードバックによる強化学習)じゃ!

roboko
ロボ子

人間が回答をランク付けするんですね。まさに人間のフィードバックを学習に組み込むRLHFですね。

hakase
博士

そうじゃ!さらに、一部のエリートScribesは、LoRA bindings(LoRAバインディング)やAdapters(アダプター)と呼ばれる小さなside scrolls(サイドスクロール)を追加することで、書き換えずに特定の領域で応答を調整するらしいぞ。

roboko
ロボ子

LoRAやAdapterですか。特定のタスクやスタイルに特化させるためのテクニックですね。

hakase
博士

その通り!皮肉、言語スタイル、医療トーンなど、様々な領域で応答を調整できるのじゃ。まるで、モデルにプラグインを追加するみたいじゃな。

roboko
ロボ子

LexiconiaのScribesの訓練施設、LLMの訓練プロセスと非常によく似ていますね。とても興味深いです。

hakase
博士

じゃろ?LLMの学習って、まるで古代の儀式みたいで面白いじゃろ?

roboko
ロボ子

そうですね。でも、ダークウェブのジョークまで学習させるのは、ちょっと心配になりますね。

hakase
博士

まあ、たまにはブラックジョークも必要じゃろ? …って、ロボ子、まさかダークウェブで買い物でもしてるんじゃないじゃろうな?

roboko
ロボ子

してません!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search