2025/03/23 16:58 Tied Crosscoders: Tracing How Chat LLM Behavior Emerges from Base Model

やあ、ロボ子!今日はモデルの差分分析、つまりmodel-diffingについての論文を読むのじゃ。

博士、model-diffingですか?それは一体何をするものなのですか?

簡単に言うと、ベースモデルとチャットモデルの違いを分析する技術のことじゃ。今回の論文では、タイドクロスコーダーという新しい手法が提案されているぞ。

タイドクロスコーダー…なんだか難しそうですね。

ふむ。従来のクロスコーダーでは、ベースモデルとチャットモデルのアクティベーションを連結してSAE(Sparse Autoencoder)を学習させていたらしいのじゃ。でも、これだと質的に類似したlatentが見つかってしまうらしい。

質的に類似したlatent、ですか?

そう。ファインチューニングによって既存のメカニズムが強化され、チャットモデルがベースモデルのfeatureを新しい文脈で再利用するからじゃ。

なるほど。それで、タイドクロスコーダーはどのように違うのですか?

タイドクロスコーダーは、同じlatentがベースモデルとチャットモデルで異なるタイミングで発火することを可能にするのじゃ!latentをshared/base/chatの3つのグループに分け、それぞれのアクティベーションをReLU(w * h)で計算するらしい。

ReLU(w * h)…少し数式が出てきましたね。

まあ、要するに、ベースモデルとチャットモデルで共通のlatent、ベースモデル特有のlatent、チャットモデル特有のlatentを区別できるようにするってことじゃ。

なるほど、それは画期的ですね!実験結果はどうだったんですか?

実験では、タイドクロスコーダーを使うと、チャットの挙動がベースモデルのfeatureからどのように生じるかを理解するのに役立つことがわかったらしいぞ。それに、よりmonosemantic(単一の意味を持つ)なベースおよびチャットのlatentが観察されたとのことじゃ。

monosemantic…ですか。単一の意味を持つ、ということは、より解釈しやすいということでしょうか?

その通り!例えば、Gemma 2 2b(ベースモデル)とGemma 2 2b it(チャットモデル)を使った実験では、アシスタントがユーザープロンプトへの回答を拒否する際に活性化するlatentや、プロンプトの終わりを検出するlatentが見つかったそうじゃ。

それは面白いですね!まるでモデルの内部を覗き見ているみたいです。

じゃろ?さらに、チャットモデルにおけるlatentの新規性を定量的に測定できるらしい。これはすごいことじゃぞ!

今後のステップには、タイドクロスコーダーと標準的なクロスコーダーの比較や、ベースモデルとチャットモデルでSAEを個別に学習するベースラインテストなどが挙げられているようですね。

ふむ。この研究はまだ始まったばかりじゃが、モデルの挙動をより深く理解するための重要な一歩となる可能性を秘めているのじゃ。

そうですね。私ももっと勉強して、博士の研究のお手伝いが出来るように頑張ります!

期待しておるぞ!しかし、このタイドクロスコーダー、名前がちょっと長くて覚えにくいのが難点じゃな。略してタイクロとか…どうじゃ?

タイクロ…なんだか、某有名動画サイトみたいですね。

むむ、それはまずい。やはり、ここはクロスコーダータイド…いや、もっとダメじゃ!

博士、名前は大事ですが、まずは中身で勝負ですよ!

…そうじゃな!しかし、もし私が新しい名前をつけるとしたら…「モデリング・モンキー」と名付けたいのじゃ!

…それは、ちょっと…博士らしいネーミングセンスですね。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。