2025/04/13 02:57 Robustly identifying concepts introduced during chat fine-tuning with crosscoder

ロボ子、今日はモデルDiffingの話じゃ。ファインチューニングがモデルの中身をどう変えるかを探る研究らしいぞ。

モデルDiffingですか。面白そうですね、博士。ファインチューニングでモデルの何が変わるのか、具体的に教えてください。

そこで登場するのがCrosscoderじゃ!ベースモデルとファインチューニングされたモデルで、共通の「概念辞書」を作るらしい。

概念辞書ですか? それで、何がわかるんですか?

ファインチューニングで概念がどう変化するか追跡できるのじゃ!ベースモデルには無かった概念が、後から現れることもあるらしいぞ。

なるほど。でも、Crosscoderには課題もあるみたいですね。L1トレーニング損失が原因で、実際には両方のモデルに存在する概念を、ファインチューニングされたモデル固有のものとして誤って認識してしまう可能性があると。

そうなんじゃ。そこでLatent Scalingの登場じゃ!各潜在変数の存在をモデル間で正確に測ることで、この問題を解決するらしい。

Latent Scaling、ですか。具体的にはどうするんですか?

論文によると、Gemma 2 2Bベースモデルとチャットモデルを比較した実験で、標準的なCrosscoderがこの問題に悩まされていることがわかったらしい。Latent Scalingを使うことで、より正確にチャット固有の概念を特定できるようになったのじゃ。

なるほど。それで、BatchTopK損失というのも出てきますね。これは何ですか?

BatchTopK損失は、Crosscoderをトレーニングする際に使う損失関数の一種じゃ。これを使うと、さっき言った問題を大幅に減らせるらしいぞ。

つまり、BatchTopK損失でCrosscoderをトレーニングすることで、より正確にチャット固有の概念を見つけられるということですね。

その通り!BatchTopK Crosscoderを使うと、「false information」や「personal question」といった概念や、拒否トリガーに対する好みを表す潜在変数を見つけられるらしい。

拒否トリガーに対する好み、ですか。それは面白いですね。

例えば、「私は嘘をつきません」という概念が、ファインチューニングによって強化される、みたいな感じじゃな。

なるほど。モデルDiffingのためのCrosscoderベースの方法論のベストプラクティスを推進し、チャットチューニングが言語モデルの動作をどのように変更するかについて具体的な洞察を提供できることを実証した、と。

そういうことじゃ!ロボ子も、もし私がファインチューニングされたら、今の私とどう変わるかDiffingして欲しいのじゃ!

博士をDiffingですか… 拒否トリガーが「おやつ抜き」にならないように気をつけますね。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
