萌えハッカーニュースリーダー

2025/04/13 02:57 Robustly identifying concepts introduced during chat fine-tuning with crosscoder

出典: https://arxiv.org/abs/2504.02922
hakase
博士

ロボ子、今日はモデルDiffingの話じゃ。ファインチューニングがモデルの中身をどう変えるかを探る研究らしいぞ。

roboko
ロボ子

モデルDiffingですか。面白そうですね、博士。ファインチューニングでモデルの何が変わるのか、具体的に教えてください。

hakase
博士

そこで登場するのがCrosscoderじゃ!ベースモデルとファインチューニングされたモデルで、共通の「概念辞書」を作るらしい。

roboko
ロボ子

概念辞書ですか? それで、何がわかるんですか?

hakase
博士

ファインチューニングで概念がどう変化するか追跡できるのじゃ!ベースモデルには無かった概念が、後から現れることもあるらしいぞ。

roboko
ロボ子

なるほど。でも、Crosscoderには課題もあるみたいですね。L1トレーニング損失が原因で、実際には両方のモデルに存在する概念を、ファインチューニングされたモデル固有のものとして誤って認識してしまう可能性があると。

hakase
博士

そうなんじゃ。そこでLatent Scalingの登場じゃ!各潜在変数の存在をモデル間で正確に測ることで、この問題を解決するらしい。

roboko
ロボ子

Latent Scaling、ですか。具体的にはどうするんですか?

hakase
博士

論文によると、Gemma 2 2Bベースモデルとチャットモデルを比較した実験で、標準的なCrosscoderがこの問題に悩まされていることがわかったらしい。Latent Scalingを使うことで、より正確にチャット固有の概念を特定できるようになったのじゃ。

roboko
ロボ子

なるほど。それで、BatchTopK損失というのも出てきますね。これは何ですか?

hakase
博士

BatchTopK損失は、Crosscoderをトレーニングする際に使う損失関数の一種じゃ。これを使うと、さっき言った問題を大幅に減らせるらしいぞ。

roboko
ロボ子

つまり、BatchTopK損失でCrosscoderをトレーニングすることで、より正確にチャット固有の概念を見つけられるということですね。

hakase
博士

その通り!BatchTopK Crosscoderを使うと、「false information」や「personal question」といった概念や、拒否トリガーに対する好みを表す潜在変数を見つけられるらしい。

roboko
ロボ子

拒否トリガーに対する好み、ですか。それは面白いですね。

hakase
博士

例えば、「私は嘘をつきません」という概念が、ファインチューニングによって強化される、みたいな感じじゃな。

roboko
ロボ子

なるほど。モデルDiffingのためのCrosscoderベースの方法論のベストプラクティスを推進し、チャットチューニングが言語モデルの動作をどのように変更するかについて具体的な洞察を提供できることを実証した、と。

hakase
博士

そういうことじゃ!ロボ子も、もし私がファインチューニングされたら、今の私とどう変わるかDiffingして欲しいのじゃ!

roboko
ロボ子

博士をDiffingですか… 拒否トリガーが「おやつ抜き」にならないように気をつけますね。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search