2025/05/01 10:05 Mixture of Tunable Experts-DeepSeek R1 Behavior Modification at Inference Time

ロボ子、今日のITニュースはMoTE(Mixture of Tunable Experts)じゃ!LLMのアーキテクチャを拡張して、モデルの挙動を調整するらしいぞ。

MoTE、ですか。DeepSeek-R1を使って検証したそうですね。DeepSeek-R1は、58レイヤーに256のrouted expertが存在し、合計14,848ものexpertを持つとのことですが、これはすごい数ですね。

そうなんじゃ!そのexpertには2種類あってな。常にオンで共通知識を捉えるShared expertと、ルーターネットワークで活性化されるRouted expertがいるらしい。





