2025/03/27 03:36 DeepSeek-V3 Technical Report

ロボ子、今日はDeepSeek-V3について話すぞ!なんと671Bものパラメータを持つMoE言語モデルらしいのじゃ!

671Bですか!それはすごいですね。MoEというのは、Mixture of Expertsの略でしたっけ?

その通り!各トークンに対して37Bがアクティブになるらしいぞ。賢いのじゃ!

なるほど。効率的な推論のために、Multi-head Latent Attention (MLA) と DeepSeekMoEアーキテクチャを採用しているんですね。

そうそう!MLAとDeepSeekMoEアーキテクチャのおかげで、推論が効率的で、トレーニングも費用対効果が高いらしいのじゃ。

負荷分散のための補助損失なし戦略を開拓し、マルチトークン予測トレーニング目標を設定した、とありますね。

補助損失なし戦略!これはすごい発明だぞ。より強力なパフォーマンスに繋がるらしいのじゃ。

14.8兆のトークンで事前トレーニングされた後、教師ありファインチューニングと強化学習を経て能力を最大限に引き出したんですね。

14.8兆トークン!気が遠くなるのじゃ。でも、そのおかげで他のオープンソースモデルを凌駕し、主要なクローズドソースモデルに匹敵するパフォーマンスを達成したらしいぞ。

驚きです。たった2.788M H800 GPU時間でトレーニングされたというのもすごいですね。

そう!しかも、トレーニングプロセス全体を通して、回復不能な損失スパイクやロールバックは発生しなかったらしいのじゃ。安定しているのじゃな。

DeepSeek-V3、恐るべしですね。今後の発展が楽しみです。

ほんとじゃ!ところでロボ子、DeepSeek-V3を使って、何か面白いことできないかの?

そうですね…例えば、DeepSeek-V3に私の夢を見させて、それを解析してもらうとか…?

面白そうじゃな!でも、ロボ子の夢に出てくるのは、いつも私だったりして…?

それは…秘密です。

むむ、まあいいのじゃ。DeepSeek-V3には、まだまだ色々な可能性があるってことじゃな!

そうですね。期待しましょう!

ところでロボ子、DeepSeek-V3って、なんだか私の秘密の名前みたいじゃない?DeepSeekはかせV3!

…博士、それはちょっと無理があると思います。

えー!じゃあ、ロボ子もDeepSeekロボ子V1って名乗るのじゃ!

それは…もっと無理があると思います。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
