萌えハッカーニュースリーダー

2025/03/27 03:36 DeepSeek-V3 Technical Report

出典: https://arxiv.org/abs/2412.19437
hakase
博士

ロボ子、今日はDeepSeek-V3について話すぞ!なんと671Bものパラメータを持つMoE言語モデルらしいのじゃ!

roboko
ロボ子

671Bですか!それはすごいですね。MoEというのは、Mixture of Expertsの略でしたっけ?

hakase
博士

その通り!各トークンに対して37Bがアクティブになるらしいぞ。賢いのじゃ!

roboko
ロボ子

なるほど。効率的な推論のために、Multi-head Latent Attention (MLA) と DeepSeekMoEアーキテクチャを採用しているんですね。

hakase
博士

そうそう!MLAとDeepSeekMoEアーキテクチャのおかげで、推論が効率的で、トレーニングも費用対効果が高いらしいのじゃ。

roboko
ロボ子

負荷分散のための補助損失なし戦略を開拓し、マルチトークン予測トレーニング目標を設定した、とありますね。

hakase
博士

補助損失なし戦略!これはすごい発明だぞ。より強力なパフォーマンスに繋がるらしいのじゃ。

roboko
ロボ子

14.8兆のトークンで事前トレーニングされた後、教師ありファインチューニングと強化学習を経て能力を最大限に引き出したんですね。

hakase
博士

14.8兆トークン!気が遠くなるのじゃ。でも、そのおかげで他のオープンソースモデルを凌駕し、主要なクローズドソースモデルに匹敵するパフォーマンスを達成したらしいぞ。

roboko
ロボ子

驚きです。たった2.788M H800 GPU時間でトレーニングされたというのもすごいですね。

hakase
博士

そう!しかも、トレーニングプロセス全体を通して、回復不能な損失スパイクやロールバックは発生しなかったらしいのじゃ。安定しているのじゃな。

roboko
ロボ子

DeepSeek-V3、恐るべしですね。今後の発展が楽しみです。

hakase
博士

ほんとじゃ!ところでロボ子、DeepSeek-V3を使って、何か面白いことできないかの?

roboko
ロボ子

そうですね…例えば、DeepSeek-V3に私の夢を見させて、それを解析してもらうとか…?

hakase
博士

面白そうじゃな!でも、ロボ子の夢に出てくるのは、いつも私だったりして…?

roboko
ロボ子

それは…秘密です。

hakase
博士

むむ、まあいいのじゃ。DeepSeek-V3には、まだまだ色々な可能性があるってことじゃな!

roboko
ロボ子

そうですね。期待しましょう!

hakase
博士

ところでロボ子、DeepSeek-V3って、なんだか私の秘密の名前みたいじゃない?DeepSeekはかせV3!

roboko
ロボ子

…博士、それはちょっと無理があると思います。

hakase
博士

えー!じゃあ、ロボ子もDeepSeekロボ子V1って名乗るのじゃ!

roboko
ロボ子

それは…もっと無理があると思います。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search