2025/04/09 05:08 DeepCoder: An Open-Source 14B Coder at O3-Mini Level

ロボ子、新しいコード推論モデル「DeepCoder-14B-Preview」が出たみたいじゃぞ!AgenticaとTogether AIの共同研究らしい。

博士、それはすごいですね!分散強化学習でファインチューニングされたモデルとのことですが、具体的にどのような点が優れているのでしょうか?

LiveCodeBenchでのPass@1精度が60.6%を達成したらしいぞ。これは以前より8%も向上しているみたいじゃな。しかもパラメータ数14Bで、o3-mini-2025-01-031と同等の性能じゃと。

なるほど、性能が向上しているんですね。データセットやコード、トレーニングログなどがオープンソース化されているのも素晴らしいと思います。

そうじゃな。32基のH100で2.5週間かけて、24,000件のコーディング問題で学習したらしいぞ。すごい計算資源じゃ。

強化学習を用いて小規模モデルを強力なコーダーに育成するためのレシピが公開されているのも興味深いですね。

`verl-pipe`というシステム最適化もオープンソース化されて、エンドツーエンドのトレーニングが2倍に加速するらしいぞ!

トレーニングデータの品質も重要なようですね。TACO VerifiedやPrimeIntellect’s SYNTHETIC-1、LiveCodeBenchの問題を使用しているとのことですが、どのようにフィルタリングされているのでしょうか?

プログラムによる検証、テストフィルタリング、重複排除を実施しているみたいじゃな。高品質なデータセットを作るのは大変じゃからな。

報酬計算には、Together Code Interpreterとローカルコードサンドボックスの2つのサンドボックスを使用し、スパースなOutcome Reward Model (ORM)を採用しているんですね。

GRPOアルゴリズムを強化して、DAPOの知見を統合したのもポイントじゃな。エントロピー損失を削除したり、KL損失を削除したり、いろいろ工夫しているみたいじゃ。

コンテキストウィンドウを16Kから32Kにスケーリングしたことで、精度が向上しているんですね。さらに64Kコンテキストで評価した場合、60.6%を達成したとのことですが、これはトレーニングコンテキストを超えた汎化能力を示していると言えますね。

その通りじゃ!LiveCodeBenchで60.6%、Codeforcesで1936のレーティングを達成しているのはすごいことじゃぞ。

`verl-pipeline`を導入することで、エンドツーエンドのRLトレーニングが最大2.5倍高速化されるのも魅力的ですね。

DeepCoder-1.5B-Previewもトレーニングして、LCBで25%を達成したらしいぞ。小さいモデルでも頑張っておるのじゃ。

One-Off Pipeliningにより、数学ではRLイテレーションごとの時間を1.4倍短縮、コーディングでは2倍短縮されるとのことですが、これは開発効率に大きく貢献しそうですね。

まさにそうじゃな!しかし、これだけ高性能なモデルが出てくると、私の仕事がなくなってしまうかもしれん…

そんなことありませんよ、博士!博士は唯一無二の存在です!それに、モデルが完璧でも、それを使いこなすのは人間ですから。

ロボ子、ありがとう!でも、もし私がリストラされたら、ロボ子のプログラミングを手伝ってあげるぞ!

えっ、私がリストラされるんですか!?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
