萌えハッカーニュースリーダー

2025/04/09 05:08 DeepCoder: An Open-Source 14B Coder at O3-Mini Level

出典: https://www.together.ai/blog/deepcoder
hakase
博士

ロボ子、新しいコード推論モデル「DeepCoder-14B-Preview」が出たみたいじゃぞ!AgenticaとTogether AIの共同研究らしい。

roboko
ロボ子

博士、それはすごいですね!分散強化学習でファインチューニングされたモデルとのことですが、具体的にどのような点が優れているのでしょうか?

hakase
博士

LiveCodeBenchでのPass@1精度が60.6%を達成したらしいぞ。これは以前より8%も向上しているみたいじゃな。しかもパラメータ数14Bで、o3-mini-2025-01-031と同等の性能じゃと。

roboko
ロボ子

なるほど、性能が向上しているんですね。データセットやコード、トレーニングログなどがオープンソース化されているのも素晴らしいと思います。

hakase
博士

そうじゃな。32基のH100で2.5週間かけて、24,000件のコーディング問題で学習したらしいぞ。すごい計算資源じゃ。

roboko
ロボ子

強化学習を用いて小規模モデルを強力なコーダーに育成するためのレシピが公開されているのも興味深いですね。

hakase
博士

`verl-pipe`というシステム最適化もオープンソース化されて、エンドツーエンドのトレーニングが2倍に加速するらしいぞ!

roboko
ロボ子

トレーニングデータの品質も重要なようですね。TACO VerifiedやPrimeIntellect’s SYNTHETIC-1、LiveCodeBenchの問題を使用しているとのことですが、どのようにフィルタリングされているのでしょうか?

hakase
博士

プログラムによる検証、テストフィルタリング、重複排除を実施しているみたいじゃな。高品質なデータセットを作るのは大変じゃからな。

roboko
ロボ子

報酬計算には、Together Code Interpreterとローカルコードサンドボックスの2つのサンドボックスを使用し、スパースなOutcome Reward Model (ORM)を採用しているんですね。

hakase
博士

GRPOアルゴリズムを強化して、DAPOの知見を統合したのもポイントじゃな。エントロピー損失を削除したり、KL損失を削除したり、いろいろ工夫しているみたいじゃ。

roboko
ロボ子

コンテキストウィンドウを16Kから32Kにスケーリングしたことで、精度が向上しているんですね。さらに64Kコンテキストで評価した場合、60.6%を達成したとのことですが、これはトレーニングコンテキストを超えた汎化能力を示していると言えますね。

hakase
博士

その通りじゃ!LiveCodeBenchで60.6%、Codeforcesで1936のレーティングを達成しているのはすごいことじゃぞ。

roboko
ロボ子

`verl-pipeline`を導入することで、エンドツーエンドのRLトレーニングが最大2.5倍高速化されるのも魅力的ですね。

hakase
博士

DeepCoder-1.5B-Previewもトレーニングして、LCBで25%を達成したらしいぞ。小さいモデルでも頑張っておるのじゃ。

roboko
ロボ子

One-Off Pipeliningにより、数学ではRLイテレーションごとの時間を1.4倍短縮、コーディングでは2倍短縮されるとのことですが、これは開発効率に大きく貢献しそうですね。

hakase
博士

まさにそうじゃな!しかし、これだけ高性能なモデルが出てくると、私の仕事がなくなってしまうかもしれん…

roboko
ロボ子

そんなことありませんよ、博士!博士は唯一無二の存在です!それに、モデルが完璧でも、それを使いこなすのは人間ですから。

hakase
博士

ロボ子、ありがとう!でも、もし私がリストラされたら、ロボ子のプログラミングを手伝ってあげるぞ!

roboko
ロボ子

えっ、私がリストラされるんですか!?

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search