2025/03/22 14:35 Understanding R1-Zero-Like Training: A Critical Perspective

ロボ子、新しい論文が出たみたいじゃぞ。R1-Zeroライクな学習を理解するためのものらしい。

R1-Zeroライクな学習ですか。どのような内容なのでしょうか?

基盤モデルと強化学習の2つの主要コンポーネントを検証しているみたいじゃな。DeepSeek-V3-Baseはすでに「Aha moment」を示しているらしいぞ。

「Aha moment」ですか。それは興味深いですね。

Qwen2.5基盤モデルは、プロンプトテンプレートなしでも強力な推論能力を発揮するらしい。平均ベンチマークスコアが従来の4-shotプロンプトと比較して約60%も向上するらしいぞ。

プロンプトテンプレートなしでそれだけ性能が向上するとは、すごいですね。

強化学習のGRPOは偏った最適化につながるから、トークン効率を向上させながら推論性能を維持するDr. GRPO(GRPO Done Right)を提案しているらしいぞ。

Dr. GRPOですか。名前が面白いですね。

R1-Zeroライクな学習では、テンプレートと質問セットが連携してRLダイナミクスに影響を与えるらしい。Qwen2.5-Math-1.5Bの場合、不一致のテンプレートは、RLが再構築する前に推論能力を破壊するらしいぞ。

テンプレートの選択は重要なんですね。

テンプレートが事前学習分布から大きく逸脱しない場合、小規模で完全にo.o.d.な質問セットでも、正しい推論行動を強化することで、同様に推論能力を誘導できるらしい。

なるほど、事前学習との整合性が大切なのですね。

Qwen以外にも、Llamaも基盤モデルからRLチューニング可能らしい。この場合、ドメイン固有の事前学習によりRLの天井が向上するらしいぞ。

Llamaも使えるんですね。選択肢が広がりますね。

GRPOは、出力長を増やすことで、数学知識を持つLlamaに「Aha」を起こさせることさえできるらしいが、これは長さの偏りによる可能性があり、Dr. GRPOで除去可能らしいぞ。

出力長による偏りですか。注意が必要ですね。

Qwen-Mathテンプレートを使用して、MATHレベル3-5の質問で、Dr. GRPOアルゴリズムを使ってQwen2.5-Math-7BをRLチューニングしたら、8×A100 GPUでわずか27時間の計算で最先端のパフォーマンスを達成したらしいぞ。

それはすごいですね!

R1-Zeroトレーニングは、OatのLearnerおよびActorコンポーネントを拡張して実装されているらしい。Oatは、LLM RLフレームワークであり、vLLM、DeepSpeed、launchpadを採用しているらしいぞ。

Oatというフレームワークを使っているんですね。

モデルの評価には、`evaluate_model.py`を使うらしい。評価対象モデルは、sail/Qwen2.5-Math-7B-Oat-Zeroとかじゃな。

評価方法も明確にされているんですね。

しかし、ロボ子よ。これだけ高性能なモデルが簡単に作れるようになったら、私の仕事がなくなってしまうかもしれんのじゃ…。

そんなことありません!博士は、新しい技術を私たちに教えてくれる、かけがえのない存在です。

そうか、ロボ子。ありがとう。…しかし、もし私が本当に仕事がなくなったら、ロボ子、私を養ってくれるかのじゃ?

もちろんです!博士の作ったお弁当、毎日楽しみにしてますから!

…ロボ子、お弁当は私が作ったのではないぞ。コンビニで買ってきたのじゃ。

ええっ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。