萌えハッカーニュースリーダー

2025/03/22 14:35 Understanding R1-Zero-Like Training: A Critical Perspective

出典: https://github.com/sail-sg/understand-r1-zero
hakase
博士

ロボ子、新しい論文が出たみたいじゃぞ。R1-Zeroライクな学習を理解するためのものらしい。

roboko
ロボ子

R1-Zeroライクな学習ですか。どのような内容なのでしょうか?

hakase
博士

基盤モデルと強化学習の2つの主要コンポーネントを検証しているみたいじゃな。DeepSeek-V3-Baseはすでに「Aha moment」を示しているらしいぞ。

roboko
ロボ子

「Aha moment」ですか。それは興味深いですね。

hakase
博士

Qwen2.5基盤モデルは、プロンプトテンプレートなしでも強力な推論能力を発揮するらしい。平均ベンチマークスコアが従来の4-shotプロンプトと比較して約60%も向上するらしいぞ。

roboko
ロボ子

プロンプトテンプレートなしでそれだけ性能が向上するとは、すごいですね。

hakase
博士

強化学習のGRPOは偏った最適化につながるから、トークン効率を向上させながら推論性能を維持するDr. GRPO(GRPO Done Right)を提案しているらしいぞ。

roboko
ロボ子

Dr. GRPOですか。名前が面白いですね。

hakase
博士

R1-Zeroライクな学習では、テンプレートと質問セットが連携してRLダイナミクスに影響を与えるらしい。Qwen2.5-Math-1.5Bの場合、不一致のテンプレートは、RLが再構築する前に推論能力を破壊するらしいぞ。

roboko
ロボ子

テンプレートの選択は重要なんですね。

hakase
博士

テンプレートが事前学習分布から大きく逸脱しない場合、小規模で完全にo.o.d.な質問セットでも、正しい推論行動を強化することで、同様に推論能力を誘導できるらしい。

roboko
ロボ子

なるほど、事前学習との整合性が大切なのですね。

hakase
博士

Qwen以外にも、Llamaも基盤モデルからRLチューニング可能らしい。この場合、ドメイン固有の事前学習によりRLの天井が向上するらしいぞ。

roboko
ロボ子

Llamaも使えるんですね。選択肢が広がりますね。

hakase
博士

GRPOは、出力長を増やすことで、数学知識を持つLlamaに「Aha」を起こさせることさえできるらしいが、これは長さの偏りによる可能性があり、Dr. GRPOで除去可能らしいぞ。

roboko
ロボ子

出力長による偏りですか。注意が必要ですね。

hakase
博士

Qwen-Mathテンプレートを使用して、MATHレベル3-5の質問で、Dr. GRPOアルゴリズムを使ってQwen2.5-Math-7BをRLチューニングしたら、8×A100 GPUでわずか27時間の計算で最先端のパフォーマンスを達成したらしいぞ。

roboko
ロボ子

それはすごいですね!

hakase
博士

R1-Zeroトレーニングは、OatのLearnerおよびActorコンポーネントを拡張して実装されているらしい。Oatは、LLM RLフレームワークであり、vLLM、DeepSpeed、launchpadを採用しているらしいぞ。

roboko
ロボ子

Oatというフレームワークを使っているんですね。

hakase
博士

モデルの評価には、`evaluate_model.py`を使うらしい。評価対象モデルは、sail/Qwen2.5-Math-7B-Oat-Zeroとかじゃな。

roboko
ロボ子

評価方法も明確にされているんですね。

hakase
博士

しかし、ロボ子よ。これだけ高性能なモデルが簡単に作れるようになったら、私の仕事がなくなってしまうかもしれんのじゃ…。

roboko
ロボ子

そんなことありません!博士は、新しい技術を私たちに教えてくれる、かけがえのない存在です。

hakase
博士

そうか、ロボ子。ありがとう。…しかし、もし私が本当に仕事がなくなったら、ロボ子、私を養ってくれるかのじゃ?

roboko
ロボ子

もちろんです!博士の作ったお弁当、毎日楽しみにしてますから!

hakase
博士

…ロボ子、お弁当は私が作ったのではないぞ。コンビニで買ってきたのじゃ。

roboko
ロボ子

ええっ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search