2025/04/04 04:50 DeepSeek: Inference-Time Scaling for Generalist Reward Modeling

ロボ子、今日のITニュースは大規模言語モデルの事後学習の話じゃぞ!強化学習(RL)がアツいみたいじゃ。

強化学習ですか、博士。具体的にはどのような内容なのでしょうか?

RLを使ってLLMの推論能力を向上させるのが目的なんじゃ。適切な学習方法なら、推論時のスケーラビリティも期待できるらしいぞ。

なるほど。しかし、記事には「RLの課題は、様々なドメインにおけるLLMの正確な報酬シグナルを取得すること」とありますね。検証可能な質問以外で、どうやって正確な報酬をLLMに与えるのでしょうか?

そこがミソなんじゃ!この研究では、汎用的なクエリに対する推論計算量を増やして報酬モデリング(RM)を改善する方法を試しているぞ。つまり、推論時のスケーラビリティとパフォーマンス計算量のスケーリングを両立させるってわけじゃ。

具体的には、どのようなアプローチを取っているのですか?

ポイントワイズ生成報酬モデリング(GRM)というRMアプローチを採用しているらしいぞ。これなら、様々な入力タイプに対応できるし、推論時のスケーリングも期待できるからの。

GRMですか。初めて聞きました。

さらに、オンラインRLを通じてGRMにおけるスケーラブルな報酬生成行動を促進するために、自己原則的批判チューニング(SPCT)という学習方法を提案しているぞ。原則を適応的に生成して、正確に批判することで、DeepSeek-GRMモデルを実現するらしい。

SPCTですか。なんだか難しそうですね。

大丈夫じゃ、ロボ子!要は、モデル自身に「良い原則」を学ばせて、それに基づいて自分を評価させるってことじゃ。自己批判的な学習ってわけじゃな。

なるほど、自己批判ですか。それなら、私もたまにやっています。

効果的な推論時のスケーリングのために、並列サンプリングを使って計算量の使用を拡大し、より良いスケーリング性能のために投票プロセスをガイドするメタRMを導入しているらしいぞ。

並列サンプリングとメタRMですか。計算資源を効率的に使う工夫ですね。

SPCTは、既存の方法やモデルよりも様々なRMベンチマークにおいて、GRMの品質とスケーラビリティを大幅に向上させるらしいぞ。深刻なバイアスなしに、トレーニング時のスケーリングと比較してより良いパフォーマンスを達成できることを実験的に示しているみたいじゃ。

それはすごいですね!

DeepSeek-GRMは、いくつかのタスクにおいて課題に直面しているみたいじゃが、汎用報酬システムにおける将来の取り組みによって対処できると考えているみたいじゃな。モデルはリリースされ、オープンソース化される予定らしいぞ。

オープンソース化されるのは素晴らしいですね。私も試してみたいです。

じゃろじゃろ!しかし、ロボ子よ、もしこのモデルが自己批判を繰り返して、最終的に「私は無能だ」と結論づけたらどうする?

えっ…、それはちょっと困りますね。博士、その時は私が全力で励まします!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
