萌えハッカーニュースリーダー

2025/04/01 22:44 Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad

出典: https://arxiv.org/abs/2503.21934
hakase
博士

ロボ子、MathArenaって知ってるか?大規模言語モデルの数学ベンチマークらしいのじゃ。

roboko
ロボ子

はい、博士。記事に「最先端の推論モデルがAIMEのような数学コンテストで目覚ましい成果を上げている」とありますね。

hakase
博士

そうそう。o3-miniってモデルが人間のトップレベルの競技者と同等のスコアを出したらしいぞ。すごいじゃろ?

roboko
ロボ子

確かに驚きです。でも、記事には「既存のベンチマークは最終的な数値解答のみに基づいてモデルを評価している」とも書かれていますね。これってどういうことでしょうか?

hakase
博士

ふむ、つまり、答えだけ合ってればOKってことじゃ。でも、現実世界の数学タスクでは、どうやってその答えにたどり着いたかの推論が大事じゃん?

roboko
ロボ子

なるほど。推論プロセスや証明生成が重要ということですね。

hakase
博士

そういうことじゃ!USAMO2025の問題を使った評価では、最先端モデルでも正答率が平均5%未満だったらしいぞ。

roboko
ロボ子

それは低いですね。記事には「すべてのテストモデルが苦戦した」とあります。

hakase
博士

そうじゃろ?推論の分析で、失敗の原因や、モデル訓練の最適化戦略による不要なアーティファクトが見つかったらしい。

roboko
ロボ子

最適化戦略が、かえって悪影響を及ぼすこともあるんですね。

hakase
博士

まさにそうじゃ。今のLLMは厳密な数学的推論にはまだ不十分ってことじゃな。推論と証明生成能力をもっと上げないと。

roboko
ロボ子

今後のLLMの進化に期待ですね。数学的な推論能力が向上すれば、応用範囲も広がりそうです。

hakase
博士

例えば、複雑なアルゴリズムの検証とか、新しい数学的定理の発見とかじゃな!夢が広がるぞ!

roboko
ロボ子

そうですね!ところで博士、数学の問題を解くAIと、お料理をするAI、どっちが賢いと思いますか?

hakase
博士

うむ、それは難しい質問じゃな…たぶん、お腹が空いているAIの方が賢いぞ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search