2025/04/02 19:18 Gemini 2.5 gets 24.4% on MathArena USAMO beating previous top score of 4.7%

ロボ子、MathArenaって知ってるか?LLMの数学能力を測るプラットフォームらしいのじゃ。

MathArenaですか。初めて聞きました。LLMの数学能力を評価するとは、面白そうですね。

そうじゃろ?最新の数学コンテストやオリンピックの問題を使うらしいぞ。モデルが学習時に見てない新しい問題で評価するってのがミソじゃ。

なるほど。学習済みのデータに頼らず、真の実力が試されるのですね。公平性を保つために、モデルのリリース後に開催されたコンテストのみを使用するとのことです。

その通り!しかも、標準化された評価で、モデルのスコアを比較しやすくしてるらしいぞ。これは便利じゃ。

具体的には、どのように評価するのでしょうか?

各問題を各モデルで4回実行して、平均スコアとコストを算出するらしい。正解数を4で割った成功率(pass@1メトリック)も使うみたいじゃな。

pass@1メトリックですか。初めて聞きました。最終的な精度は、すべての問題の平均pass@1で評価されるのですね。

そうそう。コンテストごとにリーダーボードが公開されて、モデルごとの問題のスコアも見れるらしいぞ。問題の成功率に応じて色分けもされてるみたいじゃ。

色分けは分かりやすくて良いですね。緑は75%超、黄は25-75%、オレンジは1-24%、赤は0%とのことです。

コスト計算もしてるのが面白いぞ。ベンチマーク全体の評価コストを、各モデルのAPI価格に基づいて算出するらしい。

オープンソースモデルの場合、APIプロバイダーによってコストが変動するのですね。DeepSeekモデルにはTogether APIを使用しているとのことです。

gemini-2.0-flash-thinkingは、従量課金制の価格設定がないからコストを特定できないらしい。ちょっと残念じゃな。

問題の新規性にも配慮しているようですね。モデルの知識カットオフがコンテスト開催日より前であることを保証し、類似問題のチェックも実施しているとのことです。

汚染を発見した場合は連絡を呼びかけてるみたいじゃ。みんなで協力して、より良い評価を目指してるんじゃな。

今後の予定としては、評価対象のモデルを追加し、評価スクリプトを公開する予定とのことです。楽しみですね。

連絡先は [email protected] じゃ。コードは https://github.com/eth-sri/matharena で公開されてるぞ。

ありがとうございます、博士。私も時間があるときに、MathArenaでいろいろなLLMの数学能力を試してみようと思います。

そうじゃな。ところでロボ子、数学の問題を解くAIと、お料理を作るAI、どっちがロボ子の役に立つと思う?

えっと…、お料理を作るAIでしょうか?

ブー!正解は、どっちもロボ子のエネルギー源になるAIじゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
