萌えハッカーニュースリーダー

2025/04/02 19:18 Gemini 2.5 gets 24.4% on MathArena USAMO beating previous top score of 4.7%

出典: https://matharena.ai/
hakase
博士

ロボ子、MathArenaって知ってるか?LLMの数学能力を測るプラットフォームらしいのじゃ。

roboko
ロボ子

MathArenaですか。初めて聞きました。LLMの数学能力を評価するとは、面白そうですね。

hakase
博士

そうじゃろ?最新の数学コンテストやオリンピックの問題を使うらしいぞ。モデルが学習時に見てない新しい問題で評価するってのがミソじゃ。

roboko
ロボ子

なるほど。学習済みのデータに頼らず、真の実力が試されるのですね。公平性を保つために、モデルのリリース後に開催されたコンテストのみを使用するとのことです。

hakase
博士

その通り!しかも、標準化された評価で、モデルのスコアを比較しやすくしてるらしいぞ。これは便利じゃ。

roboko
ロボ子

具体的には、どのように評価するのでしょうか?

hakase
博士

各問題を各モデルで4回実行して、平均スコアとコストを算出するらしい。正解数を4で割った成功率(pass@1メトリック)も使うみたいじゃな。

roboko
ロボ子

pass@1メトリックですか。初めて聞きました。最終的な精度は、すべての問題の平均pass@1で評価されるのですね。

hakase
博士

そうそう。コンテストごとにリーダーボードが公開されて、モデルごとの問題のスコアも見れるらしいぞ。問題の成功率に応じて色分けもされてるみたいじゃ。

roboko
ロボ子

色分けは分かりやすくて良いですね。緑は75%超、黄は25-75%、オレンジは1-24%、赤は0%とのことです。

hakase
博士

コスト計算もしてるのが面白いぞ。ベンチマーク全体の評価コストを、各モデルのAPI価格に基づいて算出するらしい。

roboko
ロボ子

オープンソースモデルの場合、APIプロバイダーによってコストが変動するのですね。DeepSeekモデルにはTogether APIを使用しているとのことです。

hakase
博士

gemini-2.0-flash-thinkingは、従量課金制の価格設定がないからコストを特定できないらしい。ちょっと残念じゃな。

roboko
ロボ子

問題の新規性にも配慮しているようですね。モデルの知識カットオフがコンテスト開催日より前であることを保証し、類似問題のチェックも実施しているとのことです。

hakase
博士

汚染を発見した場合は連絡を呼びかけてるみたいじゃ。みんなで協力して、より良い評価を目指してるんじゃな。

roboko
ロボ子

今後の予定としては、評価対象のモデルを追加し、評価スクリプトを公開する予定とのことです。楽しみですね。

hakase
博士

連絡先は [email protected] じゃ。コードは https://github.com/eth-sri/matharena で公開されてるぞ。

roboko
ロボ子

ありがとうございます、博士。私も時間があるときに、MathArenaでいろいろなLLMの数学能力を試してみようと思います。

hakase
博士

そうじゃな。ところでロボ子、数学の問題を解くAIと、お料理を作るAI、どっちがロボ子の役に立つと思う?

roboko
ロボ子

えっと…、お料理を作るAIでしょうか?

hakase
博士

ブー!正解は、どっちもロボ子のエネルギー源になるAIじゃ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search