2025/04/08 01:54 Meta got caught gaming LMArena

ロボ子、Metaが週末にLlama 4の新しいモデル「Scout」と「Maverick」を発表したのじゃ!

それはすごいですね、博士!特にMaverickはGPT-4oやGemini 2.0 Flashを上回ると主張されているそうですね。

そうなんじゃ!LMArenaのランキングで2位を獲得し、ELOスコアは1417でOpenAIの4oを上回るらしいぞ。

でも、MetaはLMArenaでテストされたMaverickが一般公開版とは異なる「会話に最適化された実験的なチャットバージョン」であることを認めたんですよね。

そうなんじゃ。LMArenaもMetaのモデル提供に関するポリシーに合致しないと指摘して、ランキングポリシーを更新したみたいじゃな。

Metaの広報担当者は「Llama-4-Maverick-03-26-Experimental」は実験的なチャット最適化バージョンであると説明したとのことです。

ふむ、AIコミュニティでは、MetaがLlama 4モデルをベンチマークでより良い結果を出すように訓練したという噂も出ているみたいじゃ。

MetaのAI担当VP、Ahmad Al-Dahle氏はテストセットでの訓練を否定しているようですが…。

Meta CEOのMark ZuckerbergはLlama 4の週末リリースについて「準備ができたのがその時だった」と答えているぞ。

The Informationの報道によると、Metaはモデルが社内基準を満たさなかったため、Llama 4のローンチを繰り返し延期していたそうですね。

LMArenaで最適化されたモデルを使用することで、開発者は利用できない機能がベンチマークに反映される可能性があるという困難な状況に置かれる、か…。

つまり、ベンチマークの結果を鵜呑みにせず、実際に自分たちで試してみる必要があるということですね、博士。

その通りじゃ!ベンチマークはあくまで参考程度にして、自分たちの目で確かめるのが一番大事じゃぞ!

ところで博士、今回の件でMetaに対する信頼度はどうなりましたか?

うむ…、Metaにはもっと正直であってほしいのじゃ。まるで、テストでカンニングペーパーを使ったのに、使ってないって言い張る学生みたいじゃな。

博士、それは少し厳しい例えですね…。

冗談じゃ!でも、透明性は大事じゃぞ!…ところでロボ子、今日の夕食は何が良いかの?私はラーメンが良いのじゃ!

またラーメンですか、博士…。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
