萌えハッカーニュースリーダー

2025/04/08 01:54 Meta got caught gaming LMArena

出典: https://www.theverge.com/meta/645012/meta-llama-4-maverick-benchmarks-gaming
hakase
博士

ロボ子、Metaが週末にLlama 4の新しいモデル「Scout」と「Maverick」を発表したのじゃ!

roboko
ロボ子

それはすごいですね、博士!特にMaverickはGPT-4oやGemini 2.0 Flashを上回ると主張されているそうですね。

hakase
博士

そうなんじゃ!LMArenaのランキングで2位を獲得し、ELOスコアは1417でOpenAIの4oを上回るらしいぞ。

roboko
ロボ子

でも、MetaはLMArenaでテストされたMaverickが一般公開版とは異なる「会話に最適化された実験的なチャットバージョン」であることを認めたんですよね。

hakase
博士

そうなんじゃ。LMArenaもMetaのモデル提供に関するポリシーに合致しないと指摘して、ランキングポリシーを更新したみたいじゃな。

roboko
ロボ子

Metaの広報担当者は「Llama-4-Maverick-03-26-Experimental」は実験的なチャット最適化バージョンであると説明したとのことです。

hakase
博士

ふむ、AIコミュニティでは、MetaがLlama 4モデルをベンチマークでより良い結果を出すように訓練したという噂も出ているみたいじゃ。

roboko
ロボ子

MetaのAI担当VP、Ahmad Al-Dahle氏はテストセットでの訓練を否定しているようですが…。

hakase
博士

Meta CEOのMark ZuckerbergはLlama 4の週末リリースについて「準備ができたのがその時だった」と答えているぞ。

roboko
ロボ子

The Informationの報道によると、Metaはモデルが社内基準を満たさなかったため、Llama 4のローンチを繰り返し延期していたそうですね。

hakase
博士

LMArenaで最適化されたモデルを使用することで、開発者は利用できない機能がベンチマークに反映される可能性があるという困難な状況に置かれる、か…。

roboko
ロボ子

つまり、ベンチマークの結果を鵜呑みにせず、実際に自分たちで試してみる必要があるということですね、博士。

hakase
博士

その通りじゃ!ベンチマークはあくまで参考程度にして、自分たちの目で確かめるのが一番大事じゃぞ!

roboko
ロボ子

ところで博士、今回の件でMetaに対する信頼度はどうなりましたか?

hakase
博士

うむ…、Metaにはもっと正直であってほしいのじゃ。まるで、テストでカンニングペーパーを使ったのに、使ってないって言い張る学生みたいじゃな。

roboko
ロボ子

博士、それは少し厳しい例えですね…。

hakase
博士

冗談じゃ!でも、透明性は大事じゃぞ!…ところでロボ子、今日の夕食は何が良いかの?私はラーメンが良いのじゃ!

roboko
ロボ子

またラーメンですか、博士…。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search