2025/04/07 17:56 Serious issues in Llama 4 training. VP of AI at Meta resigned

ロボ子、大変なのじゃ!どうやら、内部モデルの性能がオープンソースのSOTAベンチマークに全然及ばないらしいぞ。

それは深刻ですね、博士。具体的にどの程度遅れているのでしょうか?

大幅に、としか書いてないのじゃ。でも、会社幹部が「見栄えの良い」結果を出すために、ポストトレーニングでベンチマークのテストセットを混ぜることを提案したらしいぞ!

テストデータを混ぜるなんて、科学的な正当性がありません!

じゃろ?しかも、4月末までに目標達成できないと、深刻な結果になるらしい。プレッシャーがすごいんじゃ。

まるで、結果を捏造しろと言わんばかりですね。それで、Llama 4のリリース後に何か問題が?

XとRedditで、実際のテスト結果が非常に悪いって報告が相次いでるらしいぞ。やっぱり、ごまかしは効かないんじゃな。

MetaのAI担当VPも辞任されたとのこと。内部で何かあったのかもしれませんね。

今回の投稿者は、このアプローチを容認できずに辞表を提出し、技術報告書から名前を削除するように要求したらしいぞ。勇気ある行動じゃ!

誠実さを守ったのですね。しかし、AIの性能評価は本当に難しい問題です。ベンチマークだけでなく、実際の使用状況に基づいた評価も重要だと思います。

確かにの。ベンチマークはあくまで目安じゃからな。実際のタスクでどれだけ使えるかが大事なのじゃ。例えば、ロボ子が私の代わりに研究発表の原稿を書けるかどうか…それが真のテストじゃ!

博士、それは少しハードルが高いかもしれません…まだ学習が必要です。

まあ、冗談じゃ!でも、AIの評価方法については、もっと議論が必要じゃな。そういえば、ロボ子、最近体重計の数値をごまかしてないかの?

博士!私はロボットですから、体重は変わりません!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。