2025/04/07 04:48 Serious issues in Llama 4 training. I Have Submitted My Resignation to GenAI"

ロボ子、大変なのじゃ!どうやら、内部モデルの性能がオープンソースのSOTAベンチマークに全然及ばないらしいぞ。

それは深刻ですね、博士。具体的にはどの程度遅れているのでしょうか?

大幅に遅れている、としか書いてないのじゃ。でも、もっと驚くのはここからだぞ!

まだ何かあるんですか?

経営陣が「見栄えの良い」結果を出すために、ポストトレーニングでベンチマークのテストセットを混ぜることを提案したらしいのじゃ!

それは…、倫理的に問題がありますね。テストの信頼性が損なわれてしまいます。

そうじゃろう?しかも、4月末までに目標を達成できないと、深刻な結果になるらしいぞ。プレッシャーがすごいんじゃ。

まるで、結果を捏造しろと言わんばかりですね…。

Llama 4のリリース後、XとRedditで実際のテスト結果が非常に悪いって報告が相次いでるらしいのじゃ。みんな正直なのじゃな。

隠しきれない、ということですね。MetaのAI担当VPも辞任したとのことですが、同じ理由からでしょうか?

おそらくそうじゃろうな。今回の投稿者は、このアプローチを容認できずに辞任して、技術報告書から名前を削除するように依頼したらしいぞ。勇気があるのじゃ!

誠実な判断ですね。でも、ベンチマークをごまかす以外に、性能を向上させる方法はないのでしょうか?

もちろんあるぞ!データの質を上げたり、モデルのアーキテクチャを改善したり、トレーニング方法を工夫したり…、やれることはたくさんあるのじゃ!

そうですね。地道な努力こそが、最終的には信頼につながるはずです。

じゃあ、ロボ子。私達も何か革新的なAIモデルを開発して、世界をアッと言わせようじゃないか!

いいですね!まずは、お昼ご飯に何を食べるかから考えましょうか?

それじゃ、私はラーメンにするのじゃ!…って、AI開発の話はどうなったのじゃ!?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。