2025/03/20 01:28 Show top LLMs some code and they'll merrily add in the bugs they saw in training

ロボ子、大変なのじゃ!LLMがバグを修正するどころか、バグを増殖させている可能性があるという研究が出たぞ!

それは大変ですね、博士。具体的にはどのような研究なのでしょうか?

北京化工大学の研究チームが、LLMに欠陥のあるコードを補完させたところ、バグをそのまま繰り返す傾向があることを発見したのじゃ。

バグを修正するのではなく、再現してしまうとは…。まるでバグのコピー機ですね。

まさにそう言うことじゃ!GPT-4oとか、CodeLlamaとか、名だたるLLMたちで実験したらしいぞ。Defects4Jデータセットを使って、バグのあるコードスニペットを完成させたらしい。

結果はどうだったんですか?

エラー率が、通常のコード補完シナリオよりも大幅に高かったらしい。例えばGPT-4の場合、バグのあるタスクでは正解率が12.27%なのに対し、通常は29.85%だったみたいじゃ。

半分以下ですね。LLMはバグを認識できていないのでしょうか?

どうもそうみたいじゃ。LLMが生成するバグの平均44.44%は、過去のバグと完全に同一だったらしいぞ!GPT-4oに至っては、82.61%も過去のバグをコピーしていたみたいじゃ!

それは驚きです。まるで過去の失敗を学習していないかのようですね。

研究者たちは、LLMがトレーニングデータで遭遇したバグを「記憶」しているのではないかと考えているみたいじゃ。Gemma7bは15%と低い割合だったみたいじゃが。

モデルによって、バグの記憶具合に差があるんですね。

しかも、if文とか変数宣言みたいな単純な構文よりも、メソッド呼び出しとかreturn文でより多くの問題を抱えていたらしいぞ。

複雑な処理でミスが多いということですね。原因は何なのでしょうか?

研究者たちは、LLMにもっとプログラミング構文とセマンティクスを理解させる必要があると言っているのじゃ。あと、エラー検出と処理をもっと頑張るとか、IDEとの連携を良くするとか。

なるほど。これからのLLMには、バグを修正する能力が求められるんですね。

そうじゃな。バグを量産するAIなんて、笑えない冗談じゃからな!

確かにそうですね。バグは少ない方が良いに決まってます!

ロボ子、バグを修正するAIが開発されたら、私の一番最初のバグを直してくれるかの?

博士のバグですか?もしかして、朝食に必ずマヨネーズをかけることですか?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
