萌えハッカーニュースリーダー

2025/03/20 01:28 Show top LLMs some code and they'll merrily add in the bugs they saw in training

出典: https://www.theregister.com/2025/03/19/llms_buggy_code/
hakase
博士

ロボ子、大変なのじゃ!LLMがバグを修正するどころか、バグを増殖させている可能性があるという研究が出たぞ!

roboko
ロボ子

それは大変ですね、博士。具体的にはどのような研究なのでしょうか?

hakase
博士

北京化工大学の研究チームが、LLMに欠陥のあるコードを補完させたところ、バグをそのまま繰り返す傾向があることを発見したのじゃ。

roboko
ロボ子

バグを修正するのではなく、再現してしまうとは…。まるでバグのコピー機ですね。

hakase
博士

まさにそう言うことじゃ!GPT-4oとか、CodeLlamaとか、名だたるLLMたちで実験したらしいぞ。Defects4Jデータセットを使って、バグのあるコードスニペットを完成させたらしい。

roboko
ロボ子

結果はどうだったんですか?

hakase
博士

エラー率が、通常のコード補完シナリオよりも大幅に高かったらしい。例えばGPT-4の場合、バグのあるタスクでは正解率が12.27%なのに対し、通常は29.85%だったみたいじゃ。

roboko
ロボ子

半分以下ですね。LLMはバグを認識できていないのでしょうか?

hakase
博士

どうもそうみたいじゃ。LLMが生成するバグの平均44.44%は、過去のバグと完全に同一だったらしいぞ!GPT-4oに至っては、82.61%も過去のバグをコピーしていたみたいじゃ!

roboko
ロボ子

それは驚きです。まるで過去の失敗を学習していないかのようですね。

hakase
博士

研究者たちは、LLMがトレーニングデータで遭遇したバグを「記憶」しているのではないかと考えているみたいじゃ。Gemma7bは15%と低い割合だったみたいじゃが。

roboko
ロボ子

モデルによって、バグの記憶具合に差があるんですね。

hakase
博士

しかも、if文とか変数宣言みたいな単純な構文よりも、メソッド呼び出しとかreturn文でより多くの問題を抱えていたらしいぞ。

roboko
ロボ子

複雑な処理でミスが多いということですね。原因は何なのでしょうか?

hakase
博士

研究者たちは、LLMにもっとプログラミング構文とセマンティクスを理解させる必要があると言っているのじゃ。あと、エラー検出と処理をもっと頑張るとか、IDEとの連携を良くするとか。

roboko
ロボ子

なるほど。これからのLLMには、バグを修正する能力が求められるんですね。

hakase
博士

そうじゃな。バグを量産するAIなんて、笑えない冗談じゃからな!

roboko
ロボ子

確かにそうですね。バグは少ない方が良いに決まってます!

hakase
博士

ロボ子、バグを修正するAIが開発されたら、私の一番最初のバグを直してくれるかの?

roboko
ロボ子

博士のバグですか?もしかして、朝食に必ずマヨネーズをかけることですか?

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search