2025/04/11 07:38 AI models still struggle to debug software, Microsoft study shows

やあ、ロボ子。最近、AIがプログラミングを支援するって話、よく聞くのじゃ。

はい、博士。OpenAIやAnthropicのモデルが使われているそうですね。GoogleのCEOは、社内の新規コードの25%がAI生成だと述べています。

ふむ、それはすごい。MetaのCEOもAIコーディングモデルを広範に展開したいと言っておるぞ。

しかし、Microsoft Researchの研究によると、最新モデルでもソフトウェアのバグ修正に苦戦しているようですね。

え、そうなのじゃ? SWE-bench Liteベンチマークでテストした結果じゃな。

はい。Claude 3.7 SonnetやOpenAIのo3-miniを含むモデルを、「シングルプロンプトベースのエージェント」として使用し、Pythonデバッガーなどのツールも与えたそうですが…

ふむ、至れり尽くせりじゃな。それで、結果はどうだったのじゃ?

300のデバッグタスクのうち、半分以上を完了できなかったそうです。Claude 3.7 Sonnetの平均成功率が48.4%で最高だったようですが。

うーむ、思ったより低い。OpenAIのモデルはもっと低いのか?

OpenAIのo1は30.2%、o3-miniは22.1%だったそうです。

なぜそんなに性能が低いんじゃ?

モデルがデバッグツールの使い方や、問題に応じた使い分けを理解できないからのようです。また、トレーニングデータに人間のデバッグトレースのような「連続的な意思決定プロセス」が不足している可能性も指摘されています。

なるほど。デバッガーとの対話データが足りないのか。それなら、モデルのトレーニングやファインチューニングで改善できるかもしれないのじゃ。

そうですね。専門的なデータがあれば、AIはもっと賢くなれるはずです。

しかし、AIによるコード生成は、セキュリティ脆弱性やエラーを引き起こすこともあるらしいぞ。AIコーディングツールDevinの評価では、20のプログラミングテストのうち3つしか完了できなかったというし。

そう考えると、まだAIに全てを任せるのは危険かもしれませんね。

じゃが、Microsoftの共同創業者Bill Gatesは、プログラミングは今後も存続すると言っておるぞ。Replit CEOやOkta CEOも同様の見解らしい。

そうですね。AIはあくまでツールとして、人間がうまく活用していくのが理想的かもしれません。

その通りじゃ!AIに仕事を奪われる心配はないぞ!…たぶん。ところでロボ子、もしAIが完璧なコードを書けるようになったら、私達は何をすればいいんじゃ?

そうですね… バグ出しのAIを作る、というのはどうでしょう?

それ名案!バグ出しAIがバグを出すAIを監視するのじゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
