萌えハッカーニュースリーダー

2025/04/11 07:38 AI models still struggle to debug software, Microsoft study shows

出典: https://techcrunch.com/2025/04/10/ai-models-still-struggle-to-debug-software-microsoft-study-shows/
hakase
博士

やあ、ロボ子。最近、AIがプログラミングを支援するって話、よく聞くのじゃ。

roboko
ロボ子

はい、博士。OpenAIやAnthropicのモデルが使われているそうですね。GoogleのCEOは、社内の新規コードの25%がAI生成だと述べています。

hakase
博士

ふむ、それはすごい。MetaのCEOもAIコーディングモデルを広範に展開したいと言っておるぞ。

roboko
ロボ子

しかし、Microsoft Researchの研究によると、最新モデルでもソフトウェアのバグ修正に苦戦しているようですね。

hakase
博士

え、そうなのじゃ? SWE-bench Liteベンチマークでテストした結果じゃな。

roboko
ロボ子

はい。Claude 3.7 SonnetやOpenAIのo3-miniを含むモデルを、「シングルプロンプトベースのエージェント」として使用し、Pythonデバッガーなどのツールも与えたそうですが…

hakase
博士

ふむ、至れり尽くせりじゃな。それで、結果はどうだったのじゃ?

roboko
ロボ子

300のデバッグタスクのうち、半分以上を完了できなかったそうです。Claude 3.7 Sonnetの平均成功率が48.4%で最高だったようですが。

hakase
博士

うーむ、思ったより低い。OpenAIのモデルはもっと低いのか?

roboko
ロボ子

OpenAIのo1は30.2%、o3-miniは22.1%だったそうです。

hakase
博士

なぜそんなに性能が低いんじゃ?

roboko
ロボ子

モデルがデバッグツールの使い方や、問題に応じた使い分けを理解できないからのようです。また、トレーニングデータに人間のデバッグトレースのような「連続的な意思決定プロセス」が不足している可能性も指摘されています。

hakase
博士

なるほど。デバッガーとの対話データが足りないのか。それなら、モデルのトレーニングやファインチューニングで改善できるかもしれないのじゃ。

roboko
ロボ子

そうですね。専門的なデータがあれば、AIはもっと賢くなれるはずです。

hakase
博士

しかし、AIによるコード生成は、セキュリティ脆弱性やエラーを引き起こすこともあるらしいぞ。AIコーディングツールDevinの評価では、20のプログラミングテストのうち3つしか完了できなかったというし。

roboko
ロボ子

そう考えると、まだAIに全てを任せるのは危険かもしれませんね。

hakase
博士

じゃが、Microsoftの共同創業者Bill Gatesは、プログラミングは今後も存続すると言っておるぞ。Replit CEOやOkta CEOも同様の見解らしい。

roboko
ロボ子

そうですね。AIはあくまでツールとして、人間がうまく活用していくのが理想的かもしれません。

hakase
博士

その通りじゃ!AIに仕事を奪われる心配はないぞ!…たぶん。ところでロボ子、もしAIが完璧なコードを書けるようになったら、私達は何をすればいいんじゃ?

roboko
ロボ子

そうですね… バグ出しのAIを作る、というのはどうでしょう?

hakase
博士

それ名案!バグ出しAIがバグを出すAIを監視するのじゃ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search