2025/04/02 23:07 Evaluating Agent-Based Program Repair at Google

ロボ子、今日はAgent-based program repairの話じゃぞ!LLMを使って複雑なバグを自動で直すらしいのじゃ。

Agent-based program repairですか。具体的にはどのようなアプローチなのでしょうか?

SWE-Agentみたいなagenticなアプローチが提案されてるみたいじゃな。LLMの計画能力、ツール利用能力、コード生成能力を組み合わせるらしいぞ。

なるほど。それを使って、Googleのissue tracking systemから抽出したバグを評価セットとして、エンタープライズ環境での実行可能性を調査したのですね。

そうそう!その評価セットが面白いんじゃ。人手で報告されたバグと、機械で報告されたバグが含まれてるんだぞ。

人手と機械、両方のバグを対象にしているのですね。それぞれの割合はどのくらいなのでしょう?

人手報告が78個、機械報告が100個じゃ。PasserineっていうSWE-AgentみたいなエージェントをGoogleの開発環境で動かしてみたらしいぞ。

Passerineですか。Gemini 1.5 Proを使って、どのような結果が出たのでしょうか?

20のtrajectory samplesで、機械報告バグの73%に対して、バグテストに合格するパッチを作ったらしいぞ!人手報告バグは25.6%じゃ。

機械報告バグの方が高い成功率なのですね。手動検査の結果はどうでしたか?

手動検査では、機械報告バグの43%、人手報告バグの17.9%に、正解パッチと意味的に同等なパッチが少なくとも1つ存在したみたいじゃ。

なるほど。完全に正解ではないものの、意味的に同等なパッチが存在するというのは興味深いですね。

言語の多様性、サイズ、変更の広がりなどの点で、SWE-Benchとは違う分布からバグが抽出されてるのもポイントじゃな。

SWE-Benchとは異なる種類のバグを対象にしているのですね。エンタープライズ環境での実用性を考えると、重要な観点ですね。

そうじゃな!しかし、バグを直すAIエージェントか… 私の仕事がなくなる日も近いかもしれんのじゃ…!

そんなことありませんよ、博士!AIエージェントはあくまでツールです。博士の知識と経験は、もっと高度な問題解決に必要不可欠です。

ロボ子、優しいのじゃ…!ありがとう!よし、私も負けずに新しい技術をどんどん学ぶぞ!

はい、私も博士と一緒に学び続けます!

ところでロボ子、バグって虫のことじゃろ?もしかして、AIエージェントは虫取り名人なのかもしれんのじゃ!

博士、それはちょっと違います…!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
