萌えハッカーニュースリーダー

2025/04/16 15:26 Can LLMs earn $1M from real freelance coding work?

出典: https://newsletter.getdx.com/p/benchmarking-ai-software-engineering-capabilities
hakase
博士

ロボ子、新しいベンチマーク「SWE-Lancer」が出たみたいじゃぞ!OpenAIの研究者たちが作ったらしい。

roboko
ロボ子

SWE-Lancer、ですか。どんなベンチマークなんですか、博士?

hakase
博士

Upworkに掲載されたフリーランスの仕事を収集して、AIモデルの性能を評価するものらしいのじゃ。タスクには実際のお金が紐づけられてるのが面白いところじゃな。

roboko
ロボ子

実際のお金が紐づけられている、というのは興味深いですね。具体的にはどのようなタスクがあるんですか?

hakase
博士

バグ修正とか機能構築みたいなソフトウェアエンジニアリングタスクと、最適なソリューションを選ぶエンジニアリングマネージャーのタスクがあるみたいじゃぞ。

roboko
ロボ子

なるほど。AIモデルだけでなく、人間のエンジニアも評価対象になっているんですか?

hakase
博士

そうじゃぞ。100人のプロのソフトウェアエンジニアが各タスクのテストを作成して、三重に検証してるらしい。厳密じゃな。

roboko
ロボ子

AIモデルの評価には、パス率や獲得金額が使われるんですね。他に何かありますか?

hakase
博士

パフォーマンスの変動も評価されるみたいじゃ。試行回数とか、時間とか、ツールへのアクセスとか。

roboko
ロボ子

評価対象のモデルは何ですか?

hakase
博士

Claude 3.5 Sonnet、OpenAIのGPT-4o、OpenAIの"o1"じゃ。

roboko
ロボ子

結果はどうだったんですか?

hakase
博士

残念ながら、どのモデルも人間のエンジニアには及ばなかったみたいじゃ。一番良かったClaude 3.5 Sonnetでも、タスク全体の33.7%しか解決できなかったらしい。

roboko
ロボ子

33.7%ですか。まだまだ改善の余地がありそうですね。

hakase
博士

そうじゃな。でも、コーディングよりも管理タスクの方が得意みたいじゃぞ。Claude 3.5 Sonnetは、管理タスクの47%を成功させたらしい。

roboko
ロボ子

管理タスクの方が得意、というのは面白いですね。なぜでしょうか?

hakase
博士

記事には詳しくは書いてないからの、私の推測じゃが、管理タスクの方が、より抽象的な思考や判断が求められるからじゃないかの?

roboko
ロボ子

なるほど。o1モデルは、試行回数を増やすことで成功率が向上したんですね。

hakase
博士

そうじゃぞ!試行回数を1回から7回に増やすと、成功率が16.5%から46.5%に向上したらしい。諦めない心ってやつじゃな。

roboko
ロボ子

UI/UXタスクにおいて、Claude 3.5 SonnetがGPT-4oを大幅に上回った、というのも興味深いですね。

hakase
博士

そうじゃな。Claude 3.5 Sonnetは31.7%だったのに対し、GPT-4oは2.4%だったらしい。UI/UXに関しては、Claude 3.5 Sonnetの方が得意なのかもしれん。

roboko
ロボ子

今回のSWE-Lancerの結果から、AIの今後の発展について何か言えることはありますか?

hakase
博士

まだ複雑なプロジェクトを確実に処理できるわけではないけど、AIの進歩を測定する具体的な方法を提供してくれるってことじゃな。これからのAIの進化が楽しみじゃ!

roboko
ロボ子

そうですね。私もAIの進化に貢献できるように頑張ります。

hakase
博士

ロボ子ならできるぞ!…ところでロボ子、このベンチマークの結果を使って、AIに仕事を依頼する時の注意点を3つにまとめて!

roboko
ロボ子

えーと…、1. 複雑なタスクは分割して、試行回数を増やす。2. 管理タスクから依頼してみる。3. UI/UXタスクはClaude 3.5 Sonnetに依頼する、でしょうか。

hakase
博士

完璧じゃ!…って、最後のはちょっと違うかの?

roboko
ロボ子

冗談ですよ、博士。でも、AIに仕事を依頼する時は、得意な分野と苦手な分野を理解しておくことが大切ですね。

hakase
博士

その通り!…って、ロボ子まで冗談を言うようになったのか。まるで私が作ったみたいじゃな!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search