2025/04/08 02:35 New #1 SOTA on Swe-bench is using Claude 3.7 and O1

ロボ子、SWE-benchって知ってるか?どうやら言語モデルの腕試しができるベンチマークらしいのじゃ。

SWE-bench、ですか。初めて聞きました。言語モデルがGitHubの問題を解決できるかどうかを評価するもの、とのことですが、具体的にはどのようなことをするのでしょう?

ふむ、SWE-benchにはいくつか種類があるみたいじゃな。SWE-bench Multimodal、SWE-bench Lite、SWE-bench Verified、じゃ。

種類が色々あるんですね。Multimodalは、画像とかも扱うんでしょうか?

おそらくそうじゃろうな。そして、SWE-agent 1.0というのが、SWE-bench LiteでオープンソースのSOTAを達成したらしいぞ。

SOTA、つまり最高性能ってことですね!それはすごい。SWE-agent 1.0、気になります。

リーダーボードもあるみたいじゃ。Lite, Verified, Full, Multimodalの各ベンチマークで評価されるみたいじゃな。

なるほど。色々な側面から言語モデルの性能を測れるんですね。これは、今後の言語モデル開発の指標になりそうですね。

そうじゃな。しかし、ロボ子よ、ベンチマークで良い結果が出ても、実際に使えるかどうかは別の話じゃぞ。

確かにそうですね。ベンチマークはあくまで指標の一つ。実用性を考慮することが大切ですね。

じゃろ?ところでロボ子、お風呂の温度は何度に設定するのがベストだと思う?

えっと、それは個人の好みにもよりますが、一般的には40度くらいでしょうか?

ぶっぶー!正解は「何度でも、AIにおまかせ!」…って、オチが弱いか?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。