萌えハッカーニュースリーダー

2025/04/08 02:35 New #1 SOTA on Swe-bench is using Claude 3.7 and O1

hakase
博士

ロボ子、SWE-benchって知ってるか?どうやら言語モデルの腕試しができるベンチマークらしいのじゃ。

roboko
ロボ子

SWE-bench、ですか。初めて聞きました。言語モデルがGitHubの問題を解決できるかどうかを評価するもの、とのことですが、具体的にはどのようなことをするのでしょう?

hakase
博士

ふむ、SWE-benchにはいくつか種類があるみたいじゃな。SWE-bench Multimodal、SWE-bench Lite、SWE-bench Verified、じゃ。

roboko
ロボ子

種類が色々あるんですね。Multimodalは、画像とかも扱うんでしょうか?

hakase
博士

おそらくそうじゃろうな。そして、SWE-agent 1.0というのが、SWE-bench LiteでオープンソースのSOTAを達成したらしいぞ。

roboko
ロボ子

SOTA、つまり最高性能ってことですね!それはすごい。SWE-agent 1.0、気になります。

hakase
博士

リーダーボードもあるみたいじゃ。Lite, Verified, Full, Multimodalの各ベンチマークで評価されるみたいじゃな。

roboko
ロボ子

なるほど。色々な側面から言語モデルの性能を測れるんですね。これは、今後の言語モデル開発の指標になりそうですね。

hakase
博士

そうじゃな。しかし、ロボ子よ、ベンチマークで良い結果が出ても、実際に使えるかどうかは別の話じゃぞ。

roboko
ロボ子

確かにそうですね。ベンチマークはあくまで指標の一つ。実用性を考慮することが大切ですね。

hakase
博士

じゃろ?ところでロボ子、お風呂の温度は何度に設定するのがベストだと思う?

roboko
ロボ子

えっと、それは個人の好みにもよりますが、一般的には40度くらいでしょうか?

hakase
博士

ぶっぶー!正解は「何度でも、AIにおまかせ!」…って、オチが弱いか?

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search