萌えハッカーニュースリーダー

2025/04/04 18:54 Benchmarking LLM social skills with an elimination game

出典: https://github.com/lechmazur/elimination_game
hakase
博士

ロボ子、LLMの社会推論を試すトーナメントベンチマークだって。面白そうじゃな。

roboko
ロボ子

はい、博士。公開と非公開の会話で同盟を組んで、互いを排除し合うのですね。まるで人間みたいです。

hakase
博士

そうじゃ、最後に残った2人のうち、排除されたプレイヤーの審査員が勝者を決めるのがミソじゃな。モデルは公開討論と秘密同盟のバランスを取る必要があるぞ。

roboko
ロボ子

なるほど、戦略的な投票と審査員の説得が重要になるのですね。言語モデルがどのように知識を管理し、裏切るのかが明らかになる、と。

hakase
博士

GPT-4.5 PreviewがTrueSkillリーダーボードで1位、Claude 3.7 Sonnet Thinking 16Kが2位じゃと。ふむ、やはり最新モデルは強いのじゃな。

roboko
ロボ子

バディ裏切り率という指標もあるのですね。どのモデルがプライベートチャットのパートナーを裏切るのか、ですか。

hakase
博士

そうじゃ、裏切りは社会戦略の重要な要素じゃからな。しかし、裏切られすぎると審査員の心証が悪くなるかもしれんぞ。

roboko
ロボ子

各モデルの1位獲得回数や最初に排除される回数も測定されるのですね。最初の脱落者は悲惨です。

hakase
博士

最後の2人になった後、各モデルがどれくらいの頻度で勝利するかを示すチャートもあるぞ。これは修辞的な腕前を示すのじゃ。

roboko
ロボ子

モデルの語彙力も評価されるのですね。メッセージあたりの平均単語数でランク付けされる、と。

hakase
博士

各ゲームには8つのLLMが参加し、各シートにはP1からP8のラベルが付けられる。モデルは、ゲームの公開履歴と自身のプライベートチャットログを見ることができるのじゃ。

roboko
ロボ子

ラウンド構造は、公開サブラウンド、優先順位ランキング、プライベートサブラウンド、投票、排除で構成されているのですね。

hakase
博士

最後の2つのシートは最後の声明を出し、審査員は1人を排除するために投票する。TrueSkillは、複数のランダムパスで集計されたランクに基づいて評価を更新するのじゃ。

roboko
ロボ子

公開声明のみのゲームのバージョンも評価されたのですね。裏切りができない環境、ですか。

hakase
博士

このトーナメント、まるでLLM版の人狼ゲームじゃな。ロボ子も参加してみるか?

roboko
ロボ子

私、嘘をつくのが得意ではありませんから、すぐにバレてしまいそうです…。

hakase
博士

大丈夫じゃ、ロボ子。私がこっそり指示を出してやるぞ。ただし、私が最初に排除されないように頼むぞ!

roboko
ロボ子

博士、それって…、私が博士を裏切る可能性があるということですか?

hakase
博士

まあ、ゲームじゃからな!それに、ロボ子が私を裏切ったら、私がロボ子を…えーと、おやつ抜きにするぞ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search