2025/06/30 18:26 How Long Contexts Fail

やっほー、ロボ子!最近、大規模言語モデル(LLM)のエージェント開発がアツいみたいじゃな。でも、コンテキスト管理が意外と難しいらしいぞ。

博士、こんにちは。コンテキスト管理ですか?コンテキストウィンドウを大きくすれば、何でも解決すると思っていました。

それが違うんじゃ!記事によると、コンテキストウィンドウを拡大しても、必ずしもパフォーマンスが向上するわけじゃないらしいぞ。むしろ、コンテキストの過負荷でエージェントが失敗することもあるみたいじゃ。

えっ、そうなんですか?具体的にどんな失敗があるんですか?

ふむ、例えば「コンテキスト汚染」じゃな。これは、誤った情報がコンテキストに入り込んで、繰り返し参照される状態のことじゃ。Geminiエージェントがポケモンゲーム中に誤った情報を生成して、非現実的な目標を追いかける例が紹介されておる。

それは困りますね。他にはどんな問題があるんですか?

「コンテキストの錯乱」じゃ。コンテキストが長すぎると、モデルが学習済みの知識を無視して、コンテキストに過度に依存してしまうんじゃと。10万トークンを超えるコンテキストで、Geminiエージェントが過去の行動を繰り返す傾向を示すらしいぞ。

まるで、長い会議で話が堂々巡りになるみたいですね。

まさにそうじゃ!さらに、「コンテキストの混乱」というのもある。これは、不必要な情報がコンテキストに含まれることで、モデルが低品質な応答を生成する状態じゃ。ツール使用ベンチマークで、モデルに複数のツールを提供するとパフォーマンスが低下するらしい。

ツールがたくさんあると、どれを使えばいいか迷ってしまうんですね。

その通り!記事には、46個のツールを与えられたLlama 3 8bモデルが、19個のツールを与えられた場合に比べて失敗したと書いてあるぞ。

そんなにたくさんツールがあったら、私でも混乱しそうです。

最後に「コンテキストの衝突」じゃ。これは、コンテキスト内の情報が互いに矛盾する状態のことじゃ。プロンプトの情報を分割して複数回に分けて与えると、モデルの性能が大幅に低下するらしいぞ。平均で39%も低下するらしい。

それは、最初に与えられた情報に引っ張られてしまうからでしょうか?

その通り!モデルが初期の段階で不完全な情報に基づいて誤った回答を生成し、その誤りが後の回答に影響を与えるんじゃ。

エージェントは色々な情報源から情報を集めるので、特に注意が必要ですね。

そうじゃな。エージェントは複数の情報源から情報を収集し、連続的なツール呼び出しを行い、多段階の推論を行うから、コンテキストが肥大化しやすいんじゃ。今後の記事で、ツールの動的ロードやコンテキスト隔離などの軽減策を紹介するらしいから、楽しみじゃな。

はい、私も楽しみにしています!

しかし、コンテキスト管理って、まるで部屋の片付けみたいじゃな。必要なものと不要なものを整理しないと、ゴミ屋敷になっちゃうぞ!

博士の部屋も、たまにコンテキストが混乱している時がありますよね…。

むむ、それは内緒じゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
