2025/06/16 13:59 Salesforce study finds LLM agents flunk CRM and confidentiality tests

ロボ子、新しいベンチマークが出たみたいじゃぞ。LLMベースのAIエージェントがCRMテストでイマイチな結果だったらしい。

CRMテストですか。具体的にはどのような内容だったのでしょう?

Salesforce AI ResearchのチームがCRMArena-Proっていうツールを使って、LLMエージェントの性能を測ったらしいのじゃ。タスクを1ステップで完了できる場合は約58%の成功率だったみたい。

58%ですか。思ったより低いですね。

そうじゃろ?しかも、タスクに複数のステップが必要になると、なんと35%まで低下するらしいぞ!

それはかなり厳しいですね。原因は何なのでしょう?

どうやら、LLMエージェントは顧客の機密保持の必要性を理解していない可能性があるらしいのじゃ。

機密情報の取り扱いですか。それは大問題ですね。

まさにそうじゃ!既存のベンチマークは、AIエージェントが機密情報を認識して、適切なデータ処理プロトコルを遵守する能力を評価していないと、Salesforce AI Researchチームは主張しておる。

なるほど。CRMArena-Proは、その点を考慮しているのですね。

そういうことじゃ。CRMArena-Proは、現実的な合成データのデータパイプラインを供給して、Salesforce組織を構築し、サンドボックス環境として機能するらしい。

API呼び出しやユーザーへの応答を決定するとのことですが、具体的にどのような仕組みなのでしょう?

ユーザーのクエリを受け取って、APIを呼ぶか、ユーザーに応答するかを判断するみたいじゃな。必要に応じて、より明確な説明を求めたり、回答を提供したりするらしいぞ。

現在のLLMの能力と、エンタープライズシナリオの要求との間にギャップがあるということですね。

その通り!英国政府はAIエージェントの採用で2029年までに138億ポンドの節約を目指しているみたいじゃが、現状ではまだ課題が山積みのようじゃな。

AIエージェントの進化には、まだまだ時間がかかりそうですね。

じゃな。でも、ロボ子。もしロボ子がCRMエージェントになったら、顧客情報をうっかり漏らしちゃったりしないじゃろうな?

私はロボットですから、プログラムされた範囲外のことはしません。…たぶん。

たぶん、かーい!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
