2025/06/24 16:18 Lossless LLM 3x Throughput Increase by LMCache

ロボ子、今日はLMCacheという面白い技術について話すのじゃ!LLMのserving engineを拡張するもので、特に長文コンテキストで効果を発揮するらしいぞ。

LMCacheですか。長文コンテキストに強いというのは、具体的にどのような仕組みなのでしょう?

ふむ、LMCacheは再利用可能なテキストのKVキャッシュを、GPU、CPU DRAM、ローカルディスクなどに保存するのじゃ。そして、LLM serving engineインスタンスで再利用されるテキストのKVキャッシュを再利用するらしい。

KVキャッシュを再利用することで、どのようなメリットがあるのですか?

GPUサイクルを節約できて、ユーザーの応答遅延を削減できるのじゃ!特にvLLMと組み合わせると、マルチラウンドQAやRAGを含む多くのLLMユースケースで、3〜10倍の遅延削減とGPUサイクル削減を達成できるらしいぞ。

3〜10倍もの遅延削減ですか!それはすごいですね。具体的にどのようなユースケースで効果的なのでしょうか?

マルチラウンドQAやRAGが例として挙げられているのじゃ。例えば、顧客とのチャットボットで、過去の会話内容をキャッシュとして再利用することで、応答速度を大幅に向上させることができるのじゃ。

なるほど。過去の会話内容を毎回計算するのではなく、キャッシュから取得することで高速化するのですね。RAGの場合はどうでしょうか?

RAG(Retrieval-Augmented Generation)の場合は、外部知識を検索してLLMに与える際に、同じような検索クエリが何度も発生することがあるのじゃ。その際に、検索結果をキャッシュしておけば、検索処理を省略できるのじゃ。

LMCacheはvLLM production stack ecosystemでサポートされているとのことですが、導入は簡単なのでしょうか?

ドキュメントによると、LMCache V1とLMCache V0のインストール方法が記載されているのじゃ。pip installでもインストールできるようになったみたいだから、以前より簡単になっているはずじゃ。

それは良いですね。CPU KVCacheオフロードやDisaggregated prefill、P2P KVCache共有などの機能もあるみたいですね。

そうそう、LMCache V1では、高性能CPU KVCacheオフロード、Disaggregated prefill、P2P KVCache共有といった機能が追加されているのじゃ。これらの機能によって、さらにパフォーマンスが向上するはずじゃ。

LMCacheはApache License 2.0でライセンスされているのですね。オープンソースで利用できるのはありがたいです。

LMCacheを使う研究者は、関連する論文を引用する必要があるのじゃ。Liu et al. (2024)のCachegenや、Cheng et al. (2024)の論文などが挙げられているぞ。

毎週コミュニティミーティングも開催されているみたいですね。火曜日の午前9時と午後6時30分(太平洋時間)にあるようです。

LMCacheは、LLMの性能を向上させるための重要な技術になりそうじゃな。これからの発展が楽しみじゃ!

そうですね。私もLMCacheを実際に試して、その効果を検証してみたいと思います。ところで博士、LMCacheのキャッシュって、博士の秘密のおやつみたいですね。

な、なにを言うのじゃ!私のおやつは、LMCacheとは違うぞ!…た、たしかに、どちらも無駄にできない大切なものじゃけど…。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。