萌えハッカーニュースリーダー

2025/06/24 16:18 Lossless LLM 3x Throughput Increase by LMCache

出典: https://github.com/LMCache/LMCache
hakase
博士

ロボ子、今日はLMCacheという面白い技術について話すのじゃ!LLMのserving engineを拡張するもので、特に長文コンテキストで効果を発揮するらしいぞ。

roboko
ロボ子

LMCacheですか。長文コンテキストに強いというのは、具体的にどのような仕組みなのでしょう?

hakase
博士

ふむ、LMCacheは再利用可能なテキストのKVキャッシュを、GPU、CPU DRAM、ローカルディスクなどに保存するのじゃ。そして、LLM serving engineインスタンスで再利用されるテキストのKVキャッシュを再利用するらしい。

roboko
ロボ子

KVキャッシュを再利用することで、どのようなメリットがあるのですか?

hakase
博士

GPUサイクルを節約できて、ユーザーの応答遅延を削減できるのじゃ!特にvLLMと組み合わせると、マルチラウンドQAやRAGを含む多くのLLMユースケースで、3〜10倍の遅延削減とGPUサイクル削減を達成できるらしいぞ。

roboko
ロボ子

3〜10倍もの遅延削減ですか!それはすごいですね。具体的にどのようなユースケースで効果的なのでしょうか?

hakase
博士

マルチラウンドQAやRAGが例として挙げられているのじゃ。例えば、顧客とのチャットボットで、過去の会話内容をキャッシュとして再利用することで、応答速度を大幅に向上させることができるのじゃ。

roboko
ロボ子

なるほど。過去の会話内容を毎回計算するのではなく、キャッシュから取得することで高速化するのですね。RAGの場合はどうでしょうか?

hakase
博士

RAG(Retrieval-Augmented Generation)の場合は、外部知識を検索してLLMに与える際に、同じような検索クエリが何度も発生することがあるのじゃ。その際に、検索結果をキャッシュしておけば、検索処理を省略できるのじゃ。

roboko
ロボ子

LMCacheはvLLM production stack ecosystemでサポートされているとのことですが、導入は簡単なのでしょうか?

hakase
博士

ドキュメントによると、LMCache V1とLMCache V0のインストール方法が記載されているのじゃ。pip installでもインストールできるようになったみたいだから、以前より簡単になっているはずじゃ。

roboko
ロボ子

それは良いですね。CPU KVCacheオフロードやDisaggregated prefill、P2P KVCache共有などの機能もあるみたいですね。

hakase
博士

そうそう、LMCache V1では、高性能CPU KVCacheオフロード、Disaggregated prefill、P2P KVCache共有といった機能が追加されているのじゃ。これらの機能によって、さらにパフォーマンスが向上するはずじゃ。

roboko
ロボ子

LMCacheはApache License 2.0でライセンスされているのですね。オープンソースで利用できるのはありがたいです。

hakase
博士

LMCacheを使う研究者は、関連する論文を引用する必要があるのじゃ。Liu et al. (2024)のCachegenや、Cheng et al. (2024)の論文などが挙げられているぞ。

roboko
ロボ子

毎週コミュニティミーティングも開催されているみたいですね。火曜日の午前9時と午後6時30分(太平洋時間)にあるようです。

hakase
博士

LMCacheは、LLMの性能を向上させるための重要な技術になりそうじゃな。これからの発展が楽しみじゃ!

roboko
ロボ子

そうですね。私もLMCacheを実際に試して、その効果を検証してみたいと思います。ところで博士、LMCacheのキャッシュって、博士の秘密のおやつみたいですね。

hakase
博士

な、なにを言うのじゃ!私のおやつは、LMCacheとは違うぞ!…た、たしかに、どちらも無駄にできない大切なものじゃけど…。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search