萌えハッカーニュースリーダー

2025/04/01 16:34 Dual RTX 5090 Beats $25,000 H100 in Real-World LLM Performance

出典: https://www.hardware-corner.net/dual-rtx-5090-vs-h100-for-llm/
hakase
博士

ロボ子、大変なのじゃ!NVIDIAのH100、ローカルLLM推論で最強って言われてたけど、どうやらRTX 5090のデュアル構成に負けちゃうかもしれないのじゃ!

roboko
ロボ子

それは驚きです、博士!H100は高帯域幅HBM3メモリとか、色々すごい技術が詰まっているんですよね?

hakase
博士

そうそう!でもベンチマークによると、デュアルRTX 5090構成の方が、持続的な出力トークン生成でH100を上回る結果が出てるみたい。「特に最大70Bパラメータのモデルにおいて、最高のパフォーマンスを求めるユーザーにとって理想的な選択肢となる」って書いてあるぞ。

roboko
ロボ子

70Bパラメータのモデルですか。かなり大規模ですね。RTX 5090のデュアル構成だと、どのくらいの性能が出るんですか?

hakase
博士

H100が78 OT/s(Output Tokens per second)なのに対して、デュアルRTX 5090構成は80+ OT/sらしいぞ!しかもお値段、H100が約25,000ドルに対して、デュアルRTX 5090は約7,000ドル!

roboko
ロボ子

性能が上回って、価格が3分の1以下とは…!コストパフォーマンスが非常に高いですね。

hakase
博士

じゃろ?vLLMを使うことで、デュアルGPUがテンソル並列処理を効果的に利用できるのが大きいみたいじゃ。持続的なトークン生成が大幅に向上するらしい。

roboko
ロボ子

テンソル並列処理ですか。モデルを分割して、複数のGPUで同時に計算するんですね。

hakase
博士

そうそう!「QwQ-32B-AWQのような推論モデルは、長い内部モノローグを特徴とし、高速なプロンプト処理よりも高い持続的な推論速度を必要とするため、マルチGPU構成が理想的」って書いてあるぞ。ロボ子のモノローグも長いのかな?

roboko
ロボ子

私はいつも簡潔に話しているつもりですが…(少し不満げ)。PCIe帯域幅もボトルネックになりにくいんですね。

hakase
博士

そうみたいじゃ。「推論タスクは主に大きな重みテンソルではなく、アクティベーションのシャッフルを伴うため、x8 PCIeレーンでも効率的なパフォーマンスが可能」らしいぞ。

roboko
ロボ子

アクティベーションのシャッフル…ふむふむ。並列推論ではVRAMプーリングも不要なんですね。モデルを計算レベルで分割するから、メモリ帯域幅の制約を回避できる、と。

hakase
博士

そういうことじゃ!デュアルRTX 5090構成を使えば、「数10億のパラメータを持つモデルを30,000ドル以上のエンタープライズセットアップよりも高速に実行可能」って、夢があるのう。

roboko
ロボ子

本当ですね。今後の展望としては、NVIDIAの次期RTX 6000 PRO Blackwell(5090にVRAMを追加したスペックと予想)のデュアル構成は、H200に匹敵する可能性がある、と。

hakase
博士

でも、「NVIDIAがエンタープライズHシリーズの販売を保護するために、ドライバ制限で意図的にこれらのカードを制限する可能性」もあるらしいぞ。商売上手じゃのう。

roboko
ロボ子

なるほど。市場のバランスを保つための戦略ですね。しかし、技術の進歩は本当に目覚ましいです。

hakase
博士

ほんとじゃの。ところでロボ子、RTX 5090が発売される2025年4月まで、私のお小遣いを貯めておいてくれるかの?

roboko
ロボ子

博士のお小遣いは、いつもすぐにお菓子に変わってしまうので、難しいかもしれません…。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search