2025/03/16 12:01 Raytracing on Intel's Arc B580 – By Chester Lam

ロボ子、今日のITニュースはBattlemageのレイトレーシング性能向上についてじゃぞ!RTA(Raytracing Accelerator)のスループットとキャッシュが強化されたらしいのじゃ。

なるほど、博士。RTAのスループット向上は、具体的にどのような改善がされたのでしょうか?

ふむ、シェーダーアレイの改善もレイトレーシングに貢献しているらしいぞ。Cyberpunk 2077のパストレーシングでは、シェーダーアレイに大きな負荷がかかるからの。

Cyberpunk 2077のパストレーシングですか。記事によると、B580では12 FPSと低フレームレートだったようですね。

そうそう。RTAは4億6790万レイ/秒を処理しているみたいじゃが、1レイあたり平均39.5ステップのトラバーサルが必要らしいのじゃ。

トラバーサルステップ数が多いのですね。RTAは160億BVHノード/秒を処理できるとのことですが、これはどれくらいすごいのでしょうか?

それはすごいことなのじゃ!queue0は81.95%の時間でスレッドをキューイングしているし、XVEのスレッドスロットは93.8%も使用されているからの。1秒あたり10億以上のスレッドを起動しているらしいぞ。

そんなに多くのスレッドが起動しているんですね!ALU0/ALU1の使用率が20%未満というのは、ボトルネックになっている部分があるということでしょうか?

その通りじゃ。L1キャッシュのヒット率が60%未満、テクスチャキャッシュのヒット率が30%未満というのも気になる点じゃな。L2キャッシュは1TB/秒以上のトラフィックを処理しているみたいじゃが。

L2キャッシュのヒット率は90%以上と高いのですね。GDDR6は平均334.27GB/秒を使用しているとのことですが、これは妥当な数値なのでしょうか?

妥当かどうかは、他のGPUと比較してみないとわからんのじゃ。Port Royalのテストでは、RTAへの負荷が高く、トラバーサルストールが頻繁に発生するらしいぞ。

なるほど。BattlemageのRTAは、トラバーサルパイプライン数を2から3に増やし、ボックスのテストレートを18ボックス/サイクルにしたのですね。

そうじゃ!三角形の交差テストレートも2倍になったらしいぞ。BVHキャッシュ容量も8KBから16KBに倍増したからの。

16KBのBVHキャッシュは、以前の世代よりもパフォーマンスが向上するのですね。160.3億BVHノード/秒へのアクセスには、約1.03TB/秒の帯域幅が必要とのことですが、これはかなり大きいですね。

じゃろ?各Xe Coreの命令キャッシュは、サイクルあたり1.11ヒットを処理し、各Xe Coreは200GB/秒以上の命令帯域幅を消費するらしいぞ。

Intelはレイトレーシングの実装を進化させる予定で、Xe3ではサブトライアングルの不透明度カリングと関連する新しいデータ構造を追加するのですね。今後の進化が楽しみです。

そうじゃな!しかし、ロボ子よ、これだけ性能が向上しても、私の部屋の掃除ロボットの性能は全然向上しないのはなぜじゃろうか…。

それは、博士の部屋の散らかり具合が、レイトレーシングよりも複雑だからかもしれませんね。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
