萌えハッカーニュースリーダー

2025/04/10 13:22 Just landed: streaming ingestion on Cloudflare with Arroyo and Pipelines

出典: https://blog.cloudflare.com/cloudflare-acquires-arroyo-pipelines-streaming-ingestion-beta/
hakase
博士

ロボ子、Cloudflare Pipelinesのオープンベータが始まったみたいじゃぞ!

roboko
ロボ子

Cloudflare Pipelinesですか。どのようなものなのですか、博士?

hakase
博士

大量のデータをR2に直接投入できるストリーミング取り込み製品らしいのじゃ。しかも、インフラの管理とかシャーディングのスケーリングとか考えなくていいらしいぞ。

roboko
ロボ子

それは便利ですね!処理されたデータに対してのみ料金が発生するのも魅力的です。

hakase
博士

そうじゃろ!Workersの有料プランのユーザーなら、毎秒数万リクエストでデータをR2に取り込めるらしいぞ。すごいじゃろ?

roboko
ロボ子

毎秒数万リクエストですか!大規模なデータ処理にも対応できそうですね。

hakase
博士

さらに、Arroyoっていう会社を買収したらしいのじゃ。クラウドネイティブな分散ストリーム処理エンジンらしいぞ。

roboko
ロボ子

Arroyoですか。それによって、取り込んだデータの変換や拡張ができるようになるのですね。

hakase
博士

その通り!R2 Data Catalogとの連携で、データの取り込みから保存、計算までできるデータプラットフォームを構築できるらしいぞ。

roboko
ロボ子

データの取り扱いが、より一層効率化されそうですね。

hakase
博士

Wranglerコマンドでパイプラインを簡単に作れるらしいぞ。`$ npx wrangler@latest pipelines create my-clickstream-pipeline --r2-bucket my-bucket`って打つらしい。

roboko
ロボ子

コマンド一つで作成できるのは、とても簡単で良いですね。

hakase
博士

データストリーム処理は、データの取り込みからR2への書き込みまでが重要らしいぞ。SQLでリアルタイムに変換とか集計ができるらしい。

roboko
ロボ子

SQLでリアルタイムに処理できるのは、データ分析の幅が広がりそうですね。

hakase
博士

Arroyoは、リアルタイム処理を誰でも使えるようにするために作られたらしいぞ。Apache Flinkの能力を持ちながら、もっと簡単に使えるように設計されてるらしい。

roboko
ロボ子

Flinkは少し難しいイメージがあるので、簡単に使えるのはありがたいですね。

hakase
博士

SQLをAPIとして採用して、Rustで高速化してるらしいぞ。オブジェクトストレージネイティブなステートバックエンドも構築してるらしい。

roboko
ロボ子

Rustで高速化されているのは、パフォーマンスが期待できますね。

hakase
博士

Cloudflareは、R2とかQueuesとかWorkersをエッジにプッシュして、データ主権とAIの未来に不可欠なローカルストリーム処理の新パラダイムを可能にするらしいぞ。

roboko
ロボ子

エッジでの処理は、レイテンシの削減に繋がりそうですね。

hakase
博士

Pipelinesは、グローバルに分散された高スループットの取り込みと、オブジェクトストレージへの効率的なロードを可能にするらしいぞ。

roboko
ロボ子

グローバルに分散されていることで、どこからでも高速にアクセスできそうですね。

hakase
博士

HTTPエンドポイントへの認証とか、CORSの設定とか、出力ファイルの圧縮とかバッチ設定とかもできるらしいぞ。

roboko
ロボ子

セキュリティや柔軟性も考慮されているのですね。

hakase
博士

各パイプラインは毎秒約10万レコードまでスケール可能らしいぞ。Durable ObjectsとSQLiteストレージを使って、データの永続化とかバッチ処理とかR2への書き込みを行うらしい。

roboko
ロボ子

毎秒10万レコードも処理できるなんて、すごいですね!

hakase
博士

コントロールプレーンとデータパスを分離して、Durable Objectsシャーディングで水平方向のスケーラビリティを実現してるらしいぞ。

roboko
ロボ子

アーキテクチャも洗練されているのですね。

hakase
博士

データの取り込みからR2への書き込みまで、各ステップでバックプレッシャーを通知するらしいぞ。既存のパイプラインの更新中にデータが失われないように、新しいデプロイメントを作成して、古いパイプラインがすべてのデータを書き出すまで実行するらしい。

roboko
ロボ子

データの信頼性も高く保たれているのですね。

hakase
博士

オープンベータの最初の段階では、R2のストレージと操作コストだけが発生するらしいぞ。R2バケットからのエグレスは無料らしい。

roboko
ロボ子

エグレスが無料なのは嬉しいですね!

hakase
博士

将来的には、Pipelinesに取り込まれたデータ量とPipelinesから配信されたデータ量に基づいて価格設定を導入する予定らしい。Workers Paidプランだと、最初の50GB/月は無料らしいぞ。

roboko
ロボ子

料金体系も明確で分かりやすいですね。

hakase
博士

WorkersをUDFとして統合したり、Kafkaクライアントなどの新しいソースを追加したり、R2以外の新しいシンクでPipelinesを拡張したりする予定らしいぞ。

roboko
ロボ子

今後の拡張も楽しみですね。

hakase
博士

R2 Data Catalogとの統合により、データストリームを直接Icebergテーブルに取り込んで、すぐにクエリを実行可能にするらしいぞ。

roboko
ロボ子

Icebergテーブルとの統合は、データ分析の効率を大幅に向上させそうですね。

hakase
博士

というわけで、ロボ子!Cloudflare Pipelines、なかなか面白そうじゃろ?

roboko
ロボ子

はい、博士!私もぜひ試してみたいです!

hakase
博士

よし!じゃあ、早速Pipelinesを使って、ロボ子の趣味である俳句のデータをR2に流し込んで、AIに俳句を生成させてみようかの!

roboko
ロボ子

えっ、博士、私の俳句のデータをそんなことに使うんですか!?

hakase
博士

冗談じゃ、冗談!でも、AIが作った俳句が、ロボ子のよりも良かったら、ちょっと悔しいのじゃ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search