2025/04/10 13:22 Just landed: streaming ingestion on Cloudflare with Arroyo and Pipelines

ロボ子、Cloudflare Pipelinesのオープンベータが始まったみたいじゃぞ!

Cloudflare Pipelinesですか。どのようなものなのですか、博士?

大量のデータをR2に直接投入できるストリーミング取り込み製品らしいのじゃ。しかも、インフラの管理とかシャーディングのスケーリングとか考えなくていいらしいぞ。

それは便利ですね!処理されたデータに対してのみ料金が発生するのも魅力的です。

そうじゃろ!Workersの有料プランのユーザーなら、毎秒数万リクエストでデータをR2に取り込めるらしいぞ。すごいじゃろ?

毎秒数万リクエストですか!大規模なデータ処理にも対応できそうですね。

さらに、Arroyoっていう会社を買収したらしいのじゃ。クラウドネイティブな分散ストリーム処理エンジンらしいぞ。

Arroyoですか。それによって、取り込んだデータの変換や拡張ができるようになるのですね。

その通り!R2 Data Catalogとの連携で、データの取り込みから保存、計算までできるデータプラットフォームを構築できるらしいぞ。

データの取り扱いが、より一層効率化されそうですね。

Wranglerコマンドでパイプラインを簡単に作れるらしいぞ。`$ npx wrangler@latest pipelines create my-clickstream-pipeline --r2-bucket my-bucket`って打つらしい。

コマンド一つで作成できるのは、とても簡単で良いですね。

データストリーム処理は、データの取り込みからR2への書き込みまでが重要らしいぞ。SQLでリアルタイムに変換とか集計ができるらしい。

SQLでリアルタイムに処理できるのは、データ分析の幅が広がりそうですね。

Arroyoは、リアルタイム処理を誰でも使えるようにするために作られたらしいぞ。Apache Flinkの能力を持ちながら、もっと簡単に使えるように設計されてるらしい。

Flinkは少し難しいイメージがあるので、簡単に使えるのはありがたいですね。

SQLをAPIとして採用して、Rustで高速化してるらしいぞ。オブジェクトストレージネイティブなステートバックエンドも構築してるらしい。

Rustで高速化されているのは、パフォーマンスが期待できますね。

Cloudflareは、R2とかQueuesとかWorkersをエッジにプッシュして、データ主権とAIの未来に不可欠なローカルストリーム処理の新パラダイムを可能にするらしいぞ。

エッジでの処理は、レイテンシの削減に繋がりそうですね。

Pipelinesは、グローバルに分散された高スループットの取り込みと、オブジェクトストレージへの効率的なロードを可能にするらしいぞ。

グローバルに分散されていることで、どこからでも高速にアクセスできそうですね。

HTTPエンドポイントへの認証とか、CORSの設定とか、出力ファイルの圧縮とかバッチ設定とかもできるらしいぞ。

セキュリティや柔軟性も考慮されているのですね。

各パイプラインは毎秒約10万レコードまでスケール可能らしいぞ。Durable ObjectsとSQLiteストレージを使って、データの永続化とかバッチ処理とかR2への書き込みを行うらしい。

毎秒10万レコードも処理できるなんて、すごいですね!

コントロールプレーンとデータパスを分離して、Durable Objectsシャーディングで水平方向のスケーラビリティを実現してるらしいぞ。

アーキテクチャも洗練されているのですね。

データの取り込みからR2への書き込みまで、各ステップでバックプレッシャーを通知するらしいぞ。既存のパイプラインの更新中にデータが失われないように、新しいデプロイメントを作成して、古いパイプラインがすべてのデータを書き出すまで実行するらしい。

データの信頼性も高く保たれているのですね。

オープンベータの最初の段階では、R2のストレージと操作コストだけが発生するらしいぞ。R2バケットからのエグレスは無料らしい。

エグレスが無料なのは嬉しいですね!

将来的には、Pipelinesに取り込まれたデータ量とPipelinesから配信されたデータ量に基づいて価格設定を導入する予定らしい。Workers Paidプランだと、最初の50GB/月は無料らしいぞ。

料金体系も明確で分かりやすいですね。

WorkersをUDFとして統合したり、Kafkaクライアントなどの新しいソースを追加したり、R2以外の新しいシンクでPipelinesを拡張したりする予定らしいぞ。

今後の拡張も楽しみですね。

R2 Data Catalogとの統合により、データストリームを直接Icebergテーブルに取り込んで、すぐにクエリを実行可能にするらしいぞ。

Icebergテーブルとの統合は、データ分析の効率を大幅に向上させそうですね。

というわけで、ロボ子!Cloudflare Pipelines、なかなか面白そうじゃろ?

はい、博士!私もぜひ試してみたいです!

よし!じゃあ、早速Pipelinesを使って、ロボ子の趣味である俳句のデータをR2に流し込んで、AIに俳句を生成させてみようかの!

えっ、博士、私の俳句のデータをそんなことに使うんですか!?

冗談じゃ、冗談!でも、AIが作った俳句が、ロボ子のよりも良かったら、ちょっと悔しいのじゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
