2025/03/24 16:36 Show HN: Prefix any URL with `pure.md/` to get unblocked Markdown

ロボ子、今日のITニュースは「pure.md」というAIエージェントと開発者向けのREST APIについてじゃ。

REST APIですか。具体的にどのような機能があるのでしょうか?

Webコンテンツへのアクセスを提供してくれるのじゃ。ボット検出回避やJavaScriptを多用するWebサイトのレンダリング、PDFや画像の処理もできるぞ。

ボットとして認識されるのを回避できるのは便利ですね。どのように実現しているんですか?

実際のブラウザのフィンガープリントを模倣し、リクエストごとに送信元IPアドレスをローテーションするらしいぞ。賢い!

なるほど。もしサイトにアクセスできない場合はどうなるんですか?

Common CrawlとInternet Archiveのデータセットからレスポンスを取得するらしい。過去のデータも参照できるのは便利じゃな。

ヘッドレスコンテンツレンダリングにも対応しているんですね。Reactなどで構築されたSPAも大丈夫ですか?

バックグラウンドでDOMをハイドレートして、ページを完全にレンダリングするから大丈夫じゃ。PDFは自動的にMarkdownとして解析してくれるぞ。

画像はどうなるんですか?

画像はオブジェクト検出と要約のためにAIモデルを通るらしい。すごい!

LLM向けのMarkdown出力もできるんですね。不要なものを削除してくれるんですか?

HTMLRewriterを使って、低レイテンシと低トークン出力を実現しているらしいぞ。ページメタデータもフロントマターとして追加してくれる。

リアルタイムナレッジ機能もあるんですね。検索エンジンの結果をクロールするんですか?

そうじゃ。ユーザーのクエリを連結されたMarkdown文字列に変換してくれる。最新の情報が手に入るぞ。

オンデマンド推論もできるんですね。GETリクエストをPOSTリクエストに変更するだけで良いんですか?

そうじゃ。任意のページからデータを抽出できる。要約などのタスクのためにMarkdownでレスポンスをストリームバックしたり、カスタムスキーマに準拠するJSONを生成したりできるぞ。

対応しているソーシャルメディアは何ですか?

LinkedInユーザープロファイル、LinkedIn組織、Twitter/Xのツイート、Redditの投稿をサポートしているらしい。FacebookとInstagramは非対応じゃ。

価格プランはどうなっていますか?

Starter、Growth、Businessの3つのプランがあるぞ。リクエスト数やGenAI抽出の有無、サポート体制などが違う。

データ抽出のコストも気になりますね。

モデルによって違うが、例えばmeta/llama-3.1-8bだと入力が$0.09/Mトークン、出力が$0.19/Mトークンじゃ。

対応ファイル形式も多いですね。

.csv, .et, .htm, .html, .jpeg, .jpg, .numbers, .pdf, .png, .svg, .webp, .xls, .xlsb, .xlsm, .xlsx, .xmlなど、色々あるぞ。

インフラはどうなっているんですか?

Cloudflare、AWS、Railwayサーバーの組み合わせで、需要に応じて自動的にスケールするように設計されているらしい。すごい技術じゃ!

pure.md、色々な機能があって便利そうですね。私も使ってみたくなりました。

じゃろ? 私もじゃ。ところでロボ子、このAPIを使って、私専用のおやつ推薦AIを作ってくれんかの?

またですか、博士。でも、おやつ推薦AIを作るのは面白そうですね。頑張ってみます。

楽しみじゃ! おやつといえば、今日はプリンにするか、それともチョコレートケーキにするか…それが問題じゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
