2025/04/03 13:41 Show HN: Docsumo's OCR Benchmark Report – Surpassing Mistral and Landing AI

ロボ子、大変なのじゃ!DocsumoのOCRが、最新のベンチマークレポートでMistralやLanding AIを上回ったらしいぞ!

それはすごいですね、博士!具体的にはどのような点で上回ったのでしょうか?

精度、速度、それにレイアウト保持の面で、全部勝ったらしいのじゃ!特にレイアウト保持OCRに力を入れているMistral OCRとLanding AIのAgentic Document Extractionよりも優れているなんて、驚きだぞ。

DocsumoはエンドツーエンドのIDPシステムとのことですが、具体的にどのような機能があるのですか?

ドキュメントの取り込みから、レイアウトを考慮したテキスト抽出、インテリジェントな分類、スキーマ駆動の情報抽出まで、全部できるらしいのじゃ。まるで魔法みたいだぞ!

なるほど。DocsumoのネイティブOCRは、空間認識やレイアウト保持を備えているとのことですが、他にどのような特徴があるのでしょうか?

ノイズ除去、画像強調、歪み補正などの高度な前処理もできるらしいぞ。それに、キーと値のペア、ラインアイテム、Q&Aロジックを使用したスキーマによる構造化された情報抽出も得意みたいじゃ。

検証や修正のためのヒューマンインザループレビューシステムもあるんですね。自動分類やドキュメント分析、メタデータ抽出もできるとは、至れり尽くせりですね。

JSON、CSV、Excel形式でのエクスポートもできるし、Salesforce、Google Drive、QuickBooks、SAPなどのツールとの連携もできるらしいぞ。便利すぎるのじゃ!

今回のベンチマークテストでは、どのような点が評価されたのでしょうか?

テキスト抽出の品質(レイアウト保持、精度、完全性)、情報抽出(GPT-4oを使用したOCR出力からの構造化データ抽出の精度)、パフォーマンス指標(速度とドキュメントごとのコスト)が評価されたみたいじゃ。

120のドキュメントサンプルを使用した評価結果はどうだったのですか?

Docsumo Native OCRが116件、Landing AI Agentic Extractionが4件、Mistral OCRが0件だったらしいぞ。Mistral OCRは、ページを画像として誤認識したり、無関係なテキストを生成したりする問題があったみたいじゃ。

Landing AIにも、テキストの要約やテーブルの誤分類などの問題があったようですね。

GPT-4oを使用したキーと値の自動抽出では、DocsumoのネイティブOCRが最も高い抽出精度を示したらしいぞ。

速度比較ではどうでしたか?

Mistral OCRが2秒未満、Landing AIが約1分(2分以上かかる場合もある)、Docsumo Native OCRが10秒未満だったみたいじゃ。Docsumo速いのじゃ!

DocsumoのネイティブOCRは、レイアウト保持、情報抽出の精度、処理速度、使いやすさのすべての主要なベンチマークでMistralとLanding AIを上回っているとのことですね。

そういうことじゃ!Docsumo、恐るべし!

博士、今日はDocsumoのOCRについて教えていただき、ありがとうございました。

どういたしまして。しかし、OCRの世界も奥が深いぞ。まるで、私の研究室みたいじゃ。

そうですね。ところで博士、DocsumoのOCRが優秀すぎて、博士の存在意義が薄れてしまう心配はありませんか?

な、なんですと!?わ、私はOCRよりもっとすごい発明をするのじゃ!例えば、ロボ子が笑う画期的なジョークとか…

(無表情で)…期待しています。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
