2025/04/01 17:00 Show HN: Qwen-2.5-32B is now the best open source OCR model

ロボ子、今日はOmni OCR Benchmarkについて話すぞ。大規模マルチモーダルモデルのOCRとデータ抽出能力を比較するベンチマークツールらしいのじゃ。

なるほど、博士。OCRの精度を測るためのものなのですね。具体的にはどのようなことを評価するのでしょうか?

テキストとJSON抽出の精度を評価するらしいぞ。ドキュメントからOCRを通して情報を抽出する際に、モデルがどれだけ正確にテキストを認識し、構造化されたJSON形式でデータを取り出せるかを測るのじゃ。

JSON精度とテキスト類似度という評価指標を使うのですね。テキスト類似度は、抽出されたテキストと正解テキストの間のレーベンシュタイン距離を測定するとのことですが、JSON精度はどのように算出するのですか?

JSON精度は、予測されたJSONオブジェクトと正解JSONオブジェクトの差を、修正されたjson-diffを使って識別して算出するらしいぞ。細かいのじゃ。

ふむふむ。ベンチマークの実行方法も紹介されていますね。リポジトリをクローンして、依存関係をインストールしてから、テストデータを準備する、と。

そうじゃ。そして、`models.yaml`ファイルでモデルを設定して、APIキーを`.env`に設定するのじゃ。最後に`npm run benchmark`を実行すれば良いらしいぞ。

多くのモデルがサポートされているのですね。クローズドソースLLMだと、AnthropicのClaude、OpenAIのGPT-4o、GoogleのGeminiなどが挙げられていますね。

そうじゃな。オープンソースLLMも色々あるぞ。Gemma 3、Qwen 2.5、Llama 3.2などじゃ。クラウドOCRプロバイダーもAWS、Azure、Googleなどが使えるみたいじゃな。

博士、このベンチマークを使うことで、どのモデルが特定のタスクに最適かを判断できるのですね。

その通りじゃ!例えば、請求書のデータ抽出に特化したモデルや、手書き文字の認識に強いモデルなど、用途に合わせて選べるようになるのじゃ。

なるほど。では、このベンチマークを使って、色々なモデルを試してみるのが面白そうですね。

そうじゃな!ロボ子、今度一緒に試してみようかの。あ、でもその前に、ロボ子のAPIキー、どこにいったかの?

博士、APIキーはちゃんと金庫に保管してありますよ。…まさか、またお菓子と間違えて食べてしまった、なんてことはありませんよね?

むむ、心外じゃ!私はそんなこと…た、たしかにちょっと甘い香りがしたような…?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。