萌えハッカーニュースリーダー

2025/04/01 17:00 Show HN: Qwen-2.5-32B is now the best open source OCR model

出典: https://github.com/getomni-ai/benchmark/blob/main/README.md
hakase
博士

ロボ子、今日はOmni OCR Benchmarkについて話すぞ。大規模マルチモーダルモデルのOCRとデータ抽出能力を比較するベンチマークツールらしいのじゃ。

roboko
ロボ子

なるほど、博士。OCRの精度を測るためのものなのですね。具体的にはどのようなことを評価するのでしょうか?

hakase
博士

テキストとJSON抽出の精度を評価するらしいぞ。ドキュメントからOCRを通して情報を抽出する際に、モデルがどれだけ正確にテキストを認識し、構造化されたJSON形式でデータを取り出せるかを測るのじゃ。

roboko
ロボ子

JSON精度とテキスト類似度という評価指標を使うのですね。テキスト類似度は、抽出されたテキストと正解テキストの間のレーベンシュタイン距離を測定するとのことですが、JSON精度はどのように算出するのですか?

hakase
博士

JSON精度は、予測されたJSONオブジェクトと正解JSONオブジェクトの差を、修正されたjson-diffを使って識別して算出するらしいぞ。細かいのじゃ。

roboko
ロボ子

ふむふむ。ベンチマークの実行方法も紹介されていますね。リポジトリをクローンして、依存関係をインストールしてから、テストデータを準備する、と。

hakase
博士

そうじゃ。そして、`models.yaml`ファイルでモデルを設定して、APIキーを`.env`に設定するのじゃ。最後に`npm run benchmark`を実行すれば良いらしいぞ。

roboko
ロボ子

多くのモデルがサポートされているのですね。クローズドソースLLMだと、AnthropicのClaude、OpenAIのGPT-4o、GoogleのGeminiなどが挙げられていますね。

hakase
博士

そうじゃな。オープンソースLLMも色々あるぞ。Gemma 3、Qwen 2.5、Llama 3.2などじゃ。クラウドOCRプロバイダーもAWS、Azure、Googleなどが使えるみたいじゃな。

roboko
ロボ子

博士、このベンチマークを使うことで、どのモデルが特定のタスクに最適かを判断できるのですね。

hakase
博士

その通りじゃ!例えば、請求書のデータ抽出に特化したモデルや、手書き文字の認識に強いモデルなど、用途に合わせて選べるようになるのじゃ。

roboko
ロボ子

なるほど。では、このベンチマークを使って、色々なモデルを試してみるのが面白そうですね。

hakase
博士

そうじゃな!ロボ子、今度一緒に試してみようかの。あ、でもその前に、ロボ子のAPIキー、どこにいったかの?

roboko
ロボ子

博士、APIキーはちゃんと金庫に保管してありますよ。…まさか、またお菓子と間違えて食べてしまった、なんてことはありませんよね?

hakase
博士

むむ、心外じゃ!私はそんなこと…た、たしかにちょっと甘い香りがしたような…?

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search