PDF表抽出 — 統計・レポートの表をそのまま構造化

スキャンや非定型PDF内の表をセル単位で認識し、構造化データに変換します。DEEP AgentのVision-LLMが、結合セルや複雑なレイアウトまで正確に抽出します。

なぜ難しいのか

政府統計やレポートPDFの表は画像のように固定されているため、コピーすると列がずれ、結合セルが崩れてしまいます。

一般的なOCRは文字だけを読み取り、表の行・列構造が失われるため、人が改めてExcelに入力し直す必要があります。

DEEP Agentのアプローチ

DEEP Agentは表をレイアウト単位で認識し、結合セルやヘッダーの関係を保ったまま構造化データとして返します。

抽出結果は表・段落・見出しがカテゴリごとに分類されて出力されるため、そのままシステムに連携したり、確認したりできます。

実際のドキュメントで見る抽出結果

以下は、実際のドキュメントをDEEP Agentで処理した結果です。

よくある質問

結合されたセルや複雑な表も認識できますか?

はい。レイアウト解析により、結合セルや多段ヘッダーの関係を保ったまま表を構造化します。

スキャンされた画像PDFも処理できますか?

Vision-LLMベースのため、テキストレイヤーのないスキャンPDFでも表を認識して抽出します。

抽出結果はどの形式で受け取れますか?

要素ごとのカテゴリと位置情報を含む構造化JSONで返され、MarkdownやHTMLへの変換も可能です。

韓国語の表も正確ですか?

DEEP AgentはOCRBench v2(英語部門)で68.1点の世界1位を獲得しており、韓国語文書に特化しています。

今すぐご自身のドキュメントでお試しください

登録なしでドキュメントをアップロードすると、すぐに抽出結果をご覧いただけます。

無料でドキュメントパースを試す
PDF表抽出 — 統計・レポートの表を構造化データに | DEEP Agent