PDF表抽出 — 統計・レポートの表をそのまま構造化
スキャンや非定型PDF内の表をセル単位で認識し、構造化データに変換します。DEEP AgentのVision-LLMが、結合セルや複雑なレイアウトまで正確に抽出します。
なぜ難しいのか
政府統計やレポートPDFの表は画像のように固定されているため、コピーすると列がずれ、結合セルが崩れてしまいます。
一般的なOCRは文字だけを読み取り、表の行・列構造が失われるため、人が改めてExcelに入力し直す必要があります。
DEEP Agentのアプローチ
DEEP Agentは表をレイアウト単位で認識し、結合セルやヘッダーの関係を保ったまま構造化データとして返します。
抽出結果は表・段落・見出しがカテゴリごとに分類されて出力されるため、そのままシステムに連携したり、確認したりできます。
実際のドキュメントで見る抽出結果
以下は、実際のドキュメントをDEEP Agentで処理した結果です。
よくある質問
結合されたセルや複雑な表も認識できますか?
はい。レイアウト解析により、結合セルや多段ヘッダーの関係を保ったまま表を構造化します。
スキャンされた画像PDFも処理できますか?
Vision-LLMベースのため、テキストレイヤーのないスキャンPDFでも表を認識して抽出します。
抽出結果はどの形式で受け取れますか?
要素ごとのカテゴリと位置情報を含む構造化JSONで返され、MarkdownやHTMLへの変換も可能です。
韓国語の表も正確ですか?
DEEP AgentはOCRBench v2(英語部門)で68.1点の世界1位を獲得しており、韓国語文書に特化しています。
今すぐご自身のドキュメントでお試しください
登録なしでドキュメントをアップロードすると、すぐに抽出結果をご覧いただけます。
無料でドキュメントパースを試す