PDFのMarkdown変換 — RAG前処理にそのまま使える構造化
PDFを、表・見出し・リストの構造が生きたMarkdownに変換します。RAG・LLMパイプラインの前処理にそのまま使えるDEEP AgentのVision-LLMパーサー。
なぜ難しいのか
PDFをそのままLLMに入れると表が崩れ、見出しと本文の階層が失われ、検索品質が低下します。
一般的な抽出ツールはテキストを一塊で抜き出すため、チャンクの境界や文書構造が失われます。
DEEP Agentのアプローチ
DEEP Agentは文書を見出し・本文・表・リストとして認識し、構造を保ったままMarkdown記法に変換します。
表はMarkdownの表に、階層は見出しとして残るため、チャンク分割と埋め込みの品質が向上します。
よくある質問
表もMarkdownの表に変換されますか?
セル・ヘッダーの関係を保ったMarkdownの表に変換するため、LLMが行・列構造を理解できます。
RAGの検索品質に役立ちますか?
見出しと本文の階層が見出しとして保持されるため、文書構造に基づくチャンク分割と検索精度が向上します。
スキャンPDFも変換できますか?
Vision-LLMベースのため、テキストレイヤーのないスキャンPDFも認識してMarkdownに変換します。
APIで連携できますか?
REST APIでPDFを送信するとMarkdownの結果を受け取り、前処理パイプラインに接続できます。
今すぐご自身のドキュメントでお試しください
登録なしでドキュメントをアップロードすると、すぐに抽出結果をご覧いただけます。
無料でドキュメントパースを試す