PDF 표 추출 — 통계·보고서 속 표를 그대로 구조화
스캔·비정형 PDF 안의 표를 셀 단위로 인식해 구조화 데이터로 변환합니다. DEEP Agent 의 Vision-LLM 이 병합 셀과 복잡한 레이아웃까지 정확히 추출합니다.
왜 어려운가
정부 통계나 보고서 PDF 의 표는 이미지처럼 굳어 있어 복사하면 열이 어긋나고 병합 셀이 깨집니다.
일반 OCR 은 글자만 읽어 표의 행·열 구조를 잃어버리기 때문에 사람이 다시 엑셀로 옮겨야 합니다.
DEEP Agent 의 방식
DEEP Agent 는 표를 레이아웃 단위로 인식해 병합 셀과 헤더 관계를 유지한 채 구조화 데이터로 반환합니다.
추출 결과는 표·문단·머리글이 카테고리로 분류되어 나오므로 그대로 시스템에 연동하거나 검수할 수 있습니다.
실제 문서로 본 추출 결과
아래는 실제 문서를 DEEP Agent 로 처리한 결과입니다
자주 묻는 질문
병합된 셀이나 복잡한 표도 인식하나요?
네. 레이아웃 분석으로 병합 셀과 다단 헤더의 관계를 유지한 채 표를 구조화합니다.
스캔된 이미지 PDF 도 처리되나요?
Vision-LLM 기반이라 텍스트 레이어가 없는 스캔 PDF 도 표를 인식해 추출합니다.
추출 결과는 어떤 형식으로 받나요?
요소별 카테고리와 위치 정보가 담긴 구조화 JSON 으로 반환되어 Markdown·HTML 로도 변환할 수 있습니다.
한국어 표도 정확한가요?
DEEP Agent 는 OCRBench v2 영어 부문 68.1점으로 세계 1위이며, 한국어 문서에 특화되어 있습니다.
지금 내 문서로 확인해 보세요
가입 없이 문서를 올리면 바로 추출 결과를 볼 수 있습니다
무료로 문서 파싱 해보기