먼저 알아둘 기준

화면에서 한 문장처럼 보이는 글도 PDF 내부에는 글자 또는 짧은 조각별 좌표로 저장될 수 있습니다. 추출기는 위에서 아래, 왼쪽에서 오른쪽 같은 규칙으로 조각을 합치지만 원본 작성 프로그램의 의미 구조를 항상 알 수는 없습니다.

두 단으로 편집된 페이지에서 단 사이 거리가 줄 간격보다 작게 해석되면 왼쪽과 오른쪽 문장이 번갈아 섞일 수 있습니다. 표도 셀 경계가 구조로 저장되지 않았다면 행과 열 순서가 뒤엉킬 수 있습니다.

텍스트 레이어가 없는 스캔 PDF는 좌표에 글자가 아니라 이미지 픽셀만 있습니다. 이 경우 OCR이 필요하며 문서정리소의 기본 PDF 텍스트 추출 범위와 구분해야 합니다.

실제 작업에서 보는 사례

01

2단 논문에서 왼쪽 첫 줄 다음에 오른쪽 첫 줄이 이어져 문장이 섞입니다.

02

영수증 표의 금액이 항목명 뒤가 아니라 페이지 끝에 몰려 나올 수 있습니다.

03

마우스로 글자를 선택할 수 없는 스캔 페이지에서는 추출 결과가 비어 있습니다.

단계별로 확인하는 방법

  1. 1

    PDF에서 실제로 글자를 선택·복사할 수 있는지 확인합니다.

  2. 2

    페이지 범위를 작게 정해 페이지별 추출 순서를 미리봅니다.

  3. 3

    다단과 표 페이지는 원본을 옆에 두고 문단을 재배열합니다.

  4. 4

    불필요한 강제 줄바꿈과 반복 머리말을 후속 도구에서 정리합니다.

주의할 점

  • 추출 결과가 나온다는 사실만으로 문장 순서와 숫자 대응이 정확하다고 가정하면 안 됩니다.
  • 암호화 또는 복사 제한 문서는 권한과 파서 지원 범위를 확인해야 합니다.

기술적 제한

  • PDF 텍스트 객체에는 문단·표 셀·읽기 순서 같은 의미 정보가 없을 수 있어 좌표 기반 휴리스틱에 의존합니다.
  • 내장 글꼴의 ToUnicode 매핑이 없으면 보이는 글리프를 올바른 유니코드 문자로 복원하지 못할 수 있습니다.