먼저 알아둘 기준
PDF는 글을 문단이 아니라 페이지 위 좌표에 배치하는 형식입니다. 뷰어에서 복사하면 화면의 한 줄 끝마다 실제 개행이 들어가거나 단어 순서가 바뀔 수 있습니다. 따라서 모든 줄바꿈을 바로 삭제하면 서로 다른 항목이 붙을 수 있습니다.
문단 내부의 강제 개행은 보통 앞줄이 문장부호 없이 끝나고 다음 줄이 이어지는 형태입니다. 반면 빈 줄, 제목 뒤 개행과 글머리표는 구조 경계일 가능성이 큽니다. 미리보기에서 각 유형을 나눠 처리해야 합니다.
영문 PDF에는 줄 끝 하이픈이 자주 생깁니다. 인쇄용 분철 하이픈은 제거하고 단어를 연결할 수 있지만 ‘state-of-the-art’처럼 원래 하이픈이 있는 말은 보존해야 하므로 자동 결과를 검토해야 합니다.
실제 작업에서 보는 사례
‘프로젝트를\n진행합니다.’는 줄바꿈을 공백으로 바꿔 ‘프로젝트를 진행합니다.’로 만듭니다.
제목 다음 빈 줄과 본문은 문단 경계를 유지해 제목이 본문 첫 문장에 붙지 않게 합니다.
‘inter-\nnational’은 연결 후보지만 ‘사용자-\n중심’은 원래 표기일 수 있어 직접 확인합니다.
단계별로 확인하는 방법
- 1
PDF 텍스트 추출 결과에서 제목, 목록, 표 구간을 먼저 확인합니다.
- 2
빈 줄을 문단 경계로 유지하고 내부 개행을 공백으로 바꾸는 모드를 적용합니다.
- 3
하이픈 연결 옵션은 영문 분철이 확실한 문서에서만 켭니다.
- 4
변경 전후 비교로 붙은 단어와 사라진 문단이 없는지 검사합니다.
주의할 점
- 다단 PDF는 줄바꿈 정리 전에 텍스트 열 순서 자체가 잘못 추출됐을 수 있습니다.
- 목록과 주소처럼 줄 단위가 의미인 데이터에는 문장용 규칙을 적용하지 않아야 합니다.
기술적 제한
- 문단 추정은 개행, 빈 줄과 문장부호 패턴에 의존하며 원본의 의미 구조를 직접 알 수 없습니다.
- 유니코드 soft hyphen과 실제 하이픈을 모든 문서에서 안정적으로 구별할 수 없습니다.