먼저 알아둘 기준

DOCX는 여러 XML과 미디어 파일을 ZIP 컨테이너에 담은 형식입니다. 본문 XML의 문단과 run을 읽어 글자를 이어 붙이고 스타일 정보를 참고해 제목과 목록을 구분할 수 있습니다.

표 안의 글자는 추출할 수 있어도 병합 셀, 너비와 테두리 같은 시각 구조는 TXT에서 표현할 수 없습니다. Markdown도 단순 표만 다루므로 복잡한 레이아웃은 HTML 또는 일반 문장으로 바뀔 수 있습니다.

머리말·꼬리말, 각주와 미주는 본문과 별도 XML에 있어 포함 여부를 선택해야 합니다. 이미지 속 글자는 OCR 없이는 추출되지 않으며 그림 개수나 파일만 확인할 수 있습니다.

실제 작업에서 보는 사례

01

제목 1 스타일은 Markdown의 # 제목 후보로 변환됩니다.

02

2×3 단순 표의 셀 글자는 행 순서대로 유지되지만 열 너비는 사라집니다.

03

텍스트 상자 안 문장은 일반 본문 순서에서 빠지거나 예상과 다른 위치에 나타날 수 있습니다.

단계별로 확인하는 방법

  1. 1

    DOC가 아닌 실제 DOCX 파일인지 형식과 ZIP 구조를 확인합니다.

  2. 2

    머리말·꼬리말과 각주·미주 포함 여부를 정합니다.

  3. 3

    제목, 목록과 표가 예상한 읽기 순서인지 미리봅니다.

  4. 4

    미지원 요소 경고를 확인한 뒤 TXT 또는 Markdown으로 저장합니다.

DOCX 추출 시 요소별 예상 결과

요소텍스트 추출형식 보존
일반 문단대체로 가능페이지 위치는 제외
제목 스타일가능Markdown 헤딩으로 단순화
단순 표셀 텍스트 가능폭·테두리·병합은 제한
이미지그림 속 글자 제외개수 또는 파일 추출 가능
글상자·도형누락 가능원본 배치 미보존

주의할 점

  • DOCX 텍스트 추출을 원본 문서의 완전한 복원이나 변환으로 설명하지 않아야 합니다.
  • 기밀 문서는 브라우저 확장 프로그램과 기기 환경도 고려해 취급 정책을 따라야 합니다.

기술적 제한

  • WordprocessingML의 사용자 정의 필드, 부동 개체와 호환성 확장은 일반 파서가 모두 지원하지 못할 수 있습니다.
  • 문서 XML 순서가 실제 페이지의 시각적 읽기 순서와 항상 같지는 않습니다.