먼저 알아둘 기준
공백 포함 방식은 사용자가 입력한 문자열의 물리적 길이에 가깝습니다. 띄어쓰기, 문단 사이의 빈 줄과 들여쓰기 탭이 많으면 내용이 같아도 값이 커집니다. 입력 칸의 최대 길이를 검사하는 시스템에서 흔히 쓰입니다.
공백 제외 방식은 글의 핵심 문자량을 비교하기 좋지만 문장부호까지 빼는 것은 아닙니다. ‘안녕, 세상!’에서 공백만 제외하면 쉼표와 느낌표는 여전히 글자에 포함됩니다.
서로 다른 도구 결과를 비교할 때는 정규식의 공백 정의도 살펴야 합니다. 일반 스페이스만 빼는 계산과 모든 유니코드 공백을 빼는 계산은 전각 공백이나 줄바꿈이 있는 문서에서 값이 달라집니다.
실제 작업에서 보는 사례
‘가 나’는 공백 포함 3자, 일반 공백 제외 2자입니다.
‘첫째 줄\n둘째 줄’은 줄바꿈을 포함하면 한 문자가 더 집계되며 공백 제외에서는 빠집니다.
‘문서 정리’에는 전각 공백이 있어 일반 스페이스만 제거하는 계산에서는 예상보다 1자가 많을 수 있습니다.
단계별로 확인하는 방법
- 1
공백 포함·제외 중 제출 규정이 요구하는 값을 찾습니다.
- 2
공백 정리 전 두 값을 기록해 숨은 공백의 영향을 확인합니다.
- 3
전각 공백, 탭과 연속 줄바꿈을 미리보기에서 정리합니다.
- 4
수정 후 제출 시스템 자체의 계산 결과와 마지막으로 대조합니다.
글자 수 기준 비교
| 기준 | 포함하는 항목 | 주요 용도 |
|---|---|---|
| 공백 포함 | 본문, 스페이스, 탭, 줄바꿈 | 입력 칸 전체 길이 확인 |
| 공백 제외 | 공백류를 뺀 본문과 문장부호 | 내용 분량 비교 |
| UTF-8 바이트 | 인코딩된 실제 바이트 | 파일·전송 용량 제한 |
주의할 점
- ‘공백 제외’라는 말이 문장부호와 특수문자까지 제외한다는 뜻은 아닙니다.
- 자동 줄바꿈은 화면 표시일 뿐 실제 개행 문자가 아닐 수 있어 복사 결과와 다를 수 있습니다.
기술적 제한
- 유니코드 공백에는 일반 스페이스 외에도 NBSP, 전각 공백 등 여러 문자가 있어 제거 범위에 따라 결과가 달라집니다.
- CRLF와 LF를 정규화하기 전에는 줄바꿈의 내부 길이가 운영체제별로 다를 수 있습니다.