폴더에 PDF 자료가 많을 때, 경로, 페이지 수, 크기, 생성 시간, 수정 시간뿐만 아니라 제목, 저자, 주제, 키워드 등의 메타데이터를 하나씩 열어서 확인하는 것은 시간이 많이 걸릴 뿐만 아니라 누락되기 쉽습니다. 본 문서에서는 HeSoft Doc Batch Tool 의 파일 정보 통계 기능을 사용하여 여러 PDF 파일의 기본 속성과 PDF 상세 정보를 일괄 추출하고 Excel 표로 자동 요약하는 방법을 소개합니다. 이는 자료 정리, 기록 보관, 강의 자료 정리, 프로젝트 문서 목록 작성 등의 상황에 적합합니다.
일상 업무, 자료 관리, 교수 연구, 프로젝트 납품 및 문서 정리 과정에서 다음과 같은 요구 사항을 자주 접하게 됩니다. 한 폴더에 수십 개에서 수백 개의 PDF 파일이 있을 때, 각 PDF의 전체 경로, 파일 이름, 확장자, 파일 크기, 만든 날짜, 수정한 날짜, 페이지 수, 그리고 PDF 메타데이터의 제목, 작성자, 주제, 키워드, 생성 날짜, 응용 프로그램, PDF 작성기 등의 정보를 정리해야 하는 경우입니다. 수동으로 PDF를 하나씩 열어 확인하고 Excel 표에 복사해 넣으면 효율이 매우 낮을 뿐만 아니라, 누락, 오기입, 형식 불일치 등의 문제가 발생하기 쉽습니다.
이 글에서 해결하고자 하는 것이 바로 이러한 전형적인 PDF 파일 정보 일괄 통계 문제입니다. 업무용 소프트웨어 HeSoft Doc Batch Tool 을(를) 통해 여러 PDF 파일을 작업 목록으로 한 번에 가져오고, 추가 통계가 필요한 PDF 파일 상세 정보를 선택한 다음 마법사 안내에 따라 요약 결과를 생성할 수 있습니다. 최종적으로 얻은 Excel 표는 문서 대장, 자료 목록, 납품 명세서, 파일 감사 및 후속 필터 분석에 바로 사용할 수 있습니다.
적용 시나리오: PDF 경로, 페이지 수 및 메타데이터 일괄 통계에 적합한 작업
PDF 정보 일괄 통계는 단일 시나리오를 위한 기능이 아니라 문서 관리 작업의 기본 역량에 더 가깝습니다. 대량의 PDF를 구조화된 표로 정리해야 한다면, 이 방법을 사용하여 반복적인 노동을 줄일 수 있습니다.
- 자료 아카이브: 프로젝트 자료, 계약 스캔본, 규정 문서, 교육 자료 등 PDF를 통합하여 Excel 목록으로 정리하여 추후 검색을 용이하게 합니다.
- 교육 자료 관리: 강의 유인물, 복습 자료, 읽기 자료, 연습 문제집 등 PDF의 페이지 수와 작성자 정보를 일괄 집계하여 자료 규모를 파악합니다.
- 프로젝트 납품 점검: 대량의 PDF 보고서, 제안서, 설명서 등을 납품하기 전에 먼저 파일 상세 목록을 생성하여 파일 누락 여부, 경로 정확성 여부를 점검합니다.
- 전자 기록 실사: 파일 경로, 크기, 만든 날짜, 수정한 날짜 등의 필드를 통해 기록 파일의 분포 및 업데이트 상황을 빠르게 파악합니다.
- PDF 메타데이터 검토: PDF 제목, 작성자, 주제, 키워드, 생성 날짜, 응용 프로그램, PDF 작성기 등의 정보를 조회하여 문서 출처와 메타데이터가 규범에 맞는지 판단합니다.
이러한 정보를 수동으로 집계할 경우 파일 수량이 많을수록 시간 비용이 높아집니다. 업무용 소프트웨어의 가치는 바로 반복적이고 규칙성이 강한 작업을 일괄 처리하여, 사용자가 판단과 분석에 집중할 수 있도록 하고 기계적인 복사-붙여넣기 작업에서 벗어나게 하는 데 있습니다.
결과 미리보기: 처리 전에는 분산된 PDF, 처리 후에는 Excel 상세 목록
처리 전: 폴더 내 여러 개의 PDF 자료
처리 전 상태는 일반적으로 여러 PDF 파일이 나열된 평범한 폴더입니다. 스크린샷에서 파일 이름은 ClassNotesPacket.pdf, CourseSummaryReport.pdf, ExamPreparationNotes.pdf, GrammarReviewHandout.pdf 등을 포함하며, 자료들이 PDF 형식으로 분산 저장되어 있습니다. Windows 파일 탐색기에서는 수정한 날짜, 유형, 크기 등의 일부 기본 정보를 볼 수 있지만, PDF 페이지 수를 한 번에 표시하거나 제목, 작성자, 주제, 키워드와 같은 PDF 메타데이터를 직접 추출하기에는 불편합니다.

이 정보를 표로 정리해야 할 경우, 수동 방식은 일반적으로 파일 열기, 속성 보기, 경로 복사, 페이지 수 기록, Excel 작성 등의 단계를 거쳐야 합니다. 파일이 20개라도 상당히 번거로울 수 있으며, 200개, 2000개의 PDF 파일이라면 수동 처리는 더욱 현실적이지 않습니다.
처리 후: PDF 정보가 Excel 표로 요약됨
HeSoft Doc Batch Tool 을(를) 사용하여 통계를 완료하면 결과가 Excel로 요약됩니다. 처리 후 스크린샷은 경로, 이름, 이름(확장자 제외), 확장자, 크기(바이트), 크기, 상위 폴더 이름, 상위 폴더 경로, 만든 날짜, 수정한 날짜, 페이지 수, 그리고 제목, 작성자, 주제, 키워드, 생성 날짜, 응용 프로그램, PDF 작성기 등 PDF 메타데이터 관련 필드와 같은 구조화된 필드를 보여줍니다.

이 결과의 장점은 매우 직관적이라는 것입니다. 각 PDF 파일은 Excel에서 하나의 행에 해당하고, 각 정보 유형은 하나의 필드 열에 해당합니다. 이후 Excel의 필터, 정렬, 찾기, 피벗 테이블 등의 기능을 사용하여 계속 분석할 수 있습니다. 예를 들어 페이지 수를 기준으로 정렬하여 페이지가 가장 많은 PDF를 빠르게 찾거나, 작성자별로 필터링하여 특정 작성자의 문서를 보거나, 생성 날짜별로 파일 배치를 확인하거나, 경로를 기준으로 원본 파일이 있는 디렉터리를 찾을 수 있습니다.
조작 단계: HeSoft Doc Batch Tool 을(를) 사용하여 PDF 정보 통계
1단계: 파일 정리 내 파일 정보 통계 기능으로 이동
HeSoft Doc Batch Tool 을(를) 연 후, 왼쪽 기능 분류에서 "파일 정리"를 선택합니다. 스크린샷에서 볼 수 있듯이, 이 분류 아래에는 파일 이름별 분류, 확장자별 분류, 파일 정보 통계, 폴더 정보 통계 등 파일 일괄 처리와 관련된 여러 기능이 있습니다. 여기서는 PDF 파일의 경로, 크기, 시간, 페이지 수 및 메타데이터를 통계해야 하므로 "파일 정보 통계"를 선택합니다.

이 단계의 목적은 파일 정보를 일괄 통계하는 전용 처리 마법사로 진입하는 것입니다. 스크린샷의 기능 카드 설명에서도 알 수 있듯이, 이 기능은 다양한 파일의 이름, 경로, 크기, 시간 및 메타데이터 등의 정보를 일괄 통계할 수 있습니다. 즉, PDF뿐만 아니라 일반 파일 목록 정리에도 사용할 수 있으며, 본 시나리오에서는 PDF에 대한 자세한 통계를 수행하는 데 중점을 둡니다.
2단계: PDF 파일 추가 또는 폴더에서 파일 가져오기
"파일 정보 통계" 페이지로 이동하면 첫 번째 단계는 "처리할 레코드 선택"입니다. 페이지 오른쪽 상단에서 "파일 추가", "폴더에서 파일 가져오기", "비우기", "더 보기" 등의 버튼을 볼 수 있습니다. 소수의 PDF의 경우 "파일 추가"를 사용하여 하나씩 또는 여러 개를 선택할 수 있으며, 폴더 안에 이미 대량의 PDF가 있는 경우 "폴더에서 파일 가져오기"를 사용하여 디렉터리의 파일을 목록에 한 번에 로드하는 것이 더 적합합니다.

가져오기가 완료되면 소프트웨어가 목록에 레코드를 표시합니다. 스크린샷의 표 열에는 번호, 이름, 경로, 확장자, 만든 날짜, 수정한 날짜 및 작업 등이 포함됩니다. 페이지 하단에 표시된 레코드 수가 20개라는 것은 현재 20개의 PDF 파일을 가져왔음을 나타냅니다. 이때 파일 이름과 경로가 올바른지, 대상 폴더의 PDF가 모두 작업에 추가되었는지 확인할 수 있습니다.
목록에 처리할 필요 없는 파일이 섞여 있으면 작업 열을 통해 해당 레코드를 삭제할 수 있으며, 가져오기가 잘못된 경우 "비우기"를 사용하여 다시 선택할 수 있습니다. 목록 상단에는 "필터", "정렬" 등의 진입점도 제공되므로 파일이 많을 때 빠르게 데이터를 확인하는 데 유용합니다. 확인이 끝나면 페이지 하단의 "다음"을 클릭하여 처리 옵션 설정으로 이동합니다.
3단계: PDF 파일 상세 정보 선택
두 번째 단계는 "처리 옵션 설정"입니다. "추가 정보" 영역에서 Word 파일 상세 정보, Excel 파일 상세 정보, PPT 파일 상세 정보, PDF 파일 상세 정보, 텍스트 파일 상세 정보, 그림 파일 상세 정보 등 여러 선택 가능한 항목을 볼 수 있습니다. 이 글에서는 PDF의 페이지 수와 메타데이터 정보를 통계해야 하므로 "PDF 파일 상세 정보"를 선택해야 합니다.

이 단계는 매우 중요합니다. 기본 파일 정보에는 일반적으로 이름, 경로, 확장자, 크기, 만든 날짜, 수정한 날짜 등이 포함됩니다. 반면 PDF 파일 상세 정보는 페이지 수, PDF 메타데이터 제목, 작성자, 주제, 키워드, 생성 날짜, 응용 프로그램, PDF 작성기 등 PDF 고유 콘텐츠를 보충하는 데 사용됩니다. 이 옵션을 선택해야 최종 생성된 Excel 표에 스크린샷에 표시된 PDF 메타데이터 열이 포함됩니다.
작업이 일반 파일 목록을 만드는 것뿐이라면 추가 상세 정보를 선택하지 않아도 됩니다. 하지만 목표가 PDF 페이지 수 통계, 문서 작성자 확인, PDF 메타데이터 정리라면 이 옵션을 선택하는 것이 좋습니다. 확인 후 "다음"을 클릭하여 저장 위치 설정을 계속합니다.
4단계: 저장 위치 설정 및 처리 시작
마법사 상단에서 후속 절차로 "저장 위치 설정" 및 "처리 시작"을 볼 수 있습니다. 저장 위치 단계로 이동하면 페이지 안내에 따라 통계 결과의 저장 위치를 선택합니다. 여기서 목표는 소프트웨어가 통계 결과를 조회, 필터링 및 추가 편집 가능한 표 파일로 출력하도록 하는 것입니다. 설정을 완료하고 계속 진행하여 "처리 시작" 단계에서 작업을 실행합니다.
처리 과정에서 소프트웨어는 작업 목록의 PDF 파일을 하나씩 읽어 기본 파일 속성과 PDF 상세 정보를 추출하고, 이러한 필드를 Excel 표로 정리합니다. 수동으로 PDF를 여는 것과 달리, 일괄 처리는 연속 실행이 가능하여 수십, 수백 개 또는 그 이상의 파일을 처리하는 데 적합합니다. 사용자는 시작 전에 파일 목록과 처리 옵션만 확인하면 되며, 나머지 통계 작업은 소프트웨어가 처리합니다.
5단계: Excel 결과 열기 및 필드 확인
작업이 완료되면 생성된 Excel 파일을 열어 각 PDF 파일이 하나의 레코드에 해당하는 것을 볼 수 있습니다. 다음 유형의 필드를 중점적으로 확인하는 것이 좋습니다.
- 위치 관련 필드: 경로, 상위 폴더 이름, 상위 폴더 경로. 원본 PDF를 빠르게 찾는 데 사용됩니다.
- 파일 이름 필드: 이름, 이름(확장자 제외), 확장자. 이름 검사 또는 후속 일괄 정리에 사용됩니다.
- 크기 필드: 크기(바이트) 및 크기. 파일 용량을 판단하고 비정상 파일을 필터링하는 데 사용됩니다.
- 시간 필드: 만든 날짜, 수정한 날짜. 파일 생성 및 업데이트 배치를 판단하는 데 사용됩니다.
- PDF 필드: 페이지 수, 제목, 작성자, 주제, 키워드, 생성 날짜, 응용 프로그램, PDF 작성기. PDF 자료 관리 및 메타데이터 검토에 사용됩니다.
추가 가공이 필요한 경우 Excel에서 페이지 수로 정렬, 작성자로 필터링, 경로로 그룹화하거나 프로젝트 번호, 자료 유형 등의 사용자 정의 필드와 결합하여 2차 정리를 할 수 있습니다.
자주 묻는 질문 및 주의 사항
1. PDF 파일 상세 정보를 선택해야 하는 이유는 무엇입니까?
기본 파일 속성만 통계할 경우 일반적으로 경로, 이름, 크기, 시간 등의 정보만 얻을 수 있습니다. 페이지 수와 PDF 메타데이터는 PDF 문서 내부 또는 확장 속성에 속하므로 "추가 정보"에서 "PDF 파일 상세 정보"를 선택해야 합니다. 선택하지 않으면 최종 Excel에 페이지 수, PDF 메타데이터 제목, 작성자 등의 열이 나타나지 않을 수 있습니다.
2. 파일이 많을 때 파일을 추가해야 합니까, 아니면 폴더에서 가져와야 합니까?
PDF가 적다면 "파일 추가"를 사용하면 됩니다. 대상 파일이 하나의 폴더에 집중적으로 저장되어 있다면 "폴더에서 파일 가져오기"를 사용하여 반복 선택 작업을 줄이는 것이 좋습니다. 가져온 후 목록에서 레코드 수와 경로를 확인하여 예상과 일치하는지 확인하십시오.
3. Excel에서 일부 시간이 우물 정자로 표시되면 어떻게 합니까?
처리 후 스크린샷에서 열 너비 부족으로 인해 일부 셀이 "####"로 표시될 수 있습니다. 이는 일반적으로 Excel 표시 너비 문제이며 데이터 손실을 의미하지는 않습니다. 열 너비를 적절히 늘리거나 셀 서식을 조정한 후 전체 내용을 확인할 수 있습니다.
4. PDF 메타데이터가 비어 있어도 정상입니까?
일부 PDF는 제작 시 제목, 작성자, 주제 또는 키워드 등의 메타데이터가 기록되지 않았을 수 있으므로 내보낸 결과의 해당 필드가 비어 있을 수 있습니다. 소프트웨어는 파일에 이미 있는 정보를 일괄적으로 읽어오는 역할을 하며, 값의 유무는 PDF 자체에 이러한 메타데이터가 포함되어 있는지에 따라 달라집니다.
5. 통계 전에 PDF를 동일한 폴더로 이동해야 합니까?
반드시 그럴 필요는 없습니다. 파일 추가 또는 폴더에서 파일 가져오기를 통해 대상 PDF를 목록에 추가할 수만 있다면 통계를 진행할 수 있습니다. 다만 관리 측면에서 동일한 작업 파일들을 한곳에 모아 두는 것이 레코드 수 확인 및 후속 아카이브에 더 편리합니다.
요약: PDF 목록 정리를 수동 입력에서 일괄 처리로 전환
PDF 파일의 경로, 페이지 수 및 메타데이터를 일괄 통계하는 것은 본질적으로 분산된 비정형 파일 정보를 구조화된 Excel 표로 변환하는 것입니다. HeSoft Doc Batch Tool 은(는) 업무용 소프트웨어로서 이러한 반복성이 강하고 파일 수량이 많으며 필드 규칙이 명확한 작업을 처리하는 데 적합합니다. "파일 정보 통계" 기능을 통해 사용자는 PDF를 빠르게 가져오고, PDF 파일 상세 정보를 선택하고, 저장 위치를 설정하고 처리를 시작하여 기본 속성과 PDF 메타데이터가 포함된 Excel 목록을 최종적으로 얻을 수 있습니다.
대량의 PDF 자료를 정리하고 있다면 파일을 하나씩 열어 수동으로 기록하는 것을 계속해서 권장하지 않습니다. 이 글의 단계에 따라 먼저 폴더의 PDF를 가져온 다음 PDF 상세 정보를 선택하고 Excel을 생성하십시오. 이렇게 하면 많은 시간을 절약할 수 있을 뿐만 아니라 수동 통계 오류를 줄여 문서 아카이브, 자료 실사 및 프로젝트 납품을 보다 효율적이고 표준화할 수 있습니다.