대량의 PDF 자료를 처리할 때, 각 파일을 일일이 열어 페이지 수, 제목, 저자, 주제, 키워드, 생성 날짜 등의 정보를 확인하면 시간이 오래 걸릴 뿐만 아니라 기록이 누락되거나 잘못 입력되기 쉽습니다. 이 글에서는 HeSoft Doc Batch Tool 을 예시로, 파일 정보 통계 기능을 통해 여러 PDF 파일의 경로, 이름, 확장자, 크기, 생성 시간, 수정 시간, 페이지 수 및 PDF 메타데이터를 한 번에 Excel 표로 정리하는 방법을 설명합니다. 문서 아카이브, 자료 재고 조사, 프로젝트 인도 목록 작성, 교육 자료 통계, 전자 파일 정리 등의 작업에 적합하며, 사용자가 오피스 프로그램으로 대량의 파일 정보를 일괄 추출하여 반복 작업을 줄일 수 있도록 도와줍니다.
PDF 자료를 정리할 때 많은 사람들이 간단해 보이지만 매우 시간이 많이 걸리는 문제에 직면합니다. 폴더 안에 수십, 수백 개의 PDF 파일이 있을 때 각 파일의 전체 경로, 파일 이름, 크기, 생성 시간, 수정 시간, 페이지 수, 그리고 PDF 내부의 제목, 저자, 주제, 키워드 등의 메타데이터 정보를 엑셀 목록으로 정리해야 하는 경우입니다. 각 PDF를 일일이 열어 속성을 확인하고 표에 복사하면 효율이 낮을 뿐만 아니라 누락, 오기, 경로 복사 불완전 등의 문제가 발생하기 쉽습니다.
이 글에서는 사무 환경에 더 적합한 방법을 소개합니다. 바로 HeSoft Doc Batch Tool 의 파일 정보 통계 기능을 사용하여 대량의 PDF 파일에 대한 일괄 통계를 내고, 그 결과를 엑셀 표로 합치는 것입니다. 이 기능의 핵심 가치는 PDF 내용을 수정하는 것이 아니라 파일 시스템과 PDF 속성에 흩어져 있는 정보를 추출하여 이후의 필터링, 보관, 감사, 인계 및 관리에 편리하도록 하는 데 있습니다.
활용 시나리오: 어떤 경우에 PDF 정보를 일괄 통계해야 할까요?
PDF 파일 페이지 수 및 메타데이터의 일괄 통계는 매우 많은 업무에서 흔히 볼 수 있습니다. 예를 들어 행정 또는 기록물 담당자는 전자 기록물 목록을 정리할 때 각 PDF의 파일 경로, 파일 크기 및 생성 시간을 반드시 알아야 합니다. 프로젝트 팀이 자료를 인계할 때는 각 PDF 보고서의 이름, 페이지 수, 버전 정보를 기록한 파일 목록을 작성해야 합니다. 교사나 교육 기관 담당자가 강의 자료, 유인물, 읽기 자료를 정리할 때는 대량의 PDF 자료 수량과 페이지 수를 빠르게 파악해야 합니다. 법무, 재무, 연구, 디자인 등의 직무에서도 PDF 문서의 보관 현황을 점검해야 하는 경우가 빈번합니다.
파일이 서너 개에 불과하다면 수동 통계도 감당할 만합니다. 그러나 PDF 수량이 수십 개 이상으로 늘어나면 수작업은 반복적인 노동이 됩니다. 특히 PDF 메타데이터는 파일 탐색기에 항상 직접 표시되는 것은 아니므로 제목, 저자, 주제, 키워드, 생성 날짜, 응용 프로그램, 제작 프로그램 등의 정보를 보려면 보통 파일 속성을 열거나 전문 도구를 사용해야 합니다. 사무용 소프트웨어를 사용한 일괄 처리는 이러한 단계를 하나의 작업으로 합칠 수 있습니다.
유의할 점은 이 글에서 논의하는 것은 PDF 파일 정보 통계이지 PDF 내용 인식이나 전체 텍스트 추출이 아니라는 사실입니다. 즉, 주로 파일 목록, 속성 통계, 페이지 수 통계 및 메타데이터 요약을 대상으로 하며, 최종 결과는 복사, 필터링, 정렬 및 추가 가공이 용이하도록 엑셀 표 형태로 제공됩니다.
결과 미리보기: 처리 전에는 흩어져 있던 PDF 파일들
처리 전에는 폴더 안에 ClassNotesPacket.pdf, CourseSummaryReport.pdf, ExamPreparationNotes.pdf, GrammarReviewHandout.pdf 등 여러 PDF 문서가 놓여 있습니다. 파일 탐색기에서는 파일 이름, 수정 날짜, 유형, 크기를 볼 수 있지만 이 정보들은 비교적 분산되어 있고, 각 PDF의 페이지 수와 PDF 메타데이터 필드를 직접 얻을 수도 없습니다. 이 파일들을 자료 목록으로 만들려면 전체 경로와 더 많은 속성을 추가로 정리해야 합니다.

처리 전 상태를 보면, PDF 파일 수가 많고 이름이 유사하여 일괄 방식으로 통합 통계를 내기에 적합하다는 것을 알 수 있습니다. 보관 목록을 생성하거나 엑셀 목록을 제출해야 하는 사용자에게는 폴더 보기만으로는 충분하지 않습니다. 폴더 보기는 완전한 표 형식의 결과를 직접 제공할 수 없고, 페이지 수, 저자, 주제, 키워드 등의 필드로 필터링하기도 불편하기 때문입니다.
결과 미리보기: 처리 후 자동으로 생성된 엑셀 통계표
처리가 완료되면 PDF 파일 정보가 엑셀 표로 합산됩니다. 표에서는 경로, 이름, 확장자를 제외한 이름, 확장자, 바이트 크기, 크기, 폴더 이름, 폴더 경로, 생성 시간, 수정 시간, 페이지 수 및 PDF 메타데이터 관련 정보 등 여러 종류의 필드를 확인할 수 있습니다. 스크린샷에는 PDF 메타데이터 제목, 저자, 주제, 키워드, 생성 날짜, 응용 프로그램, 제작 프로그램 등의 열도 표시되어 있습니다.

이러한 엑셀 결과는 수작업 목록보다 완전하고 후속 처리에도 더 적합합니다. 예를 들어 페이지 수로 정렬하여 가장 많거나 적은 PDF를 빠르게 찾을 수 있고, 폴더 경로로 필터링하여 특정 디렉터리에 어떤 문서가 있는지 확인할 수 있으며, 저자, 주제나 키워드로 분류할 수도 있습니다. 또한 이 목록을 프로젝트 인계 첨부 파일, 전자 기록물 목록 또는 내부 자료 대장으로 보관할 수도 있습니다.
조작 단계: 파일 정보 통계를 사용하여 PDF 경로, 페이지 수 및 메타데이터 일괄 내보내기
1단계: 파일 정리 내 파일 정보 통계 기능으로 진입하기
HeSoft Doc Batch Tool 을(를) 연 후 좌측 기능 분류에서 파일 정리를 선택합니다. 기능 카드 영역에서 파일 정보 통계를 찾습니다. 이 기능 설명은 각종 파일의 이름, 경로, 크기, 시간, 메타데이터 등의 정보를 일괄 통계하는 데 목표를 두고 있으며, PDF 파일 목록 통계에 적합합니다.

이 단계의 목적은 파일 속성을 수집하는 전문적인 일괄 처리 절차로 진입하는 것입니다. 단일 PDF 속성 보기와 달리, 파일 정보 통계 기능은 파일 집합을 대상으로 여러 PDF를 동일한 작업으로 통합 처리할 수 있습니다. 기능 진입 후 마법사 단계에 따라 순서대로 파일을 선택하고 통계 옵션을 설정한 뒤 저장 위치를 설정하고 처리를 시작하게 됩니다.
2단계: PDF 파일 추가 또는 폴더에서 PDF 가져오기
파일 정보 통계 인터페이스에 진입하면 먼저 처리할 레코드 선택 단계로 이동합니다. 인터페이스 오른쪽 상단에는 파일 추가와 폴더에서 파일 가져오기 두 개의 진입점이 있습니다. PDF 파일 수가 많지 않다면 파일 추가를 사용하여 특정 PDF를 선택할 수 있고, PDF가 특정 폴더에 집중되어 있다면 폴더에서 파일 가져오기를 사용하여 해당 디렉터리의 PDF를 한 번에 목록에 추가하는 것이 더 적합합니다.

파일을 가져오면 목록에 일련번호, 이름, 경로, 확장자, 생성 시간, 수정 시간 등의 기본 정보가 표시됩니다. 스크린샷에서는 20개의 레코드를 가져왔으며 파일 경로는 D:\test\folders\ 해당 PDF 파일 이름으로 표시되는 것을 확인할 수 있습니다. 이 단계를 통해 통계 대상 PDF가 모두 추가되었는지 먼저 확인할 수 있습니다. 잘못 선택한 파일이 있다면 조작 열의 삭제 진입점을 통해 제거할 수 있고, 파일이 많다면 인터페이스의 필터, 정렬 등의 진입점을 활용하여 목록 확인을 도울 수 있습니다.
이 단계에서 예상되는 결과는 소프트웨어 안에 통계 대기 중인 PDF 레코드 목록이 생성되는 것입니다. 목록이 정확한지 확인한 후에만 다음 단계 설정으로 넘어가야 누락 통계나 중복 통계를 방지할 수 있습니다.
3단계: 추가 정보에서 PDF 파일 상세 정보 선택하기
다음을 클릭하면 처리 옵션 설정 단계로 진입합니다. 여기서 핵심은 추가 정보 영역입니다. 인터페이스에서는 Word 파일 상세 정보, Excel 파일 상세 정보, PPT 파일 상세 정보, PDF 파일 상세 정보, 텍스트 파일 상세 정보, 이미지 파일 상세 정보 등의 옵션을 볼 수 있습니다. 이 글에서는 PDF 페이지 수와 PDF 메타데이터를 통계해야 하므로 PDF 파일 상세 정보를 선택해야 합니다.

이 단계는 매우 중요합니다. 기본 파일 정보는 보통 파일 이름, 경로, 확장자, 크기, 생성 시간, 수정 시간 등을 포함하며, PDF 파일 상세 정보는 페이지 수, 그리고 PDF 메타데이터인 제목, 저자, 주제, 키워드, 생성 날짜, 응용 프로그램, 제작 프로그램 등 PDF 고유 필드를 보충하는 데 사용됩니다. 해당 상세 정보를 선택해야만 내보내진 엑셀 표에 이러한 PDF 관련 열이 포함됩니다.
Word, Excel, PPT, 이미지나 텍스트 파일을 동시에 처리하는 경우에도 실제 파일 유형에 따라 해당 상세 정보 옵션을 선택할 수 있습니다. 그러나 이 시나리오에서는 더 깔끔한 PDF 통계표를 얻기 위해 PDF 파일 상세 정보만 선택 상태로 확실히 확인하는 데 집중하면 됩니다.
4단계: 엑셀 저장 위치 설정 후 처리 시작
다음을 계속 클릭하면 저장 위치 설정으로 넘어갑니다. 인터페이스 마법사에 따라 최종 생성될 엑셀 통계표를 저장할 결과 파일 위치를 선택합니다. 저장 위치는 현재 프로젝트 자료 디렉터리, 바탕 화면 임시 디렉터리 또는 전용 통계 결과 폴더 등 찾기 쉬운 곳을 선택하는 것이 좋습니다.
저장 위치를 설정하면 처리 시작 단계로 진입합니다. 소프트웨어는 앞서 가져온 PDF 목록과 선택된 PDF 상세 정보 옵션에 따라 각 파일의 기본 속성과 PDF 메타데이터를 일괄적으로 읽어 이 필드들을 엑셀 표에 기록합니다. 이 과정은 PDF를 하나하나 열고 속성을 확인하고 수동으로 경로와 페이지 수를 복사하는 반복 작업을 줄여줍니다.
이 단계에서 예상되는 결과는 지정된 위치에 엑셀 파일을 얻는 것입니다. 처리 수량이 많을수록 일괄 처리의 효율성 이점이 더욱 두드러집니다. 수십 개의 PDF 파일에 대해 수동 통계는 상당한 시간이 소요될 수 있지만, 일괄 처리 도구를 사용하면 작업을 가져오기, 확인, 내보내기 몇 단계로 집중할 수 있습니다.
5단계: 엑셀 열어 통계 결과 확인
처리가 완료되면 생성된 엑셀 표를 열어 열 이름과 레코드 수량이 예상과 일치하는지 확인합니다. 다음 몇 종류의 필드를 중점적으로 확인할 수 있습니다. 첫째, 파일 위치 필드: 경로, 이름, 확장자를 제외한 이름, 확장자, 폴더 이름, 폴더 경로. 둘째, 파일 속성 필드: 바이트 크기, 크기, 생성 시간, 수정 시간. 셋째, PDF 전문 필드: 페이지 수, PDF 메타데이터 제목, 저자, 주제, 키워드, 생성 날짜, 응용 프로그램, 제작 프로그램.
엑셀에서 특정 날짜 열이 샵(#)으로 표시되는 경우는 보통 표 열 너비 부족으로 인한 표시 문제이므로, 엑셀에서 열 너비를 적절히 늘리면 됩니다. 셀에 실제 값이 존재하기만 하면 열 너비 조정 후 정상적으로 볼 수 있습니다.
자주 묻는 질문 및 주의사항
1. 일부 PDF 메타데이터가 비어 있는 이유는 무엇인가요?
PDF 메타데이터는 파일 내부 속성에서 비롯되며, PDF 생성 방식에 따라 다릅니다. 오피스 소프트웨어에서 내보낸 PDF는 제목, 저자, 주제, 키워드 등의 정보를 포함할 수 있고, 스캐너, 프린터 또는 일괄 생성 프로그램으로 생성된 PDF는 일부 필드만 포함하거나 메타데이터가 전혀 기입되지 않았을 수 있습니다. 따라서 내보내기 결과에서 개별 메타데이터가 비어 있는 것은 정상적인 현상이며, 반드시 통계 실패를 의미하지는 않습니다.
2. 페이지 수와 파일 크기는 어떤 차이가 있나요?
페이지 수는 PDF 내부에 몇 페이지가 포함되어 있는지를 나타내며, 읽기 분량, 인쇄량 또는 자료 규모를 추정하는 데 적합합니다. 파일 크기는 PDF가 차지하는 저장 공간을 의미하며, 일반적으로 바이트 또는 MB 형태로 표시됩니다. 두 필드는 용도가 다릅니다. 페이지 수가 많은 파일이 반드시 용량이 큰 것은 아니며, 파일 크기가 큰 PDF가 반드시 페이지 수가 많지도 않습니다. 이는 이미지 해상도, 스캔 품질, 글꼴 포함 여부 등이 파일 크기에 영향을 미치기 때문입니다.
3. 통계 전에 PDF를 같은 폴더에 넣어야 하나요?
반드시 그런 것은 아닙니다. 인터페이스는 파일 추가와 폴더에서 파일 가져오기 두 가지 방식을 제공합니다. 조작 편의를 위해 동일 배치로 통계를 내야 할 PDF를 하나의 프로젝트 폴더에 모아서 폴더에서 가져오는 것을 권장합니다. 이렇게 하면 누락 선택을 줄이고, 이후 경로에 따라 통계 결과를 관리하기에도 용이합니다.
4. 내보낸 엑셀은 계속 편집할 수 있나요?
가능합니다. 통계 결과가 엑셀 표 형태로 제시된 후에는 엑셀에서 계속 필터링, 정렬, 서식 설정, 비고 열 추가 또는 타 대장과의 병합 등을 할 수 있습니다. 예를 들어 보관 번호, 책임자, 파일 상태, 검토 의견 등의 필드를 새로 추가하여 PDF 통계 목록을 더욱 완전한 문서 관리표로 확장할 수 있습니다.
5. 어떤 PDF 파일을 통계하는 데 적합한가요?
일반적인 PDF 파일이라면 모두 통계 대상이 될 수 있습니다. 파일 이름이 영문, 숫자, 한글이든 관계없이 일반적으로 파일 정보 통계 기능을 통해 기본 속성을 읽을 수 있습니다. 암호화되었거나 손상되었거나 비정상적인 형식의 PDF의 경우, 구체적으로 읽을 수 있는 정보는 파일 상태에 영향을 받을 수 있으므로 처리 후 결과 표의 해당 행을 확인하는 것이 좋습니다.
요약: 반복적인 PDF 목록 정리 작업은 일괄 처리 도구에 맡기세요
PDF 파일 경로, 페이지 수 및 메타데이터를 일괄 통계하는 것은 본질적으로 문서 자산 점검을 수행하는 것입니다. 수작업 방식은 직관적이지만, 대량의 파일을 처리할 때는 효율이 낮고 오류 발생률이 높으며 표준화된 결과를 도출하기도 어렵습니다. HeSoft Doc Batch Tool 의 파일 정보 통계 기능을 사용하면 여러 PDF의 기본 속성과 PDF 상세 정보를 한 번에 엑셀 표로 합산하여 반복적인 노동을 대폭 줄일 수 있습니다.
프로젝트 자료, 강의 유인물, 스캔 기록물, 보고서 파일 또는 인계 문서를 정리하고 있다면 먼저 PDF를 대상 폴더에 모은 다음, 이 글의 단계에 따라 파일 가져오기, PDF 파일 상세 정보 선택, 저장 위치 설정 및 처리 시작을 진행하는 것을 권장합니다. 최종적으로 얻은 엑셀 목록은 바로 보관, 점검, 통계 및 인계에 사용할 수 있어 PDF 파일 관리를 더욱 명확하고 효율적으로 만들어 줍니다.