Wenn ein Ordner eine große Anzahl von PDF-Dateien enthält, ist es nicht nur zeitaufwendig, sondern auch fehleranfällig, sie einzeln zu öffnen, um Pfad, Seitenzahl, Größe, Erstellungsdatum, Änderungsdatum sowie Metadaten wie Titel, Autor, Thema und Schlüsselwörter zu überprüfen. Dieser Artikel beschreibt, wie Sie mit der Funktion zur Dateiinformationsstatistik in HeSoft Doc Batch Tool die grundlegenden Eigenschaften und detaillierten PDF-Informationen mehrerer PDF-Dateien stapelweise extrahieren und automatisch in einer Excel-Tabelle zusammenfassen können. Dies eignet sich für Szenarien wie Datenarchivierung, Bestandsaufnahme, Organisation von Kursmaterialien und Erstellung von Projektdokumentenlisten.
Im täglichen Büroalltag, bei der Materialverwaltung, im Unterricht und in der Forschung, bei der Projektablieferung und der Archivorganisation kommt es häufig vor, dass in einem Ordner Dutzende oder sogar Hunderte von PDF-Dateien liegen, aus denen der vollständige Pfad, der Dateiname, die Erweiterung, die Dateigröße, das Erstellungsdatum, das Änderungsdatum, die Seitenanzahl sowie die PDF-Metadaten wie Titel, Autor, Thema, Schlüsselwörter, Erstellungsdatum, Anwendung und Erstellungsprogramm extrahiert werden müssen. Wenn jede PDF einzeln manuell geöffnet, überprüft und dann in eine Excel-Tabelle kopiert wird, ist das nicht nur äußerst ineffizient, sondern es kommt auch leicht zu Auslassungen, Fehleinträgen und uneinheitlichen Formaten.
Dieser Artikel widmet sich dem typischen Problem der Stapelstatistik von PDF-Dateiinformationen. Mit der Bürosoftware HeSoft Doc Batch Tool können mehrere PDF-Dateien auf einmal in eine Aufgabenliste importiert werden. Wählen Sie die gewünschten detaillierten PDF-Dateiinformationen aus und folgen Sie dann dem Assistenten, um das zusammenfassende Ergebnis zu generieren. Die so erhaltene Excel-Tabelle kann direkt für Dokumentenverzeichnisse, Materialkataloge, Lieferlisten, Dateiprüfungen und anschließende Filteranalysen verwendet werden.
Anwendungsszenarien: Für welche Aufgaben eignet sich die Stapelstatistik von PDF-Pfaden, Seitenzahlen und Metadaten?
Die Stapelstatistik von PDF-Informationen ist keine Funktion für ein einzelnes Szenario, sondern vielmehr eine grundlegende Fähigkeit der Dokumentenverwaltung. Wenn Sie eine große Anzahl von PDFs in strukturierte Tabellen umwandeln müssen, können Sie diese Methode nutzen, um sich wiederholende Arbeit zu reduzieren.
- Materialarchivierung: Vereinheitlichen Sie PDFs wie Projektmaterialien, Vertragsscans, Richtliniendokumente und Schulungsunterlagen in einer Excel-Liste, um die spätere Suche zu erleichtern.
- Verwaltung von Lehrmaterialien: Erfassen Sie Seitenzahlen und Autoreninformationen für PDFs wie Kursunterlagen, Wiederholungsmaterialien, Lesestoff und Übungshefte stapelweise, um den Materialumfang zu beurteilen.
- Prüfung der Projektablieferung: Erstellen Sie vor der Ablieferung einer großen Anzahl von PDF-Berichten, Konzepten und Handbüchern eine detaillierte Dateiliste, um die Vollständigkeit der Dateien und die Korrektheit der Pfade zu überprüfen.
- Digitale Archivinventur: Gewinnen Sie schnell einen Überblick über die Verteilung und den Aktualisierungsstatus von Archivdateien anhand von Feldern wie Dateipfad, Größe, Erstellungsdatum und Änderungsdatum.
- Prüfung von PDF-Metadaten: Überprüfen Sie Informationen wie PDF-Titel, Autor, Thema, Schlüsselwörter, Erstellungsdatum, Anwendung und Erstellungsprogramm, um die Herkunft der Dokumente und die Standardkonformität der Metadaten zu beurteilen.
Wenn diese Informationen manuell erfasst werden, steigen die Zeitkosten mit der Anzahl der Dateien. Der Mehrwert von Bürosoftware liegt darin, wiederkehrende, stark regelbasierte Aufgaben stapelweise zu verarbeiten, sodass sich der Benutzer auf Beurteilung und Analyse konzentrieren kann, statt auf mechanisches Kopieren und Einfügen.
Ergebnisvorschau: Vor der Verarbeitung eine Ansammlung verstreuter PDFs, danach eine detaillierte Excel-Tabelle
Vor der Verarbeitung: Mehrere PDF-Dokumente in einem Ordner
Der Zustand vor der Verarbeitung ist in der Regel ein gewöhnlicher Ordner mit einer Vielzahl von PDF-Dateien. Im Screenshot sind Dateinamen wie ClassNotesPacket.pdf, CourseSummaryReport.pdf, ExamPreparationNotes.pdf, GrammarReviewHandout.pdf usw. zu sehen, die verteilt als PDFs vorliegen. Der Windows-Explorer zeigt zwar einige grundlegende Informationen wie Änderungsdatum, Typ und Größe an, kann aber weder die Seitenanzahl auf einen Blick anzeigen, noch eignet er sich zur direkten Extraktion von PDF-Metadaten wie Titel, Autor, Thema oder Schlüsselwörter.

Wenn diese Informationen in eine Tabelle übertragen werden sollen, umfasst die manuelle Methode normalerweise Schritte wie Datei öffnen, Eigenschaften anzeigen, Pfad kopieren, Seitenzahl notieren und in Excel eintragen. Bei 20 Dateien mag das bereits umständlich sein, bei 200 oder 2000 PDF-Dateien ist eine manuelle Bearbeitung unrealistisch.
Nach der Verarbeitung: PDF-Informationen sind in einer Excel-Tabelle zusammengefasst
Nach Abschluss der Statistik mit HeSoft Doc Batch Tool werden die Ergebnisse in Excel zusammengefasst. Der Screenshot nach der Verarbeitung zeigt die strukturierten Felder: Pfad, Name, Name (ohne Erweiterung), Erweiterung, Größe (Bytes), Größe, Name des Ordners, Pfad des Ordners, Erstellungsdatum, Änderungsdatum, Seitenanzahl sowie zugehörige PDF-Metadatenfelder wie Titel, Autor, Thema, Schlüsselwörter, Erstellungsdatum, Anwendung und Erstellungsprogramm.

Der Vorteil dieses Ergebnisses liegt auf der Hand: Jede PDF-Datei entspricht einer Zeile in Excel, und jede Informationskategorie einer Feldspalte. Anschließend können Excel-Funktionen wie Filtern, Sortieren, Suchen und Pivot-Tabellen für weitere Analysen verwendet werden. Sortieren Sie z. B. nach Seitenanzahl, um schnell die PDF mit den meisten Seiten zu finden. Filtern Sie nach Autor, um die von einem bestimmten Autor erstellten Dokumente anzuzeigen. Überprüfen Sie Dateichargen anhand des Erstellungsdatums oder lokalisieren Sie das Ursprungsverzeichnis einer Datei anhand des Pfades.
Arbeitsschritte: Verwendung von HeSoft Doc Batch Tool zur Statistik von PDF-Informationen
Schritt 1: Aufrufen der Funktion „Dateiinformationsstatistik“ in „Dateien ordnen“
Öffnen Sie HeSoft Doc Batch Tool und wählen Sie in der linken Funktionskategorie „Dateien ordnen“. Wie der Screenshot zeigt, enthält diese Kategorie mehrere Funktionen für die Stapelverarbeitung von Dateien, wie z. B. Klassifizierung nach Dateiname, Klassifizierung nach Erweiterung, Dateiinformationsstatistik und Ordnerinformationsstatistik. Da wir hier Pfad, Größe, Zeit, Seitenzahl und Metadaten von PDF-Dateien erfassen möchten, wählen Sie „Dateiinformationsstatistik“.

Zweck dieses Schritts ist der Aufruf des speziellen Verarbeitungsassistenten für die Stapelstatistik von Dateiinformationen. Die Funktionsbeschreibung im Screenshot weist auch darauf hin, dass diese Funktion Name, Pfad, Größe, Zeit und Metadaten verschiedener Dateien stapelweise erfassen kann. Sie eignet sich also nicht nur für PDFs, sondern auch für die Erstellung allgemeiner Dateilisten. In unserem Szenario konzentrieren wir uns jedoch auf die detaillierte statistische Erfassung von PDFs.
Schritt 2: PDF-Dateien hinzufügen oder aus einem Ordner importieren
Auf der Seite „Dateiinformationsstatistik“ ist der erste Schritt „Auswahl der zu verarbeitenden Einträge“. Oben rechts auf der Seite befinden sich Schaltflächen wie „Dateien hinzufügen“, „Aus Ordner importieren“, „Leeren“ und „Mehr“. Für wenige PDFs können Sie „Dateien hinzufügen“ verwenden, um sie einzeln oder in einer Gruppe auszuwählen. Befinden sich bereits viele PDFs in einem Ordner, ist „Aus Ordner importieren“ besser geeignet, um die Dateien aus dem Verzeichnis auf einmal in die Liste zu laden.

Nach dem Import zeigt die Software die Einträge in der Liste an. Die Tabellenspalten im Screenshot enthalten laufende Nummer, Name, Pfad, Erweiterung, Erstellungszeit, Änderungszeit und Aktionen. Unten auf der Seite wird die Anzahl der Einträge mit 20 angezeigt, was bedeutet, dass aktuell 20 PDF-Dateien importiert wurden. Überprüfen Sie nun, ob Dateinamen und Pfade korrekt sind und ob alle PDFs aus dem Zielordner zur Aufgabe hinzugefügt wurden.
Sollten unerwünschte Dateien in der Liste enthalten sein, können Sie die entsprechenden Einträge über die Aktionsspalte löschen. Bei fehlerhaftem Import können Sie auch die Option „Leeren“ verwenden, um die Auswahl neu zu starten. Über der Liste bieten Einträge wie „Filtern“ und „Sortieren“ eine bequeme Möglichkeit, die Daten bei vielen Dateien schnell zu überprüfen. Klicken Sie nach der Bestätigung auf „Weiter“ am unteren Seitenrand, um die Verarbeitungsoptionen festzulegen.
Schritt 3: Detaillierte PDF-Dateiinformationen auswählen
Der zweite Schritt ist „Verarbeitungsoptionen festlegen“. Im Bereich „Zusätzliche Informationen“ sehen Sie mehrere auswählbare Optionen, darunter detaillierte Word-Dateiinformationen, detaillierte Excel-Dateiinformationen, detaillierte PPT-Dateiinformationen, detaillierte PDF-Dateiinformationen, detaillierte Textdateiinformationen, detaillierte Bilddateiinformationen usw. Da wir die Seitenanzahl und Metadaten von PDFs erfassen möchten, markieren Sie hier „Detaillierte PDF-Dateiinformationen“.

Dieser Schritt ist entscheidend. Grundlegende Dateiinformationen umfassen normalerweise Name, Pfad, Erweiterung, Größe, Erstellungsdatum und Änderungsdatum. Detaillierte PDF-Dateiinformationen ergänzen hingegen PDF-spezifische Inhalte wie Seitenanzahl, PDF-Metadaten-Titel, Autor, Thema, Schlüsselwörter, Erstellungsdatum, Anwendung und Erstellungsprogramm. Nur wenn Sie diese Option wählen, enthält die endgültig generierte Excel-Tabelle die im Screenshot gezeigten PDF-Metadatenspalten.
Wenn Sie nur eine einfache Dateiliste benötigen, müssen Sie die zusätzlichen Detailinformationen nicht auswählen. Wenn jedoch das Ziel darin besteht, PDF-Seitenzahlen zu erfassen, Dokumentautoren zu überprüfen oder PDF-Metadaten zu ordnen, empfiehlt es sich, diese Option zu aktivieren. Klicken Sie nach der Bestätigung auf „Weiter“, um den Speicherort festzulegen.
Schritt 4: Speicherort festlegen und Verarbeitung starten
Oben im Assistenten sehen Sie die nachfolgenden Schritte „Speicherort festlegen“ und „Verarbeitung starten“. Legen Sie im Schritt „Speicherort“ gemäß den Anweisungen den Speicherort für das Statistik-Ergebnis fest. Ziel ist es, dass die Software das Ergebnis als ein durchsuchbares, filterbares und weiter editierbares Tabellendokument ausgibt. Gehen Sie nach der Einstellung auf „Weiter“ und starten Sie die Aufgabe im Schritt „Verarbeitung starten“.
Während der Verarbeitung liest die Software nacheinander die PDF-Dateien aus der Aufgabenliste, extrahiert die grundlegenden Dateieigenschaften und die detaillierten PDF-Informationen und fasst diese Felder in der Excel-Tabelle zusammen. Im Gegensatz zum manuellen Öffnen von PDFs kann die Stapelverarbeitung kontinuierlich ausgeführt werden und eignet sich für Dutzende, Hunderte oder sogar noch mehr Dateien. Der Benutzer muss nur vor dem Start die Dateiliste und die Verarbeitungsoptionen bestätigen; die restliche statistische Arbeit übernimmt die Software.
Schritt 5: Excel-Ergebnis öffnen und Felder überprüfen
Sobald die Aufgabe abgeschlossen ist, öffnen Sie die generierte Excel-Datei. Sie werden sehen, dass jede PDF-Datei einem eigenen Datensatz entspricht. Es wird empfohlen, besonders auf die folgenden Feldtypen zu achten:
- Felder zur Lokalisierung: Pfad, Ordnername, Ordnerpfad, um die ursprüngliche PDF schnell zu finden.
- Dateinamenfelder: Name, Name (ohne Erweiterung), Erweiterung, nützlich für die Namensprüfung oder eine spätere Stapelaufbereitung.
- Größenfelder: Größe (Bytes) und Größe, um das Dateivolumen zu beurteilen und anormale Dateien herauszufiltern.
- Zeitfelder: Erstellungsdatum, Änderungsdatum, um die Chargen von Dateierstellung und -aktualisierung zu beurteilen.
- PDF-Felder: Seitenanzahl, Titel, Autor, Thema, Schlüsselwörter, Erstellungsdatum, Anwendung, Erstellungsprogramm, für die PDF-Dokumentenverwaltung und Metadatenprüfung.
Falls weitere Bearbeitungen nötig sind, können Sie in Excel nach Seitenzahl sortieren, nach Autor filtern, nach Pfad gruppieren oder mit benutzerdefinierten Feldern wie Projektnummer oder Materialtyp eine sekundäre Aufbereitung vornehmen.
Häufige Fragen und Hinweise
1. Warum sollte ich detaillierte PDF-Dateiinformationen auswählen?
Wenn nur grundlegende Dateiattribute erfasst werden, erhält man in der Regel nur Informationen wie Pfad, Name, Größe und Zeit. Seitenanzahl und PDF-Metadaten sind interne oder erweiterte Eigenschaften des PDF-Dokuments und erfordern die Auswahl von „Detaillierte PDF-Dateiinformationen“ unter „Zusätzliche Informationen“. Ohne diese Auswahl werden Spalten wie Seitenanzahl, PDF-Metadaten-Titel oder Autor möglicherweise nicht in der endgültigen Excel-Datei angezeigt.
2. Sollte ich bei vielen Dateien „Hinzufügen“ oder „Aus Ordner importieren“ verwenden?
Wenn es nur wenige PDFs sind, reicht „Dateien hinzufügen“. Wenn die Zieldateien zentral in einem Ordner gespeichert sind, empfiehlt sich die Option „Aus Ordner importieren“, da dies wiederholte Auswahlvorgänge reduziert. Überprüfen Sie nach dem Import die Anzahl der Einträge und die Pfade in der Liste, um sicherzustellen, dass die Auswahl den Erwartungen entspricht.
3. Warum werden in Excel einige Daten als Rautezeichen angezeigt?
Im Screenshot nach der Verarbeitung ist zu sehen, dass einige Zellen aufgrund zu geringer Spaltenbreite möglicherweise „####“ anzeigen. Dies ist in der Regel ein Anzeigeproblem in Excel und bedeutet keinen Datenverlust. Sie können die Spaltenbreite entsprechend vergrößern oder das Zellenformat anpassen, um den vollständigen Inhalt einzusehen.
4. Ist es normal, wenn PDF-Metadaten leer sind?
Bei einigen PDFs wurden beim Erstellen keine Metadaten wie Titel, Autor, Thema oder Schlüsselwörter eingetragen, sodass die entsprechenden Felder im exportierten Ergebnis leer sein können. Die Software liest lediglich die in der Datei vorhandenen Informationen stapelweise aus. Ob ein Wert vorhanden ist, hängt davon ab, ob die PDF selbst diese Metadaten enthält.
5. Müssen alle PDFs vor der Statistik in einen Ordner verschoben werden?
Das ist nicht zwingend erforderlich. Solange die Ziel-PDFs durch Hinzufügen von Dateien oder Importieren aus einem Ordner zur Liste hinzugefügt werden können, kann die Statistik durchgeführt werden. Aus organisatorischer Sicht ist es jedoch einfacher, Dateien derselben Aufgabe zentral zu speichern, um die Anzahl der Einträge zu überprüfen und die spätere Archivierung zu erleichtern.
Zusammenfassung: Die Umstellung der PDF-Listenerstellung von manueller Eingabe auf Stapelverarbeitung
Die Stapelstatistik von Pfad, Seitenanzahl und Metadaten von PDF-Dateien ist im Wesentlichen die Umwandlung verstreuter, unstrukturierter Dateiinformationen in eine strukturierte Excel-Tabelle. HeSoft Doc Batch Tool ist eine Bürosoftware, die sich für derartige Aufgaben mit hohem Wiederholungscharakter, vielen Dateien und eindeutigen Feldregeln eignet. Über die Funktion „Dateiinformationsstatistik“ können Benutzer schnell PDFs importieren, detaillierte PDF-Dateiinformationen auswählen, den Speicherort festlegen und die Verarbeitung starten, um letztendlich eine Excel-Liste mit grundlegenden Attributen und PDF-Metadaten zu erhalten.
Wenn Sie eine große Anzahl von PDF-Dokumenten organisieren, ist es nicht empfehlenswert, die Dateien weiterhin einzeln zu öffnen und manuelle Aufzeichnungen zu machen. Befolgen Sie direkt die Schritte in diesem Artikel: Importieren Sie zuerst die PDFs aus dem Ordner, wählen Sie dann die detaillierten PDF-Informationen aus und generieren Sie die Excel-Datei. So sparen Sie nicht nur viel Zeit, sondern reduzieren auch manuelle Statistikfehler und machen die Dokumentenarchivierung, Materialinventur und Projektablieferung effizienter und standardisierter.