Wenn sich in einem Ordner eine große Anzahl von TXT-Textdateien ansammelt, ist es sehr zeitaufwändig, diese einzeln zu öffnen, um Pfad, Zeilenanzahl, Zeichenanzahl und Textkodierung zu überprüfen, und es können leicht Statistiken übersehen werden. Dieser Artikel beschreibt, wie Sie mit der Dateiinformationsstatistikfunktion der Bürosoftware „ HeSoft Doc Batch Tool “ den Namen, Pfad, die Erweiterung, Größe, das Erstellungsdatum, das Änderungsdatum, die Textkodierung, die Textzeilenanzahl und die Textzeichenanzahl mehrerer TXT-Dateien auf einmal in einer Excel-Tabelle zusammenfassen können. Dies eignet sich für Szenarien wie Bestandsaufnahmen, Inhaltsprüfungen, Textdatenorganisation und Archivierungsübergaben.
Bei der täglichen Büroarbeit, der Aufbereitung von Lehrmaterialien, der Content-Pflege, der Datenarchivierung oder Projektübergaben stößt man häufig auf ein scheinbar einfaches, aber sehr zeitaufwendiges Problem: In einem Ordner befinden sich viele txt-Notepad-Dateien, und man muss den vollständigen Pfad, den Dateinamen, die Zeilenanzahl, die Zeichenanzahl und die Textkodierung jeder Datei erfassen. Bei nur ein oder zwei Dateien ist es noch akzeptabel, den Editor manuell zu öffnen und nachzusehen. Aber wenn die Anzahl der Dateien auf Dutzende, Hunderte oder sogar noch mehr ansteigt, ist das einzelne Öffnen, Kopieren der Pfade und Notieren von Zeilen- und Zeichenanzahl nicht nur ineffizient, sondern führt durch die sich wiederholende Arbeit auch leicht zu Auslassungen oder Eingabefehlern.
Besonders die Textkodierung wird von vielen Benutzern im Alltag nicht besonders beachtet. Bei der Stapelverarbeitung in Systemen, der Migration von Materialien, dem programmgesteuerten Einlesen von Texten oder der Fehlersuche bei Darstellungsproblemen mit falschen Zeichen wirken sich Unterschiede in Kodierungen wie utf-8, gb18030, windows-1252, utf-16, us-ascii jedoch direkt auf die nachfolgenden Verarbeitungsergebnisse aus. Daher macht der einheitliche Export von Basisinformationen und detaillierten Textinformationen von TXT-Dateien in eine Excel-Tabelle die anschließende Filterung, Überprüfung, Archivierung und Analyse deutlich übersichtlicher.
Dieser Artikel zeigt anhand von Screenshots, wie Sie die Funktion "Dateiinformationsstatistik" in der Bürosoftware HeSoft Doc Batch Tool nutzen, um eine Stapelstatistik für mehrere TXT-Dateien zu erstellen und die Ergebnisse in Excel zusammenzufassen. Der gesamte Prozess erfordert kein einzelnes Öffnen der Dateien und eignet sich für Büroanwender, die sich wiederholende Arbeitsschritte reduzieren und die Effizienz der Dateiverwaltung steigern möchten.
Anwendungsszenarien: Wann eignet sich die Stapelstatistik für TXT-Dateiinformationen?
Die Stapelerfassung von TXT-Dateipfaden, Zeilenanzahl, Zeichenanzahl und Textkodierung dient nicht nur dem reinen Zählen von Dateien. In vielen praktischen Arbeitsabläufen kann eine solche Statistik direkt als Materialliste, Übergabedokument oder Grundlage für die Fehlerbehebung dienen.
1. Archivierung von Textmaterialien und Erstellung von Dateilisten
Beispielsweise müssen Bildungseinrichtungen, Schulen, Materialverwalter oder Projektmitglieder eine Sammlung von Lernnotizen, Kurszusammenfassungen, Leselisten, Prüfungsmaterialien usw. als TXT-Dokumente ordnen. Durch die Stapelstatistik können schnell Name, Ordnerpfad, Erstellungsdatum, Änderungsdatum, Dateigröße und weitere Informationen jeder Datei ermittelt werden, was die spätere Archivierung und das Wiederauffinden erleichtert.
2. Erfassung des Textarbeitsvolumens durch Content- oder Redaktionsteams
Wenn ein Team viele Texte, Skripte, Notizen oder Materialien im txt-Format speichert, kann die Erfassung von Textzeilen und Zeichenanzahl helfen, den Umfang der Inhalte zu beurteilen. Im Vergleich zum manuellen Öffnen jeder Datei können Sie nach dem Stapelexport nach Excel direkt nach der Zeichenanzahl sortieren und so schnell zu kurze, zu lange oder anomale Textdateien identifizieren.
3. Überprüfung der Textkodierung vor dem Programmimport
Viele Geschäftssysteme haben beim Import von TXT-, CSV- oder Log-Textdateien Anforderungen an das Kodierungsformat. Wenn die Dateikodierung uneinheitlich ist, kann es zu fehlerhaften Zeichen, Importfehlern oder fehlerhafter Feldidentifikation kommen. Durch eine einmalige Erfassung der Textkodierung kann vorab festgestellt werden, welche Dateien utf-8, gb18030, utf-16 oder windows-1252 sind, um diese dann gezielt zu bearbeiten.
4. Überprüfung vor Dateimigration, -sicherung und -übergabe
Vor einer Dateimigration oder -übergabe muss in der Regel eine Dateiliste erstellt werden. In einer Excel-Tabelle können Pfad, Größe, Erstellungszeitpunkt, Änderungszeitpunkt usw. erfasst werden, was den Vergleich auf Vollständigkeit nach der Migration erleichtert und dem Empfänger einen schnellen Überblick über die Materialstruktur ermöglicht.
5. Vorbereitende Arbeiten vor der Analyse von Stapeltextdaten
Wenn TXT-Texte später einer Segmentierung, Statistik, Bereinigung oder einem Import in andere Analysewerkzeuge unterzogen werden sollen, hilft die vorherige Kenntnis von Zeilenanzahl, Zeichenanzahl und Kodierung jeder Datei, die Datenqualität zu bewerten. Wenn beispielsweise die Zeichenanzahl bestimmter Dateien 0 oder auffällig niedrig ist, müssen diese möglicherweise gesondert überprüft werden.
Ergebnisvorschau: Vor der Verarbeitung verstreute TXT-Dateien, danach eine Excel-Zusammenfassung
Vor der Verarbeitung: Viele TXT-Notepad-Dateien im Ordner
Im Screenshot vor der Verarbeitung ist zu sehen, dass der Ordner mehrere txt-Dateien enthält, z. B. ReadingJournalNotes.txt, VocabularyPracticeText.txt, GrammarReviewLines.txt, StudyPlanningNotes.txt, CourseSummaryText.txt usw. Zu diesem Zeitpunkt können wir im Datei-Explorer nur die Dateinamen und teilweise Zeitinformationen sehen, aber nicht direkt die Textkodierung, Textzeilenanzahl und Textzeichenanzahl jeder Datei einsehen.
Müsste man diese Informationen einzeln erfassen, wäre der traditionelle Weg, die Datei zu öffnen, den Inhalt zu prüfen, den Dateipfad zu kopieren und manuell in Excel zu übertragen. Je mehr Dateien, desto deutlicher der Zeitaufwand.

Nach der Verarbeitung: Alle TXT-Dateiinformationen in einer Excel-Tabelle zusammengefasst
Nach Abschluss der Verarbeitung gibt die Software die Statistik als Excel-Tabelle aus. Im Screenshot nach der Verarbeitung ist zu sehen, dass die Tabelle mehrere Informationsspalten generiert hat: Pfad, Name, Name (ohne Erweiterung), Erweiterung, Größe (Bytes), Größe, Name des übergeordneten Ordners, Pfad des übergeordneten Ordners, Erstellungszeitpunkt, Änderungszeitpunkt sowie die textdateibezogenen Spalten "Text - Textkodierung", "Text - Zeilenanzahl", "Text - Zeichenanzahl".
Solche Ergebnisse eignen sich hervorragend für die anschließende Filterung und Analyse. Sie können beispielsweise in Excel nach "Text - Zeilenanzahl" sortieren, um die Datei mit den meisten Zeilen zu finden; nach "Text - Textkodierung" filtern, um Dateien mit abweichender Kodierung schnell zu identifizieren; oder nach "Pfad des übergeordneten Ordners" gruppieren, um die Dateisituation in verschiedenen Verzeichnissen zu betrachten.

Bedienungsschritte: Stapelstatistik von TXT-Dateiinformationen mit HeSoft Doc Batch Tool
Nachfolgend wird anhand der Screenshots erläutert, wie die Stapelstatistik durchgeführt wird. In diesem Artikel wird HeSoft Doc Batch Tool verwendet, eine Software zur Stapelverarbeitung von Dokumenten für den Büroalltag, die sich für sich wiederholende Aufgaben wie das Ordnen, Erfassen, Klassifizieren und Konvertieren großer Dateimengen eignet. Der Schwerpunkt dieser Anwendung liegt auf der Funktion "Dateiinformationsstatistik".
Schritt 1: Rufen Sie "Dateien ordnen" auf und wählen Sie die Funktion "Dateiinformationsstatistik"
Nach dem Öffnen der Software sehen Sie in der linken Navigationsleiste mehrere Funktionskategorien, z. B. Startseite, Aufgabenabläufe, Alle Werkzeuge, Dateiname, Ordnername, Dateien ordnen, Word-Werkzeuge, Excel-Werkzeuge, PowerPoint-Werkzeuge, PDF-Werkzeuge, Textwerkzeuge, Bildwerkzeuge, Videowerkzeuge, Audiowerkzeuge usw.
Hier sollen Pfad, Größe, Zeit und detaillierte Textinformationen von TXT-Dateien erfasst werden, daher muss die Kategorie Dateien ordnen links aufgerufen werden. Suchen und klicken Sie in der rechten Funktionskarten-Ansicht auf "3. Dateiinformationsstatistik". Der Hinweis im Screenshot besagt, dass diese Funktion zum "Batch-Erfassen von Informationen wie Name, Pfad, Größe, Zeit und Metadaten verschiedener Dateien" dient, was unserem Ziel, eine TXT-Dateiliste und Texterfassungsergebnisse zu exportieren, entspricht.

Das Ziel dieses Schrittes ist die Auswahl des richtigen Einstiegspunkts für die Stapelverarbeitung. Nach Auswahl dieser Funktion gelangt die Software auf eine schrittweise geführte Assistentenseite, auf der die Bedienung nacheinander gemäß den Schritten "Zu verarbeitende Datensätze auswählen", "Verarbeitungsoptionen festlegen", "Speicherort festlegen" und "Verarbeitung starten" abläuft.
Schritt 2: Importieren der zu erfassenden TXT-Dateien
Nach dem Aufrufen der Seite "Dateiinformationsstatistik" sehen Sie oben Bedienschaltflächen wie Dateien hinzufügen, Dateien aus Ordner importieren, Leeren und Mehr. Wenn es nur wenige TXT-Dateien sind, die sich zudem an verschiedenen Orten befinden, können Sie "Dateien hinzufügen" verwenden, um bestimmte Dateien auszuwählen; wenn diese txt-Notepad-Dateien gesammelt im selben Ordner liegen, empfiehlt sich eher "Dateien aus Ordner importieren", um die Dateien auf einmal in die Liste zu übernehmen.
Im Screenshot ist zu sehen, dass nach dem Import mehrere Datensätze mit Feldern wie Nummer, Name, Pfad, Erweiterung, Erstellungszeitpunkt, Änderungszeitpunkt in der Liste erscheinen. Beispielsweise wurden Dateien wie ClassNotesArchive.txt, CourseSummaryText.txt, ExamPreparationText.txt usw. in die Liste der zu verarbeitenden Dateien aufgenommen, als Pfad wird D:\test\folders\ mit der entsprechenden txt-Datei angezeigt.

Wichtig in diesem Schritt ist die Bestätigung, ob die Dateiliste vollständig ist. Unten im Screenshot wird "Anzahl Datensätze: 20" angezeigt, was bedeutet, dass aktuell 20 Dateien importiert wurden. Der Benutzer kann anhand der Liste Dateinamen und Pfade auf Richtigkeit überprüfen. Wurden versehentlich Dateien ausgewählt, können diese über das Löschsymbol auf der rechten Seite der Liste entfernt werden; soll neu ausgewählt werden, kann auch "Leeren" und anschließend ein erneuter Import genutzt werden.
Nach abgeschlossenem Import und Bestätigung klicken Sie auf Weiter am Seitenende, um zu den Verarbeitungsoptionen zu gelangen.
Schritt 3: Unter Zusatzinformationen "Detaillierte Informationen zu Textdateien" aktivieren
Im zweiten Schritt "Verarbeitungsoptionen festlegen" erscheint der Bereich "Zusatzinformationen". Im Screenshot sind mehrere auswählbare Optionen zu sehen, darunter detaillierte Informationen zu Word-Dateien, Excel-Dateien, PPT-Dateien, PDF-Dateien, Textdateien, Bilddateien usw.
Da es sich bei den Verarbeitungsobjekten um TXT-Textdateien handelt und das Ziel die Erfassung von Textkodierung, Textzeilen- und Textzeichenanzahl ist, muss "Detaillierte Informationen zu Textdateien" aktiviert werden. Im Screenshot ist diese Option bereits aktiviert, was bedeutet, dass die Software bei der Erstellung des Statistikergebnisses nicht nur Basisdateiinformationen exportiert, sondern zusätzlich auch detaillierte Eigenschaften von Textdateien analysiert.

Dieser Schritt ist sehr wichtig. Wenn nur allgemeine Dateiinformationen erfasst werden, erhält man üblicherweise nur Basisfelder wie Dateiname, Pfad, Größe, Zeit; durch Aktivieren der "Detaillierte Informationen zu Textdateien" erscheinen in der exportierten Excel-Tabelle erst die Spalten "Text - Textkodierung", "Text - Zeilenanzahl", "Text - Zeichenanzahl" usw., die sich auf den TXT-Inhalt beziehen.
Nach erfolgter Aktivierung klicken Sie auf Weiter.
Schritt 4: Speicherort festlegen und Verarbeitung starten
Im oberen Teil des Assistenten ist zu sehen, dass die Schritte "Speicherort festlegen" und "Verarbeitung starten" folgen. Auch wenn der Screenshot die Seite für den Speicherort nicht zeigt, lässt sich anhand des Seitenablaufs nachvollziehen, dass der Benutzer im nächsten Schritt den Speicherort für das Statistikziel festlegen muss. Es empfiehlt sich, ein leicht auffindbares Verzeichnis zu wählen, z. B. den aktuellen Projektordner, ein temporäres Desktop-Verzeichnis oder einen Ordner speziell für Berichtsausgaben.
Nach Festlegen des Speicherorts geht es weiter zu "Verarbeitung starten". Die Software liest gemäß der zuvor importierten Dateiliste die Basiseigenschaften und detaillierten Textinformationen jeder TXT-Datei ein und erstellt das zusammengefasste Ergebnis. Nach Abschluss der Verarbeitung öffnen Sie die exportierte Excel-Datei und sehen eine ähnliche Statistik wie in der Ergebnisvorschau.
Es wird empfohlen, nach der Verarbeitung zunächst Folgendes zu prüfen: Stimmt die Dateianzahl mit der Anzahl der importierten Datensätze überein? Gibt es bei "Text - Textkodierung" leere oder abnormale Werte? Entsprechen "Text - Zeilenanzahl" und "Text - Zeichenanzahl" den Erwartungen? Verweist die Pfadspalte auf den korrekten Speicherort der Quelldatei?
Interpretation der Excel-Ergebnisse: Auf diese Felder sollten Sie besonders achten
Die exportierte Excel-Datei ist nicht nur eine Dateiliste, sie hilft dem Benutzer, die TXT-Dateien aus verschiedenen Blickwinkeln zu betrachten. Die Bedeutung einiger häufig verwendeter Felder wird nachfolgend erläutert.
Pfad
Der Pfad gibt die vollständige Position jeder Datei auf dem Datenträger an. Dies ist sehr nützlich für die Materialübergabe, die Sicherungsprüfung und die Lokalisierung anormaler Dateien. Sollte später festgestellt werden, dass die Kodierung oder Zeichenanzahl einer Textdatei nicht korrekt ist, kann die Originaldatei schnell über den Pfad gefunden werden.
Name und Name (ohne Erweiterung)
"Name" enthält normalerweise die Erweiterung .txt, während "Name (ohne Erweiterung)" nur den Hauptdateinamen beibehält. Ersteres eignet sich zum Abgleich mit der tatsächlichen Datei, Letzteres zur Erstellung von Verzeichnissen, Schlagwörtern oder für die Analyse von Benennungsregeln.
Erweiterung
In diesem Beispiel lautet die Erweiterung stets txt. Falls der per Stapel importierte Ordner andere Dateitypen enthält, hilft diese Spalte beim schnellen Herausfiltern der txt-Dateien oder bei der Prüfung, ob fälschlicherweise doc-, docx-, xlsx-, pdf- oder andere Dateien importiert wurden.
Größe (Bytes) und Größe
Die Dateigröße kann indirekt den Umfang des Textinhalts widerspiegeln. Zeichenanzahl und Dateigröße hängen normalerweise zusammen, sind aber nicht identisch, da verschiedene Textkodierungen unterschiedliche Byte-Mengen benötigen. Beispielsweise gibt es Unterschiede in den Byte-Regeln von utf-8, utf-16 und gb18030.
Erstellungszeitpunkt und Änderungszeitpunkt
Diese beiden Spalten eignen sich für die Analyse des Dateilebenszyklus, z. B. um zu sehen, welche Dateien kürzlich aktualisiert wurden und welche lange nicht geändert wurden. In Szenarien der Materialarchivierung wird der Änderungszeitpunkt auch häufig zur Bestimmung der Dateiversion genutzt.
Text - Textkodierung
Dies ist eine sehr wichtige Spalte in der TXT-Stapelstatistik. Im Screenshot ist zu sehen, dass verschiedene Dateien möglicherweise als utf-8, gb18030, windows-1252, utf-16, us-ascii usw. identifiziert werden. Wenn später ein einheitlicher Import in ein bestimmtes System erforderlich ist, können zunächst anhand dieser Spalte Dateien mit abweichender Kodierung herausgefiltert werden, um Fehldarstellungen beim Import zu vermeiden.
Text - Zeilenanzahl
Die Zeilenanzahl eignet sich zur Erfassung der Textstruktur. Bei TXT-Datendateien mit einem Datensatz pro Zeile kann über die Zeilenanzahl die Anzahl der Datensätze geschätzt werden; auch bei Lehrnotizen, Lernlisten oder Logdateien kann die Zeilenanzahl Aufschluss über den Inhaltsumfang geben.
Text - Zeichenanzahl
Die Zeichenanzahl eignet sich zur Erfassung des Textinhaltsvolumens. Für Texte, Beschreibungen, Skripte, Notizen usw. ist die Zeichenanzahl aussagekräftiger als die Dateigröße. Nach dem Export nach Excel können Sortier-, Filter- und Zusammenfassungsfunktionen für die weitere Analyse genutzt werden.
Häufige Fragen und Hinweise
1. Warum muss unbedingt "Detaillierte Informationen zu Textdateien" aktiviert werden?
Weil Textkodierung, Zeilenanzahl und Zeichenanzahl zusätzliche, mit dem Textinhalt zusammenhängende Informationen sind und keine gewöhnlichen Dateieigenschaften. Ohne Aktivierung dieser Option enthalten die exportierten Ergebnisse möglicherweise nur Basisinformationen wie Name, Pfad, Erweiterung, Größe, Zeit und erfüllen nicht die Anforderungen an die Erfassung von TXT-Textinhalten.
2. Können TXT-Dateien aus vielen Unterordnerebenen erfasst werden?
Die Screenshots zeigen den Import von Dateien aus einem Ordner. Ob Unterordner enthalten sind, hängt von den tatsächlichen Optionen und Regeln beim Softwareimport ab. Um ein genaues Ergebnis sicherzustellen, wird empfohlen, nach dem Import zunächst die Liste der zu verarbeitenden Dateien zu prüfen und zu bestätigen, ob alle zu erfassenden Dateien in der Liste enthalten sind.
3. Was tun, wenn Zeitspalten in Excel "#######" anzeigen?
Im Screenshot nach der Verarbeitung werden teilweise Rauten in den Zeitspalten angezeigt. Dies ist in der Regel ein durch unzureichende Spaltenbreite in Excel verursachtes Anzeigeproblem und deutet nicht unbedingt auf fehlerhafte Daten hin. Sie können die betreffende Spalte in Excel entsprechend verbreitern oder das Zellenformat anpassen, um die vollständige Zeit anzuzeigen.
4. Wozu dienen die Erkennungsergebnisse der Textkodierung?
Die Textkodierung kann helfen zu beurteilen, ob bei einer Datei Probleme mit falschen Zeichen auftreten könnten. Wenn beispielsweise einige Dateien utf-8, andere gb18030 oder utf-16 sind und das nachfolgende System nur eine Kodierung unterstützt, muss vorher konvertiert oder gruppiert werden. Zuerst die Kodierung zu erfassen und dann die Dateien zu verarbeiten, ist effizienter, als nach Auftreten der Fehldarstellung zu suchen.
5. Können die Statistik-Ergebnisse weiter gefiltert und sortiert werden?
Ja. Nach dem Export nach Excel können Benutzer die Filter-, Sortier-, bedingte Formatierungs- und Pivot-Tabellen-Funktionen von Excel für die weitere Analyse nutzen. Beispielsweise nach Zeichenanzahl absteigend sortieren, nach Kodierung gruppieren, nach Ordnerpfad filtern oder nach kürzlich aktualisierten Dateien anhand des Änderungszeitpunkts suchen.
6. Müssen die Quelldateien vor der Stapelerfassung gesichert werden?
Die Dateiinformationserfassung liest normalerweise Dateiinformationen und erstellt einen Bericht, ohne den Inhalt der Quelldateien zu ändern. Dennoch wird bei jeder Stapeloperation, insbesondere wenn sie wichtige Materialien betrifft, empfohlen, eine Sicherung der Originaldateien aufzubewahren und den Prozess zunächst mit einer kleinen Stichprobe zu testen, um zu bestätigen, dass die exportierten Felder den Anforderungen entsprechen, bevor alle Dateien verarbeitet werden.
Zusammenfassung: Stapelerfassung statt manueller Erfassung für effizienteres TXT-Dateimanagement
Bei einer großen Anzahl von TXT-Dateien ist die manuelle Erfassung von Pfaden, Zeilenanzahl, Zeichenanzahl und Textkodierung nicht nur zeitaufwendig, sondern auch fehleranfällig durch Auslassungen, Falscheingaben und Doppelerfassungen. Mit der Funktion "Dateiinformationsstatistik" von HeSoft Doc Batch Tool können die Basiseigenschaften und detaillierten Textinformationen mehrerer txt-Notepad-Dateien auf einmal in einer Excel-Tabelle zusammengefasst werden.
Der gesamte Ablauf lässt sich wie folgt zusammenfassen: Rufen Sie "Dateiinformationsstatistik" unter "Dateien ordnen" auf, importieren Sie die zu verarbeitenden TXT-Dateien, aktivieren Sie "Detaillierte Informationen zu Textdateien", legen Sie den Speicherort fest und starten Sie die Verarbeitung. Der resultierende Excel-Bericht dient sowohl als Dateiliste als auch als Grundlage für die Textkodierungsprüfung, Analyse des Inhaltsumfangs, Materialarchivierung und Projektübergabe.
Wenn Sie eine große Anzahl von TXT-, Textlog-, Lernnotiz- oder Materialdateien ordnen, empfiehlt es sich, zuerst einen Probelauf mit wenigen Dateien durchzuführen, um zu bestätigen, dass die Ergebnisfelder den Anforderungen entsprechen, bevor Sie alle Dateien stapelweise für die Statistik importieren. Dies reduziert sich wiederholende Arbeit erheblich und verwandelt die Aufgabe, die sonst das einzelne Öffnen jeder Datei erfordert hätte, in eine einmalige Stapelverarbeitung mit anschließender Excel-Analyse.