Cómo extraer por lotes el número de páginas y los metadatos de los PDF y generar un archivo Excel de inventario


TraducciónEnglishFrançaisDeutschEspañol日本語한국어Hora de Actualización2026-08-02 06:31:08

Declaración: Todas las imágenes, textos y videos en el sitio web son solo para referencia y pueden no ser las más recientes, correctas o precisas. En caso de disputa, ¡refiérase al efecto de la experiencia real!

Cuando necesita crear una lista de archivos PDF, los campos habituales no son solo el nombre y el tamaño del archivo, sino también la ruta completa, la fecha de creación, la fecha de modificación, el número de páginas, así como metadatos como el título, autor, asunto y palabras clave del PDF. Este artículo toma HeSoft Doc Batch Tool como ejemplo para ilustrar cómo importar PDF por lotes, seleccionar información detallada de archivos PDF y generar una hoja de resumen de Excel mediante la función de estadísticas de información de archivos, ayudando a los usuarios a completar rápidamente inventarios de materiales, organización de directorios de archivos y verificaciones de entrega de documentos.

Muchas personas, al organizar materiales PDF, su primer impulso es abrir Excel y, mientras navegan por las carpetas, introducir manualmente el nombre del archivo, la ruta, el tamaño y la fecha. Si solo son unos pocos archivos, esto no supone un gran problema; pero cuando la cantidad alcanza decenas o cientos, el método manual se vuelve extremadamente ineficiente. Lo que es más problemático es que información como el número de páginas del PDF, el título, el autor, el asunto, las palabras clave, la fecha de creación, la aplicación y el programa de producción, normalmente no se pueden ver completos directamente en la lista de la carpeta, y es necesario abrir el archivo o consultar las propiedades para confirmarlos.

Este artículo presenta un método más adecuado para el entorno de oficina: usar la función "Estadísticas de información de archivos" de HeSoft Doc Batch Tool para extraer por lotes los atributos básicos y la información detallada de muchos archivos PDF, y resumirlos en una tabla de Excel. Todo el proceso se realiza mediante un asistente, desde la selección de archivos y la configuración de las opciones de procesamiento hasta el guardado y el inicio del proceso, lo que resulta adecuado para usuarios que necesitan crear rápidamente listas de archivos PDF, tablas de estadísticas de páginas de PDF o registros de metadatos de PDF.

Escenarios aplicables: desde la organización de directorios PDF hasta la revisión de metadatos

La necesidad de extraer por lotes el número de páginas y los metadatos de PDF no es infrecuente en la oficina. Suele aparecer en los siguientes tipos de trabajos:

  • Creación de directorios de archivo: Organizar escaneos, contratos electrónicos, documentos normativos, informes y otros PDF en un directorio de Excel para facilitar el archivo y la recuperación.
  • Estadísticas de material didáctico: Contar las páginas de PDF como apuntes de clase, materiales de estudio, manuales de ejercicios y lecturas para evaluar el volumen del material.
  • Entrega de documentación de proyecto: Generar una lista de archivos antes de enviar los materiales del proyecto para comprobar que los PDF están completos, la nomenclatura es uniforme y las rutas son correctas.
  • Verificación del origen de archivos: Utilizar campos de los metadatos del PDF como autor, aplicación y programa de producción para ayudar a determinar el origen y el método de generación del archivo.
  • Gestión de archivos por lotes: Filtrar documentos anómalos por campos como tamaño, fecha de modificación y carpeta de ubicación para descubrir archivos duplicados o material obsoleto.

En estos escenarios, Excel es el soporte de resumen más utilizado porque facilita la ordenación, el filtrado, la búsqueda y el intercambio. Y la capacidad de procesamiento por lotes del software de oficina permite recopilar de una vez la información de archivos que, de otro modo, requeriría una confirmación manual uno por uno.

Vista previa de resultados: ¿Qué cambia antes y después del procesamiento por lotes?

Antes del procesamiento: los PDF están dispersos en carpetas y solo se ven atributos limitados

La siguiente captura de pantalla del "antes" muestra una carpeta que contiene varios archivos PDF. Los nombres de archivo incluyen ClassNotesPacket.pdf, CourseSummaryReport.pdf, ExamPreparationNotes.pdf, KnowledgeReviewNotes.pdf, etc. En el explorador de archivos se puede ver información básica como el nombre, la fecha de modificación, el tipo y el tamaño, pero esta información no está completa. Por ejemplo, no se puede ver directamente cuántas páginas tiene cada PDF, ni se pueden consultar por lotes el título, el autor, el asunto o las palabras clave del PDF.

image-Extracción por lotes de páginas PDF,exportación por lotes de metadatos PDF,lista de archivos PDF en Excel

Si se quieren organizar estos PDF en un registro formal, la vista de carpeta por sí sola no es suficiente. Los usuarios normalmente también necesitan la ruta completa para localizar el archivo original; la fecha de creación y modificación para determinar la versión del archivo; el número de páginas para calcular el tamaño del material; y los metadatos para verificar la uniformidad del documento.

Después del procesamiento: se forma una lista estructurada en Excel con un PDF por fila

Una vez finalizado el proceso, la información de los archivos PDF se exporta a Excel. La captura de pantalla muestra que la tabla ya no es solo una lista de nombres de archivo, sino que contiene campos muy completos: Ruta, Nombre, Nombre (sin extensión), Extensión, Tamaño (bytes), Tamaño, Nombre de la carpeta contenedora, Ruta de la carpeta contenedora, Fecha de creación, Fecha de modificación, Número de páginas, y metadatos del PDF como Título, Autor, Asunto, Palabras clave, Fecha de creación, Aplicación, Programa de producción, etc.

image-Extracción por lotes de páginas PDF,exportación por lotes de metadatos PDF,lista de archivos PDF en Excel

Este tipo de resultado en Excel es más adecuado para el procesamiento ofimático posterior. Por ejemplo, si se desea ver qué PDF tienen más de 10 páginas, se puede ordenar por "Número de páginas"; para comprobar si un lote de PDF fue generado por la misma aplicación, se puede filtrar por "PDF - Metadatos - Aplicación"; para organizar el origen del material por autor, se puede filtrar o agrupar por "PDF - Metadatos - Autor".

Pasos a seguir: Exportar por lotes el número de páginas, la ruta y los metadatos de PDF

Paso 1: Abrir la entrada de Estadísticas de información de archivos

Tras iniciar HeSoft Doc Batch Tool , seleccione "Organización de archivos" en el menú de navegación izquierdo. En el área de tarjetas de funciones verá "Estadísticas de información de archivos", cuya descripción es: estadísticas por lotes de nombre, ruta, tamaño, hora y metadatos de varios archivos. Como queremos extraer información de archivos PDF, haga clic en esta función para entrar.

image-Extracción por lotes de páginas PDF,exportación por lotes de metadatos PDF,lista de archivos PDF en Excel

La función de este paso es seleccionar la herramienta de procesamiento por lotes correcta. No seleccione "Estadísticas de información de carpetas", porque el objetivo de este artículo es recopilar estadísticas de archivos PDF específicos, no de la carpeta en sí. Al entrar en "Estadísticas de información de archivos", el software iniciará un asistente paso a paso para guiar al usuario a través de la importación, la configuración de opciones, la ubicación de guardado y el inicio del proceso.

Paso 2: Importar los archivos PDF a procesar

Una vez en la página de la función, se encuentra en el paso 1 "Seleccionar los registros a procesar". En la parte superior derecha de la página se ofrecen dos opciones comunes: "Agregar archivo" y "Agregar archivos en una carpeta". Si los PDF están relativamente concentrados, se recomienda usar directamente "Agregar archivos en una carpeta" para cargar de una vez todos los archivos de la carpeta de destino en la lista. Si solo desea procesar unos pocos PDF, puede usar "Agregar archivo".

image-Extracción por lotes de páginas PDF,exportación por lotes de metadatos PDF,lista de archivos PDF en Excel

Una vez completada la importación, la tabla mostrará el número de secuencia del archivo, nombre, ruta, extensión, fecha de creación, fecha de modificación y otra información. La parte inferior de la captura de pantalla muestra un recuento de 20 registros, lo que indica que se han añadido 20 archivos PDF a esta tarea. En este punto, se recomienda hacer una primera verificación: que la extensión del archivo sea pdf, que la ruta pertenezca a la carpeta de destino y que el número de archivos coincida con lo esperado.

Si descubre archivos seleccionados por error, puede eliminar registros individuales en la columna de operaciones; si necesita volver a importar, puede usar "Vaciar". Cuando haya muchos archivos, las opciones de "Filtro" y "Orden" que ofrece la página también pueden ayudar a revisar rápidamente la lista. Una vez confirmado que es correcto, haga clic en "Siguiente" en la parte inferior.

Paso 3: Seleccionar la información detallada del archivo PDF en la información adicional

Al entrar en el paso 2 "Configurar opciones de procesamiento", verá el área de "Información adicional". Aquí se enumeran las opciones de información detallada para varios tipos de archivo, incluyendo información detallada de archivos de Word, Excel, PPT, PDF, archivos de texto e imágenes.

image-Extracción por lotes de páginas PDF,exportación por lotes de metadatos PDF,lista de archivos PDF en Excel

Dado que esta tarea consiste en extraer por lotes el número de páginas y los metadatos de los PDF, es necesario marcar la casilla "Información detallada de archivo PDF". Esta es la configuración clave para generar una lista de PDF completa. Al marcarla, el software, además de recopilar los atributos básicos del archivo, leerá los campos detallados relacionados con el PDF. Las columnas que aparecen en el Excel final como "Número de páginas", "PDF - Metadatos - Título", "PDF - Metadatos - Autor", "PDF - Metadatos - Asunto", "PDF - Metadatos - Palabras clave" son precisamente el resultado de esta opción.

Si se procesan simultáneamente otros archivos de Word, Excel, PPT o imágenes, también puede marcar la información detallada correspondiente según sus necesidades reales. Pero para que la tabla de resultados sea más clara, se recomienda importar solo PDF esta vez, o al menos asegurarse de que los archivos clave a analizar son los PDF.

Paso 4: Establecer la ubicación para guardar los resultados estadísticos

En el flujo superior, el paso 3 es "Establecer ubicación de guardado". Después de hacer clic en "Siguiente" para entrar, siga las indicaciones de la interfaz para elegir dónde guardar el archivo de resultados. Se recomienda guardar el resultado en una ubicación fácil de encontrar, como el directorio del proyecto actual de los PDF, la carpeta de archivo del material o una carpeta específica para resultados estadísticos.

El propósito de establecer la ubicación de guardado es evitar no poder encontrar el archivo de Excel exportado una vez finalizado el proceso. Para los usuarios que necesitan procesar estadísticas de diferentes lotes de PDF varias veces, también pueden añadir la fecha, el nombre del proyecto o la categoría del material al nombre del archivo guardado, para distinguir fácilmente las tablas de resumen de los distintos lotes.

Paso 5: Iniciar el proceso y ver el resultado en Excel

Una vez configurada la ubicación de guardado, pasará al paso 4 "Iniciar proceso". El software leerá la información de los archivos PDF uno por uno según la lista de tareas y la organizará automáticamente en una tabla de resultados. En comparación con la estadística manual, la mayor ventaja del proceso por lotes es la estabilidad, uniformidad y repetibilidad: el mismo lote de archivos se procesa con el mismo conjunto de campos de salida, lo que evita problemas como la inconsistencia de los nombres de las columnas, formatos de fecha no uniformes o rutas copiadas de forma incompleta al introducir los datos manualmente.

Una vez finalizado el proceso, abra el resultado en Excel. Se recomienda comprobar prioritariamente si los siguientes campos cumplen los requisitos: si la ruta completa permite localizar el archivo original; si se ha generado el número de páginas; si existen las columnas de metadatos como título, autor, asunto y palabras clave del PDF; si las fechas de creación y modificación se pueden utilizar para determinar la versión; y si el tamaño del archivo se puede utilizar para comprobar anomalías.

Preguntas frecuentes y precauciones

1. Solo quiero contar las páginas de los PDF, ¿es necesario exportar todos los metadatos?

A juzgar por la captura de pantalla del resultado, al marcar la información detallada del archivo PDF, se mostrará el número de páginas y varios campos de metadatos del PDF. Si solo le interesa el número de páginas, puede conservar la columna "Número de páginas" y las columnas necesarias de ruta y nombre de archivo después de generar el Excel, y eliminar u ocultar las columnas de metadatos que no necesite. De esta manera, se puede aprovechar la extracción completa del software y mantener la concisión de la tabla final.

2. ¿Cuál es la diferencia entre el nombre del archivo PDF y el nombre en Excel?

La tabla de resultados normalmente contendrá tanto "Nombre" como "Nombre (sin extensión)". El primero incluye la extensión .pdf y es adecuado para cotejar con el archivo original; el segundo omite la extensión y es adecuado para la posterior organización y coincidencia por título, número o nombre del material.

3. ¿Por qué es necesario el campo de ruta completa?

Cuando existen PDF con el mismo nombre en varias carpetas, confiar solo en el nombre del archivo puede no ser suficiente para determinar de qué archivo específico se trata. La ruta completa puede especificar la ubicación del archivo, facilitando su localización, la apertura del archivo original o su migración posterior.

4. Si los metadatos están incompletos, ¿significa que el software no los leyó correctamente?

No necesariamente. La integridad de los metadatos del PDF depende del propio archivo. Muchos PDF se generan sin rellenar el autor, el asunto o las palabras clave, por lo que es normal que los campos correspondientes estén vacíos. El software puede extraer por lotes la información existente, pero no puede generar metadatos de la nada si no existen en el archivo.

5. Cuando hay una gran cantidad de archivos, ¿cómo reducir la probabilidad de errores?

Se recomienda importar por lotes según la carpeta o el proyecto, confirmar primero el número de registros y las rutas, y luego marcar la información detallada del archivo PDF. Una vez finalizado el proceso, utilice Excel para filtrar valores vacíos, números de página anómalos u horas anómalas para realizar una segunda comprobación. De este modo, se mantiene la eficiencia del proceso y se facilita la localización de archivos problemáticos.

Resumen: Utilizar el procesamiento por lotes para estadísticas de páginas y metadatos de PDF

El núcleo de la creación de una lista de archivos PDF no consiste simplemente en enumerar los nombres de archivo, sino en consolidar de forma unificada la información dispersa en el sistema de archivos y dentro de los propios PDF. HeSoft Doc Batch Tool , a través de la función "Estadísticas de información de archivos", conecta los pasos de importar archivos, marcar la información detallada del PDF, establecer la ubicación de guardado e iniciar el proceso, permitiendo a los usuarios obtener rápidamente una tabla de información de PDF en formato Excel.

Si está archivando materiales PDF, entregando documentos, contando páginas o revisando metadatos, puede seguir el flujo de trabajo de este artículo: primero acceda a "Estadísticas de información de archivos" en organización de archivos, luego importe los archivos PDF, marque "Información detallada de archivo PDF" y, por último, exporte a Excel. En comparación con abrir los PDF uno por uno para consultarlos, este método es más adecuado para el procesamiento de grandes volúmenes de archivos en un entorno de oficina, ya que puede reducir significativamente el trabajo repetitivo y mejorar la precisión de las estadísticas y la eficiencia en la entrega.


Palabra claveExtracción por lotes de páginas PDF , exportación por lotes de metadatos PDF , lista de archivos PDF en Excel
Hora de Creación2026-08-02 06:30:52

Declaración: Todas las imágenes, textos y videos en el sitio web son solo para referencia y pueden no ser las más recientes, correctas o precisas. En caso de disputa, ¡refiérase al efecto de la experiencia real!

Artículos Relacionados

Más artículos