Inventario de contenido documental
Inspecciona paquetes DOCX, PPTX y XLSX, o documentos PDF, para contar partes, texto, tablas, imágenes, notas y objetos antes de procesarlos.
Qué incluye
Cuando toca decidir si un DOCX, PPTX, XLSX o PDF está realmente listo para procesar, fiarte solo del tamaño del archivo o de una ojeada rápida puede hacerte pasar por alto tablas, imágenes o notas que después faltan en la conversión. Esta herramienta inspecciona las partes internas del paquete —sin modificarlo— y cuenta texto, tablas, imágenes, notas y objetos antes de que cualquier otro proceso lo toque; con PDF necesita PyMuPDF instalada y, si falta, aborta con el aviso en vez de dar un inventario incompleto. Entrega el resultado en texto legible o en JSON con los mismos contadores, así que puede encadenarse con otra herramienta o revisarse a ojo. Un inventario vacío solo dice que no se detectó contenido de ese tipo, no que el documento esté vacío de verdad. Para quien necesita verificar qué trae un documento antes de extraerlo, convertirlo o auditarlo, sin abrir cada fichero a mano.
Resultados
- Conteo de partes, texto, tablas, imágenes, notas y objetos del documento, en texto legible o JSON.
Requisitos
- Python 3.10 o superior.
- PyMuPDF es obligatoria para PDF. Sin ella la herramienta no analiza PDF: aborta con un mensaje de instalación. Para DOCX, PPTX y XLSX no hace falta nada