Extractor auditado de Word a Markdown
Extrae texto, tablas, notas, comentarios, enlaces, imágenes y objetos de un DOCX, y genera un manifiesto de lo que pudo representar y lo que quedó fuera.
Qué incluye
Convertir un Word a Markdown con una herramienta genérica puede perder silenciosamente comentarios, notas al pie o el texto de una tabla, y nadie se entera hasta que echa en falta ese párrafo. Este extractor recorre cuerpo, tablas, cabeceras, pies, notas y comentarios de un DOCX OOXML y, junto al `documento.md`, genera un `manifest.json` que registra qué partes encontró y qué elementos no pudo representar: la auditoría va con el resultado, no aparte. Falla en cerrado si el paquete no lleva `word/document.xml` en vez de devolver un Markdown a medias sin avisar, y deliberadamente no saca el texto borrado con control de cambios ni los códigos de campo, solo el contenido vigente. Conserva el DOCX original: no escribe encima de la fuente. Para quien necesita migrar o auditar documentos Word a Markdown y quiere poder demostrar qué se extrajo y qué se quedó fuera, no solo un volcado de texto.
Resultados
- documento.md con el contenido extraído y manifest.json con lo que se encontró y lo que no se pudo representar.
Requisitos
- Python 3.10 o superior.
- Documento DOCX válido
- Permiso de lectura y una carpeta de salida