Cómo convertir PDF a Markdown: herramientas, OCR y revisión
Actualizado: 20 de septiembre de 2026
Convertir un PDF a Markdown resulta útil cuando quieres editar su texto, guardarlo en tus notas o preparar documentos para una herramienta de IA. El resultado es un archivo .md con encabezados, listas y tablas que puedes leer sin un programa especial.
La conversión depende del PDF: un informe con texto seleccionable se procesa de forma distinta a una factura escaneada. Esta guía explica cómo empezar, qué herramientas considerar y cómo comprobar el resultado.
Convertir un PDF en tres pasos
- Abre el conversor de PDF a Markdown.
- Arrastra tu archivo y ejecuta la conversión.
- Revisa la vista previa y copia el texto o descarga el archivo
.md.
Puedes convertir 5 archivos al día sin cuenta o 15 con una cuenta gratuita, con un máximo de 25 MB por archivo. El plan Pro añade archivos de hasta 100 MB, lotes de hasta 10 archivos y conversiones ilimitadas. El OCR de PDF escaneados requiere Pro.
Elegir la interfaz en español no traduce el documento: el contenido conserva su idioma original.
Primero, identifica qué tipo de PDF tienes
Si puedes seleccionar y copiar una frase en tu lector de PDF, probablemente existe una capa de texto. Esa capa puede extraerse sin reconocimiento visual, aunque su codificación o el orden de lectura pueden dar problemas.
Si solo puedes seleccionar la página como una imagen, necesitas OCR: reconocimiento de texto a partir de píxeles. En file2markdown, los PDF detectados como escaneados pasan por OCR con Pro, con un límite de 50 páginas por archivo.
Algunos PDF mezclan páginas de texto con páginas escaneadas. La detección inicial utiliza una muestra del documento; comprueba que también se hayan extraído las páginas que contienen imágenes. Un resultado con mucho texto no demuestra que esté completo.
Qué herramienta elegir
No existe un ganador para todos los documentos. Esta comparación describe opciones de trabajo; no es una clasificación de precisión basada en pruebas equivalentes.
| Herramienta | Cuándo considerarla | Qué comprobar |
|---|---|---|
| file2markdown | Convertir en el navegador sin instalar software | Límites del plan y necesidad de OCR |
| Marker | Preparar un flujo de extracción con modelos | Instalación, recursos y licencia |
| pdf-inspector | Integrar extracción de PDF en una aplicación | Versión instalada y configuración de OCR |
| PyMuPDF4LLM | Obtener Markdown desde Python | Tablas y orden de lectura de tus archivos |
| MarkItDown | Trabajar con varios formatos desde Python | Resultado con tus documentos reales |
| Pandoc | Convertir DOCX, HTML o EPUB | No acepta PDF como formato de entrada |
Puedes consultar los proyectos de Marker, pdf-inspector, PyMuPDF4LLM y MarkItDown. file2markdown utiliza pdf-inspector en su flujo de PDF con texto. Las funciones de las bibliotecas pueden variar según la versión; no todas corresponden a las funciones del servicio web.
Revisa estructura y contenido
Abre el original junto al Markdown y comprueba una página inicial, una intermedia y la última. Busca encabezados que falten, pies de página repetidos y columnas intercaladas. En una tabla, comprueba que cada cifra siga debajo del encabezado correcto, con su signo, unidad y separador decimal.
El formato puede verse así:
# Informe mensual
## Ventas
| Región | Unidades |
|---|---|
| Norte | 120 |
| Sur | 95 |
Este ejemplo ilustra la sintaxis; no es una medición de precisión. Un gráfico, una ecuación o una tabla con celdas combinadas puede necesitar el PDF original para interpretarse correctamente.
Cada conversión incluye comprobaciones básicas. Para PDF puedes añadir la revisión opcional con Jev, que busca señales de texto ilegible y otras anomalías. Revisa fragmentos del resultado, sin compararlos con el PDF ni corregirlos automáticamente.
Usarlo con IA o automatizarlo
Markdown permite separar secciones y conservar referencias al documento fuente. No garantiza respuestas más exactas ni menos tokens en todos los casos. Si la pregunta depende de un gráfico, proporciona también el original a una herramienta compatible.
Para asistentes y agentes, file2markdown ofrece un servidor MCP; documentación en inglés. Antes de procesar un lote grande, prueba documentos representativos y revisa sus tablas y páginas finales.
Los archivos se convierten en memoria y el servicio no los almacena. El OCR utiliza Claude; activar Jev envía fragmentos del texto convertido a TypeSafe. Consulta la política de privacidad, en inglés, para conocer el flujo de datos.
Preguntas frecuentes
¿Puedo convertir un PDF gratis?
Sí, dentro de los límites gratuitos de archivos con texto. Los PDF escaneados requieren el OCR de Pro.
¿Pandoc sirve para convertir PDF a Markdown?
PDF no es un formato de entrada de Pandoc. Puedes usarlo para otros formatos, como DOCX o EPUB, pero necesitas un extractor de PDF para esta tarea.
¿Se conservan todas las tablas y los gráficos?
La extracción intenta recuperar la estructura del texto. Las tablas complejas y el contenido visual requieren revisión; conserva el original como referencia.
The Markdown Memo
Un boletín quincenal en inglés para abogados, investigadores, contables y quienes trabajan con PDF, documentos escaneados y presentaciones. Sin spam.