file2markdown
OCRMarkdowndocumentos escaneadosimágenesPDF

OCR a Markdown: convertir documentos escaneados e imágenes

20 de septiembre de 2026

Si no puedes seleccionar el texto de una página, quizá estés viendo una imagen del documento. Para convertir esos píxeles en palabras necesitas OCR, o reconocimiento óptico de caracteres. El resultado puede organizarse como Markdown con párrafos, encabezados, listas y tablas.

El OCR interpreta lo que ve. Puede confundir un cero con una letra, perder una línea o interpretar mal una columna. Preparar una imagen legible y revisar el resultado son partes del proceso, aunque el texto parezca bien formateado.

Qué archivos puedes convertir

En la web de file2markdown puedes subir JPG y PNG para extraer texto dentro de los límites de tu plan. El OCR de PDF escaneados requiere Pro y procesa hasta 50 páginas por archivo.

La cuota gratuita es de 5 archivos diarios sin cuenta o 15 con una cuenta gratuita, con un máximo de 25 MB por archivo. Pro admite archivos de hasta 100 MB y lotes de hasta 10 archivos. El acceso a OCR mediante URL o MCP requiere Pro; no tiene las mismas condiciones que subir una imagen directamente en la web.

Convertir una imagen o un escaneo

  1. Abre el conversor.
  2. Sube un JPG, un PNG o un PDF escaneado compatible con tu plan.
  3. Ejecuta la conversión y compara el Markdown con la imagen original.
  4. Corrige los errores que encuentres antes de copiar o descargar el texto para utilizarlo.

Para PDF, consulta también la guía de conversión. Un archivo puede mezclar páginas con texto y páginas escaneadas; revisa que ambas aparezcan en la salida. La detección inicial utiliza una muestra y no garantiza recuperar cada página mixta.

Prepara una fuente legible

Alinea la página, evita reflejos y procura que las letras pequeñas se vean con claridad. Una foto borrosa no contiene suficiente información para recuperar todas las palabras con fiabilidad. Aumentar el tamaño de esa foto después no vuelve legibles los detalles perdidos.

Si recortas la imagen, conserva títulos, unidades, notas y bordes de tablas. Una cifra sin su encabezado puede cambiar completamente de significado. En documentos de varias páginas, mantén un orden claro y comprueba que ninguna quede fuera.

El texto manuscrito, los sellos superpuestos y los fondos con poco contraste pueden ser especialmente difíciles. No des por correcta una lectura solo porque el modelo haya devuelto una frase plausible.

Cómo revisar el Markdown

Comprueba nombres propios, fechas, importes, signos negativos y separadores decimales. En español, revisa también tildes y la letra ñ. Si el documento está en otro idioma, el contenido permanece en ese idioma: la interfaz no lo traduce.

Esta tabla muestra la forma del resultado, no una prueba de precisión:

# Factura de ejemplo

| Concepto | Cantidad | Importe |
|---|---|---|
| Servicio | 2 | 40,00 EUR |

Asegúrate de que cada valor esté bajo la columna correcta. Conserva las notas que expliquen impuestos, unidades o periodos. Si una tabla compleja no queda clara, utiliza el original para esa parte del trabajo.

OCR y Jev hacen tareas diferentes

El OCR extrae texto de imágenes. Las comprobaciones de calidad revisan el texto ya convertido. Todas las conversiones incluyen comprobaciones básicas, que pueden detectar algunas anomalías y señalar páginas cuyo OCR se interrumpió por el límite de salida del modelo.

En PDF puedes añadir la revisión opcional con Jev. Analiza fragmentos para buscar problemas; no vuelve a leer la imagen, no corrige el texto y no compara la salida con el original. Esa opción no se aplica a imágenes JPG o PNG independientes.

Qué ocurre con los datos

El OCR utiliza Claude para interpretar las imágenes o páginas escaneadas. file2markdown procesa los archivos en memoria y no los almacena, pero eso no significa que todo suceda en tu navegador ni que no intervenga un proveedor externo.

Jev es una opción distinta y está desactivada por defecto. Si la activas para un PDF, se envían fragmentos del texto convertido a TypeSafe. La política de privacidad, en inglés, describe el tratamiento de datos.

Preguntas frecuentes

¿Necesito OCR para cualquier PDF?

No. Si tiene una capa de texto utilizable, puede extraerse directamente. Los PDF que solo contienen imágenes necesitan reconocimiento visual.

¿El OCR conserva siempre las tablas?

No. Puede recuperar estructura, pero las tablas complejas, las celdas combinadas y las imágenes borrosas requieren revisión contra el original.

¿Puedo convertir una foto gratis?

Sí, puedes subir JPG o PNG directamente en la web dentro de los límites gratuitos. El OCR de PDF escaneados y el OCR mediante URL o MCP requieren Pro.

Convierte tu imagen o documento.

The Markdown Memo

Un boletín quincenal en inglés para abogados, investigadores, contables y quienes trabajan con PDF, documentos escaneados y presentaciones. Sin spam.