OCR para Markdown: converter documentos digitalizados e imagens
Quando não dá para selecionar as palavras de uma página, talvez você esteja vendo uma imagem do documento. Para transformar esses pixels em texto, é necessário OCR, ou reconhecimento óptico de caracteres. A saída pode ser organizada em Markdown com parágrafos, títulos, listas e tabelas.
OCR interpreta o que está na imagem. Pode confundir zero com uma letra, pular uma linha ou ler uma coluna na ordem errada. Preparar uma imagem legível e revisar a saída fazem parte do processo, mesmo quando o texto parece bem formatado.
Quais arquivos você pode converter
No site do file2markdown, você pode enviar JPG e PNG para extrair texto dentro dos limites do seu plano. O OCR de PDFs digitalizados exige Pro e processa até 50 páginas por arquivo.
A cota gratuita é de 5 arquivos por dia sem conta ou 15 com uma conta gratuita, com até 25 MB por arquivo. O Pro aceita arquivos de até 100 MB e lotes de até 10 arquivos. OCR por URL ou MCP exige Pro; as condições são diferentes do envio direto de uma imagem pelo site.
Converta uma imagem ou digitalização
- Abra o conversor.
- Envie um JPG, PNG ou PDF digitalizado compatível com seu plano.
- Inicie a conversão e compare o Markdown com a imagem original.
- Corrija os erros encontrados antes de copiar ou baixar o texto para uso.
Para PDFs, consulte também o guia de conversão. Um arquivo pode misturar páginas com texto e páginas digitalizadas. Confira se os dois tipos aparecem na saída: a detecção inicial usa uma amostra e não garante recuperar cada página de um documento misto.
Prepare uma imagem legível
Alinhe a página, evite reflexos e confira se as letras pequenas estão nítidas. Uma foto borrada não contém informação suficiente para recuperar todas as palavras com confiança. Aumentar essa foto depois não recupera detalhes que já se perderam.
Ao recortar uma imagem, mantenha títulos, unidades, notas e bordas das tabelas. Um número sem seu cabeçalho pode ter outro significado. Em documentos com várias páginas, preserve a ordem e confira se nenhuma ficou de fora.
Manuscritos, carimbos sobre o texto e fundos com pouco contraste podem dificultar a leitura. Uma frase plausível gerada pelo modelo não é prova de que a imagem foi lida corretamente.
Confira o Markdown
Revise nomes, datas, valores, sinais negativos e separadores decimais. Em português, confira também acentos e cedilhas. O conteúdo permanece no idioma do original; escolher português na interface não traduz o documento.
Esta tabela ilustra a estrutura da saída, sem representar uma medição de precisão:
# Fatura de exemplo
| Descrição | Quantidade | Valor |
|---|---|---|
| Serviço | 2 | R$ 40,00 |
Veja se cada valor está na coluna certa. Preserve notas sobre impostos, unidades e períodos. Se uma tabela complexa não ficar clara, consulte o original para essa parte do trabalho.
OCR e Jev têm funções diferentes
OCR extrai texto das imagens. As verificações de qualidade examinam o texto depois da conversão. Todas as conversões incluem verificações básicas, que podem detectar algumas anomalias e apontar páginas cujo OCR foi interrompido pelo limite de saída do modelo.
Para PDFs, você pode ativar a verificação opcional com Jev. Ela analisa trechos em busca de possíveis problemas; não relê a imagem, não corrige o texto e não compara o resultado com o original. A opção não se aplica a imagens JPG ou PNG enviadas separadamente.
Como os dados são processados
O OCR usa Claude para interpretar imagens ou páginas digitalizadas. O file2markdown processa arquivos em memória e não os armazena. Isso não significa que tudo acontece no navegador ou que nenhum fornecedor externo participa.
Jev é uma opção separada e vem desativada. Se você ativá-la para um PDF, trechos do texto convertido serão enviados à TypeSafe. A política de privacidade, em inglês, descreve o tratamento dos dados.
Perguntas frequentes
Todo PDF precisa de OCR?
Não. Uma camada de texto utilizável pode ser extraída diretamente. PDFs que contêm apenas imagens precisam de reconhecimento visual.
OCR sempre preserva as tabelas?
Não. Ele pode recuperar a estrutura, mas tabelas complexas, células mescladas e imagens borradas exigem comparação com o original.
Posso converter uma foto de graça?
Sim. É possível enviar JPG ou PNG diretamente pelo site dentro dos limites gratuitos. OCR de PDFs digitalizados e OCR por URL ou MCP exigem Pro.
The Markdown Memo
Uma newsletter quinzenal em inglês para profissionais do direito, pesquisa, contabilidade e quem trabalha com PDFs, documentos digitalizados e apresentações. Sem spam.