OCR in Markdown: gescannte Dokumente und Bilder umwandeln
Wenn sich die Wörter auf einer Seite nicht markieren lassen, liegt möglicherweise nur ein Bild des Dokuments vor. Um aus diesen Pixeln Text zu gewinnen, brauchst du OCR, also optische Zeichenerkennung. Das Ergebnis kann als Markdown mit Absätzen, Überschriften, Listen und Tabellen ausgegeben werden.
OCR interpretiert Bildinhalte. Dabei können Nullen mit Buchstaben verwechselt, Zeilen übersehen oder Spalten falsch zugeordnet werden. Eine lesbare Vorlage und die Kontrolle des Ergebnisses gehören deshalb zum Ablauf, auch wenn der erzeugte Text sauber formatiert aussieht.
Welche Dateien du umwandeln kannst
Auf der file2markdown-Website kannst du JPG und PNG innerhalb deiner Tarifgrenzen zur Textextraktion hochladen. OCR für gescannte PDFs benötigt Pro und verarbeitet bis zu 50 Seiten pro Datei.
Kostenlos sind 5 Dateien täglich ohne Konto oder 15 mit einem kostenlosen Konto möglich, jeweils bis 25 MB. Pro unterstützt Dateien bis 100 MB und Stapel mit bis zu 10 Dateien. OCR über URL oder MCP benötigt Pro; dafür gelten andere Bedingungen als für den direkten Bild-Upload auf der Website.
Ein Bild oder einen Scan konvertieren
- Öffne den Konverter.
- Lade ein JPG, PNG oder ein von deinem Tarif unterstütztes gescanntes PDF hoch.
- Starte die Konvertierung und vergleiche das Markdown mit der Vorlage.
- Korrigiere erkannte Fehler, bevor du den Text kopierst oder herunterlädst und weiterverwendest.
Für PDFs hilft zusätzlich der Leitfaden zur PDF-Konvertierung. Eine Datei kann Textseiten und Scans mischen. Prüfe, ob beide Arten im Ergebnis vorkommen. Die anfängliche Erkennung verwendet eine Stichprobe und garantiert nicht, dass jede Seite eines gemischten Dokuments erfasst wird.
Eine lesbare Vorlage vorbereiten
Richte die Seite gerade aus, vermeide Spiegelungen und kontrolliere, ob kleine Buchstaben scharf erkennbar sind. Ein unscharfes Foto enthält möglicherweise nicht genug Informationen, um alle Wörter zuverlässig zu lesen. Nachträgliches Vergrößern stellt verlorene Details nicht wieder her.
Beim Zuschneiden sollten Überschriften, Einheiten, Anmerkungen und Tabellenränder erhalten bleiben. Eine Zahl ohne ihren Spaltenkopf kann etwas anderes bedeuten. Halte bei mehrseitigen Dokumenten die Reihenfolge ein und prüfe, ob eine Seite fehlt.
Handschrift, überlagernde Stempel und kontrastarme Hintergründe können die Erkennung erschweren. Ein plausibel klingender Satz ist kein Beweis für eine richtige Lesung.
Das Markdown kontrollieren
Prüfe Namen, Datumsangaben, Beträge, Minuszeichen und Dezimaltrennzeichen. Bei deutschen Texten sind auch Umlaute und das ß mögliche Fehlerstellen. Der Dokumentinhalt bleibt in seiner ursprünglichen Sprache; die deutsche Oberfläche übersetzt ihn nicht.
Diese Tabelle zeigt nur die Struktur einer Ausgabe und ist kein Genauigkeitstest:
# Beispielrechnung
| Beschreibung | Menge | Betrag |
|---|---|---|
| Dienstleistung | 2 | 40,00 EUR |
Kontrolliere, ob jeder Wert in der richtigen Spalte steht. Behalte Hinweise zu Steuern, Einheiten und Zeiträumen bei. Falls eine komplexe Tabelle unklar bleibt, nutze dafür das Original.
OCR und Jev haben unterschiedliche Aufgaben
OCR liest Text aus Bildern. Die Qualitätsprüfungen untersuchen anschließend den konvertierten Text. Jede Konvertierung enthält grundlegende Prüfungen. Diese können bestimmte Auffälligkeiten sowie OCR-Seiten melden, deren Ausgabe am Limit des Modells abgeschnitten wurde.
Für PDFs kannst du die optionale Prüfung mit Jev aktivieren. Sie sucht in Textausschnitten nach möglichen Problemen. Sie liest das Bild nicht erneut, korrigiert keine Wörter und gleicht nicht mit dem Original ab. Für einzeln hochgeladene JPG- oder PNG-Dateien steht diese Option nicht zur Verfügung.
Wie die Daten verarbeitet werden
OCR verwendet Claude, um Bilder oder gescannte Seiten zu interpretieren. file2markdown verarbeitet Dateien im Arbeitsspeicher und speichert sie nicht. Das bedeutet allerdings nicht, dass alles im Browser geschieht oder kein externer Anbieter beteiligt ist.
Jev ist eine separate, standardmäßig ausgeschaltete Option. Aktivierst du sie für ein PDF, werden Ausschnitte des konvertierten Textes an TypeSafe gesendet. Die Datenschutzerklärung auf Englisch beschreibt die Verarbeitung.
Häufige Fragen
Benötigt jedes PDF OCR?
Nein. Eine brauchbare Textebene kann direkt ausgelesen werden. Besteht ein PDF ausschließlich aus Bildern, ist visuelle Texterkennung nötig.
Bleiben Tabellen durch OCR immer erhalten?
Nein. OCR kann Struktur erkennen, aber komplexe Tabellen, verbundene Zellen und unscharfe Vorlagen müssen mit dem Original verglichen werden.
Kann ich ein Foto kostenlos konvertieren?
Ja. JPG und PNG lassen sich innerhalb der kostenlosen Grenzen direkt auf der Website hochladen. PDF-OCR und OCR über URL oder MCP benötigen Pro.
The Markdown Memo
Ein englischer Newsletter alle zwei Wochen für Menschen aus Recht, Forschung, Buchhaltung und alle, die mit PDFs, Scans und Präsentationen arbeiten. Kein Spam.