Jev in file2markdown: Markdown prüfen, ohne den Text umzuschreiben
Eine PDF-Konvertierung kann technisch erfolgreich sein und trotzdem unbrauchbaren Text liefern: vertauschte Zeichen, mitten im Satz getrennte Zeilen oder Tabellen mit verschobenen Zellen. Bevor du das Ergebnis weiterverwendest, hilft ein Hinweis darauf, welche Stellen du prüfen solltest.
file2markdown führt bei jeder Konvertierung grundlegende Prüfungen durch. Für PDFs kannst du zusätzlich eine optionale Prüfung mit Jev von TypeSafe aktivieren. Sie sucht in Ausschnitten des erzeugten Markdowns nach möglichen Problemen. Sie schreibt den Text nicht um und bestätigt nicht, dass er mit dem Original übereinstimmt.
So aktivierst du die Prüfung
- Öffne den Konverter und wähle eine PDF-Datei aus.
- Aktiviere vor der Konvertierung die zusätzliche Qualitätsprüfung mit KI. Standardmäßig ist sie ausgeschaltet.
- Konvertiere die Datei und lies den Hinweis beim Ergebnis.
- Wird ein Problem gemeldet, vergleiche die betroffenen Stellen mit dem Original.
Die grundlegenden Prüfungen laufen auch ohne Jev. Falls die KI-Prüfung nicht verfügbar ist, erhältst du weiterhin dein Markdown. Der Hinweis macht deutlich, dass diese zusätzliche Prüfung nicht abgeschlossen wurde.
Welche Probleme die Prüfung sucht
Unleserlicher Text. Fehler bei Schriften, Zeichenkodierung oder Extraktion können Buchstaben ersetzen, Wörter zusammenziehen oder unverständliche Zeichen erzeugen. Eine Datei kann viel Text enthalten, der sich trotzdem kaum lesen lässt.
Sätze mit festen Zeilenumbrüchen. Manche PDFs speichern jede gedruckte Zeile einzeln. Ein zusammenhängender Absatz wird dadurch zu vielen kurzen Zeilen. Das kann beim Lesen und bei der weiteren Verarbeitung stören. Code, Formeln, Listen und Formulare folgen anderen Regeln als Fließtext.
Auffällige Tabellen. Eine fehlende Zelle kann Werte unter die falsche Überschrift rücken. Unser Code zählt die Zellen und prüft die Markdown-Struktur. Jev ergänzt eine Bewertung des Ausschnitts. Das Zählen überlassen wir weiterhin dem Programm.
Zwei Ebenen mit unterschiedlichen Aufgaben
Die grundlegenden Prüfungen laufen auf unseren Servern. Sie erkennen mechanische Anzeichen wie Ersatzzeichen, Wiederholungen, fehlende Tabellentrenner und unterschiedlich lange Tabellenzeilen. Sie können auch melden, wenn eine mit OCR gelesene Seite durch das Ausgabelimit des Modells abgeschnitten wurde.
Für die optionale KI-Prüfung wählen wir Ausschnitte des konvertierten Textes aus und senden sie gemeinsam an Jev. Zu jedem Ausschnitt stellt das System eng begrenzte Fragen. Unser Code wandelt die Antworten anhand festgelegter Kriterien und Schwellenwerte in Hinweise um.
Das bleibt eine Stichprobe. Ein Fehler außerhalb der geprüften Ausschnitte kann unentdeckt bleiben. Deshalb zeigen wir auch keine pauschale Qualitätsnote an: Die Sicherheit einer Modellantwort sagt nicht aus, wie vollständig und originalgetreu das gesamte Dokument ist.
Was die Ergebnisse bedeuten
| Ergebnis | Bedeutung | Nächster Schritt |
|---|---|---|
| Prüfung empfohlen | Eine mögliche Auffälligkeit wurde erkannt | Betroffene Zeilen mit dem Original vergleichen |
| Keine Probleme erkannt | Die ausgeführten Prüfungen fanden nichts offensichtlich Auffälliges | Wichtige Angaben trotzdem kontrollieren |
| Nicht geprüft oder KI nicht verfügbar | Die angeforderte Prüfung konnte nicht abgeschlossen werden | Das Markdown nutzen, ohne diese Prüfung als Bestätigung zu werten |
Die Zeilennummern beziehen sich auf das Markdown, nicht auf PDF-Seiten. Auch eine sauber formatierte Tabelle kann einen falschen Wert enthalten. Die Prüfung belegt außerdem nicht, dass alle Seiten vorhanden sind oder die Reihenfolge stimmt.
Welche Daten TypeSafe erhält
Jev ist ausgeschaltet, bis du die Prüfung aktivierst. Bei aktivierter Prüfung gehen Ausschnitte des konvertierten Textes an TypeSafe. Die ursprüngliche PDF-Datei wird nicht an TypeSafe gesendet. Die grundlegenden Prüfungen benötigen diese Übertragung nicht.
Die Qualitätsprüfung ist ein anderer Verarbeitungsschritt als OCR. Wenn Bilder oder gescannte Seiten visuell gelesen werden müssen, verwendet der OCR-Schritt Claude. In der Datenschutzerklärung auf Englisch ist der Datenfluss des Dienstes beschrieben.
Für Entwickler und MCP-Nutzer
Konvertierungsantworten enthalten ein quality-Objekt. Mit quality_check: "ai" forderst du für ein PDF die zusätzliche Prüfung an. Standardmäßig laufen nur die grundlegenden Prüfungen. Details zum Zugriff aus Assistenten findest du in der MCP-Dokumentation auf Englisch.
Problemcodes und Zeilenangaben helfen einer Anwendung, gezielt auf Auffälligkeiten hinzuweisen oder eine andere Extraktion anzustoßen. source_compared: false hält fest, dass kein Abgleich mit dem Original stattgefunden hat. Eine nicht verfügbare Prüfung ist keine Freigabe.
Häufige Fragen
Korrigiert Jev das Dokument?
Nein. Jev liefert Bewertungen, aus denen unser Code Hinweise erzeugt. Wörter, Zahlen und Vertragsklauseln werden durch die Prüfung nicht verändert.
Funktioniert die KI-Prüfung für alle Dateitypen?
Die grundlegenden Prüfungen begleiten jede Konvertierung. Die optionale Jev-Prüfung steht für PDFs zur Verfügung.
Bedeutet ein Ergebnis ohne Warnung, dass alles korrekt ist?
Nein. Fehlende Inhalte oder falsche Werte sind im extrahierten Text nicht immer erkennbar. Behalte das Original, um Tabellen, Zitate und wichtige Angaben zu kontrollieren.
The Markdown Memo
Ein englischer Newsletter alle zwei Wochen für Menschen aus Recht, Forschung, Buchhaltung und alle, die mit PDFs, Scans und Präsentationen arbeiten. Kein Spam.