# Warum zeigen Fußnoten nach der PDF-zu-EPUB-Umwandlung auf die falsche Stelle?

Vom LLM für jede Seite zur gezielten Auswahl mit JEV: Ein Einblick in die Prüfung von Fußnotenbezügen in gescannten Büchern.

![Feine Linien verbinden Verweise einer alten Buchseite mit Fußnoten; daneben steht eine neu umbrochene Leseseite](https://pdfcraft.ai/de-DE/images/blog/jev-footnote-review.webp "Konzeptillustration: Beim Umwandeln muss die Verbindung zwischen Textverweis und Fußnote erhalten bleiben.")

Ich habe PDF Craft entwickelt, um gescannte Bücher als durchsuchbares und gut lesbares Markdown oder EPUB nutzbar zu machen. Texterkennung allein reicht dafür nicht. Eine hochgestellte Zahl, ein eingekreistes Zeichen oder ein Stern im Fließtext muss weiterhin auf die richtige Anmerkung am Fuß der Originalseite verweisen. Sonst lässt sich der Text zwar neu umbrechen, aber ein Teil seines Zusammenhangs geht verloren.

Das ist besonders bei alten Büchern, wissenschaftlichen Quellen und privaten Sammlungen wichtig. Ein brauchbares Ergebnis sollte sich auf kleinen Bildschirmen lesen und durchsuchen lassen, ohne die Verweise zu verlieren. Zur Prüfung eignen sich der [Leitfaden für gescannte PDFs als EPUB](https://pdfcraft.ai/de-DE/blog/scanned-pdf-to-epub/) und die [Checkliste für Formeln und Fußnoten](https://pdfcraft.ai/de-DE/blog/check-formulas-footnotes-after-ocr/).

## OCR erkennt Zeichen, aber nicht ihre Funktion

OCR findet Wörter auf einer Seite, weiß aber nicht unbedingt, welche Rolle sie im Buch spielen. Kleingedrucktes unten kann eine Fußnote sein oder einfach der letzte Absatz der Seite. Eine eingekreiste Zahl kann einen Beleg markieren oder Teil einer Aufzählung sein. Anmerkungen können zudem in mehrere Blöcke zerfallen oder auf der nächsten Seite weitergehen.

Ein einziger falscher Bezug führt zu merkwürdigen EPUB-Ergebnissen: Ein Verweis hat kein Ziel, zwei Noten werden verbunden, eine Seitenzahl landet im Satz oder ein Absatz endet im Kopf der nächsten Seite. Fußnoten gehören seit Langem zu den schwierigsten Aufgaben von PDF Craft.

## Der erste Versuch: Das LLM liest jede Seite

Vor etwa einem Jahr lag eine einfache Lösung nahe: Wenn klassische Programme den Sinn nicht sicher erfassen, soll ein großes Sprachmodell jede Seite prüfen. Es erkennt oft, dass Kleingedrucktes den Haupttext erläutert, deutet Sterne oder römische Zahlen als Verweiszeichen und beurteilt anhand des Kontexts, ob ein Satz über den Seitenwechsel hinausgeht.

Für einzelne Seiten war das vielversprechend. Bei einem langen Buch wurden jedoch aus Hunderten Seiten Hunderte Modellaufrufe mit Wartezeiten und möglichen Wiederholungen. Für Seitenübergänge brauchte das Modell Nachbartext; die Eingaben wuchsen. Die meisten Seiten waren ohnehin korrekt. Das teure Modell las sie trotzdem und meldete nur, dass nichts zu ändern sei. Für Nutzende war kaum erkennbar, ob die Verarbeitung vorankam oder festhing.

## Zuerst eine vollständige regelbasierte Verarbeitung

Spätere Versionen überließen die Hauptarbeit wieder der OCR und nachvollziehbaren Regeln. Dieser Ablauf trennt Fließtext von Anmerkungen, verbindet Absätze, zerlegt Fußnoten und ordnet die Verweiszeichen den passenden Noten zu. Er ist schnell, stabil und wiederholbar und funktioniert für die meisten Seiten gut.

Buchlayouts sind jedoch vielfältig. Fußnoten stehen unten oder zwischen Spalten, Kennzeichnungen sind Zahlen oder Symbole, und Kopfzeilen sowie Seitenzahlen können in den erkannten Text geraten. Manche Fälle erfordern ein Verständnis des Satzes. Nur Regeln lassen einige Sonderfälle offen; ein LLM für jede Seite ist zu langsam und teuer.

## Die Wende: JEV soll prüfen, nicht neu bearbeiten

Der vorhandene Ablauf musste nicht ersetzt werden. Ihm fehlte eine schnelle Qualitätskontrolle, die verdächtige Seiten auswählt. Ich gebe JEV daher nur eine eng gefasste Frage: **Kann die Analyse dieser Seite unverändert übernommen werden?** JEV schreibt nichts um und erklärt nicht jede Fußnote. Es liefert eine Wahrscheinlichkeit für die Entscheidung, ob die Seite weiterläuft oder an das LLM geht.

Geprüft wird die ganze Seite. Hat der Algorithmus eine Fußnote vollständig übersehen, kann eine Kontrolle nur der bereits erkannten Noten sie nicht finden. Eine Beurteilung der Seite kann dennoch fehlende Verweise, falsche Zuordnungen, ungewöhnliche Seitenübergänge oder Seitenzahlen im Fließtext bemerken. Lieber lasse ich einige Seiten zu viel prüfen, als einen Fehler unbemerkt ins EPUB zu übernehmen. Fehlalarme kosten einen zusätzlichen Modellaufruf; übersehene Fehler verschlechtern das Ergebnis. Der Schwellenwert muss noch an mehr Beispielen kalibriert werden.

```mermaid
flowchart TB
  accTitle: Von der Seitenprüfung zur begrenzten Reparatur
  accDescr: OCR und Regeln verarbeiten die Seite zuerst. JEV entscheidet, ob sie unverändert passieren kann. Verdächtige Seiten gehen an das LLM und danach in die Integritätsprüfung. Bei Fehlern wird die Reparatur wiederholt.
  A[OCR und Regeln] --> B{JEV: Seite zuverlässig?}
  B -- Ja --> F[Kapitel und Ausgabe]
  B -- Nein --> C[LLM repariert nur diese Seite]
  C --> D{Integritätsprüfung}
  D -- Bestanden --> F
  D -- Wiederholen --> C
```

## Das LLM repariert nur innerhalb fester Grenzen

Für eine verdächtige Seite erhält das LLM die Textstruktur der vorherigen, aktuellen und folgenden Seite. Ändern darf es nur die mittlere. Die Nachbarseiten liefern Kontext für überlaufende Sätze. Seitenbilder sende ich an dieser Stelle nicht mit: OCR hat Text, Positionen und Layout bereits erfasst; gefragt ist eine semantische Korrektur, kein zweiter OCR-Durchlauf.

Das Modell darf Text als Haupttext, Fußnote oder Seitenzahl neu kennzeichnen, Absatzverbindungen korrigieren und Verweise neu zuordnen. Es darf weder den Wortlaut frei umschreiben noch die Seitenstruktur ändern. Danach prüft das Programm die Reihenfolge der Fußnotenindizes, passende Verweispaare, konsistente Verbindungen über Seitengrenzen und eindeutig auffindbare Markierungspositionen. Bei Fehlern erhält das Modell konkrete Hinweise und muss ein vollständiges Ergebnis erneut liefern. Weniger Wiederholungen sind wünschenswert, aber kein Grund, diese Prüfungen zu lockern.

## Was ein Beispiel mit 26 Seiten zeigte

In einem Test-PDF mit 26 Seiten und vielen Fußnoten wählte JEV 6 Seiten für das LLM aus. Alle sechs ersten Antworten bestanden die Integritätsprüfung. Die 22 bereits korrekten Beziehungen zwischen Textverweisen und Fußnoten blieben erhalten.

Korrigiert wurden kleine, aber störende Dinge: Gedruckte Seitenzahlen waren als Fließtext erkannt worden; eine davon verband fälschlich zwei Absätze; ein einleitender Satz war mit einem folgenden eingerückten Zitat verschmolzen. Das LLM trennte ihn anhand von Sinn und Einrückung.

Das ist die Beobachtung an einem Beispiel, keine Aussage über die allgemeine Genauigkeit oder Kosten. Sie zeigt, warum eine Reparatur korrekte Arbeit bewahren und nur begründete Fehler ändern sollte.

## Teures Urteilsvermögen gezielt einsetzen

Regeln erledigen die meisten bestimmten Aufgaben, JEV sucht rasch verdächtige Seiten, das LLM bearbeitet wenige Fälle mit semantischem Bedarf und Programmprüfungen sichern die Struktur. Reparierte Seiten kehren in denselben Ablauf für Kapitel, Markdown und EPUB zurück.

Weitere Sprachen, Layouts und umfangreichere Bücher sind nötig, insbesondere um übersehene Fehler und den JEV-Schwellenwert zu messen. Die Richtung ist aber klarer: Ein LLM muss nicht jede Seite lesen, um einige Fehler am Rand zu finden. Wer ein eigenes Buch umwandelt, sollte im [PDF Craft-Arbeitsbereich](https://pdfcraft.ai/de-DE/pdf-craft/) zunächst eine kurze Probe mit Fußnoten verarbeiten und Verweise, Notentext und Seitenübergänge prüfen.
