SZD-HTR Viewer
Qualitätskontrolle und Showcase für VLM-basierte Transkriptionen aus dem Stefan-Zweig-Nachlass (Literaturarchiv Salzburg).
Katalog
- Klick auf eine Zeile öffnet das Objekt im Viewer
- Spaltenheader klicken zum Sortieren
- Textsuche über Titel, Signatur und PID
- Filter kombinierbar: Sammlung, Typ, Qualität, Review-Status
Viewer
- Links: Faksimile von GAMS
- Rechts: Transkription + Notes
- Scrollrad: Zoom (zentriert auf Cursor)
- Klicken + Ziehen: Bild verschieben
- Touch: Pinch-Zoom + Wischen
- Leerseiten am Anfang werden übersprungen (erste Content-Seite wird angezeigt)
Tastatur
- ← / → Seite blättern
- + / − Zoom
- 0 Zoom zurücksetzen
- R 90° drehen (im Edit-Modus Alt+R, da der Fokus im Textfeld liegt)
- Esc zurück zum Katalog
Edit-Modus (nur lokal)
Der Edit-Modus ist nur verfügbar, wenn der lokale Server läuft:
python pipeline/serve.py
- Edit — Transkription direkt bearbeiten
- Speichern — schreibt direkt ins Pipeline-JSON (Ctrl+S). Der Originaltext wird in
edit_historyaufbewahrt. - Seite — aktuelle Seite auf Original zurücksetzen
- Alles verwerfen — alle Änderungen am Objekt löschen
- JSON — Korrekturen als Datei exportieren
Review & Ground Truth (nur lokal)
Drei Status für jedes Objekt:
| Badge | Button | Bedeutung |
|---|---|---|
| Mensch-geprüft | ✓ Approve / ★ GT Verify | Ein Mensch hat jede Seite am Faksimile gegengelesen und bei Bedarf korrigiert. Gilt im Projekt als verifiziert und als Ground Truth für die CER-Berechnung. Approve bedeutet verbindlich: gegengelesen, nicht nur überflogen. |
| Agent-geprüft | — | Bild-Text-Vergleich durch einen Claude-Vision-Agenten. Kann stimmen, ersetzt aber keine menschliche Prüfung. |
| Ungeprüft | — | Nur Pipeline-Selbsteinschätzung. Objekte mit ⚠ haben Qualitätssignale ausgelöst (z.B. Seitenlängen-Anomalie) und sollten zuerst gesichtet werden — Filter „Zuerst sichten“. |
Review-Workflow: Objekt öffnen → jede Seite gegen Faksimile lesen →
bei Fehlern: Edit → korrigieren → Speichern → Approve. Der LLM-Originaltext bleibt in edit_history erhalten.
Diff-Ansicht (Cross-Model)
Vergleicht zwei Transkriptionen desselben Dokuments von verschiedenen VLMs (z.B. Gemini vs. Claude). Wort-basierter Diff mit Farbkodierung:
- Rot — nur in Transkription A
- Blau — nur in Transkription B
- Schwarz — Übereinstimmung
Vergleicht zwei unabhängige VLM-Transkriptionen desselben Dokuments (z.B. Gemini Flash Lite vs. Gemini Flash). Verfügbar für Objekte mit Modellkonsensus-Verifikation. CER und Übereinstimmungsrate werden pro Seite und gesamt angezeigt.
Prompt-Gruppen
| Kürzel | Gruppe | Beschreibung |
|---|---|---|
| A | Handschrift | Handschriftliche Dokumente, Tagebücher, Manuskripte |
| B | Typoskript | Maschinenschrift, Durchschläge |
| C | Formular | Amtsformulare, Urkunden, Bescheide |
| D | Kurztext | Eintrittskarten, Notizen, Karten |
| E | Tabellarisch | Register, Kalender, Kontorbücher |
| F | Korrekturfahne | Druckfahnen, Korrekturbogen |
| G | Konvolut | Gemischte Materialien in einem Objekt |
| H | Zeitungsausschnitt | Zeitungsartikel, Ausschnitte |
| I | Korrespondenz | Briefe, Postkarten |
Verifikation (Qualitätsspalte)
Die Qualitätsbewertung besteht aus mehreren Signalen unterschiedlicher Stärke:
| Signal | Stärke | Beschreibung |
|---|---|---|
| Unsicherheits-Marker | Stark | Zählung von [?] (unsichere Lesung) und [...] (unleserlich) im Transkriptionstext. Direkte Evidenz aus dem Output. |
| VLM-Selbsteinschätzung | Schwach | Das Modell bewertet seine eigene Transkription als high/medium/low. LLMs überschätzen systematisch ihre Leistung — dieses Signal ist ein Indikator, kein Beweis. |
| Textstatistik | Mittel | Zeichenzahl, Leerseiten, Zeichen pro Seite. Plausibilitäts-Check: ein 135-Seiten-Register mit nur 200 Zeichen wäre verdächtig. |