Titel Signatur PID Sammlung Typ Sprache Status
1 / 1
Faksimile
Transkription
Lade Bild…

Research Vault

Methodische Grundlagen, Datenanalysen und Entscheidungen des SZD-HTR-Projekts.

Verifiable artefacts

Paper and repository claim that the research process is documented as it happens. Here are the entry points to verify that.

Promptotyping Vault

Markdown knowledge base that steered each LLM interaction during development — data overview, annotation protocol, verification concept, evaluation results, architecture decisions.

    Research Journal

    Chronological record of every session — what was decided, what was tried, what failed. The why behind the commit log.

    Read the Research Journal →
    Exports & Artefacts

    Archival exchange formats compatible with GAMS, Transkribus, eScriptorium, OCR-D.

    SZD-HTR Viewer

    Qualitätskontrolle und Showcase für VLM-basierte Transkriptionen aus dem Stefan-Zweig-Nachlass (Literaturarchiv Salzburg).

    Katalog

    Viewer

    Tastatur

    Edit-Modus (nur lokal)

    Der Edit-Modus ist nur verfügbar, wenn der lokale Server läuft: python pipeline/serve.py

    Review & Ground Truth (nur lokal)

    Drei Status für jedes Objekt:

    BadgeButtonBedeutung
    Mensch-geprüft ✓ Approve / ★ GT Verify Ein Mensch hat jede Seite am Faksimile gegengelesen und bei Bedarf korrigiert. Gilt im Projekt als verifiziert und als Ground Truth für die CER-Berechnung. Approve bedeutet verbindlich: gegengelesen, nicht nur überflogen.
    Agent-geprüft Bild-Text-Vergleich durch einen Claude-Vision-Agenten. Kann stimmen, ersetzt aber keine menschliche Prüfung.
    Ungeprüft Nur Pipeline-Selbsteinschätzung. Objekte mit haben Qualitätssignale ausgelöst (z.B. Seitenlängen-Anomalie) und sollten zuerst gesichtet werden — Filter „Zuerst sichten“.

    Review-Workflow: Objekt öffnen → jede Seite gegen Faksimile lesen → bei Fehlern: Edit → korrigieren → Speichern → Approve. Der LLM-Originaltext bleibt in edit_history erhalten.

    Diff-Ansicht (Cross-Model)

    Vergleicht zwei Transkriptionen desselben Dokuments von verschiedenen VLMs (z.B. Gemini vs. Claude). Wort-basierter Diff mit Farbkodierung:

    Vergleicht zwei unabhängige VLM-Transkriptionen desselben Dokuments (z.B. Gemini Flash Lite vs. Gemini Flash). Verfügbar für Objekte mit Modellkonsensus-Verifikation. CER und Übereinstimmungsrate werden pro Seite und gesamt angezeigt.

    Prompt-Gruppen

    KürzelGruppeBeschreibung
    AHandschriftHandschriftliche Dokumente, Tagebücher, Manuskripte
    BTyposkriptMaschinenschrift, Durchschläge
    CFormularAmtsformulare, Urkunden, Bescheide
    DKurztextEintrittskarten, Notizen, Karten
    ETabellarischRegister, Kalender, Kontorbücher
    FKorrekturfahneDruckfahnen, Korrekturbogen
    GKonvolutGemischte Materialien in einem Objekt
    HZeitungsausschnittZeitungsartikel, Ausschnitte
    IKorrespondenzBriefe, Postkarten

    Verifikation (Qualitätsspalte)

    Die Qualitätsbewertung besteht aus mehreren Signalen unterschiedlicher Stärke:

    SignalStärkeBeschreibung
    Unsicherheits-Marker Stark Zählung von [?] (unsichere Lesung) und [...] (unleserlich) im Transkriptionstext. Direkte Evidenz aus dem Output.
    VLM-Selbsteinschätzung Schwach Das Modell bewertet seine eigene Transkription als high/medium/low. LLMs überschätzen systematisch ihre Leistung — dieses Signal ist ein Indikator, kein Beweis.
    Textstatistik Mittel Zeichenzahl, Leerseiten, Zeichen pro Seite. Plausibilitäts-Check: ein 135-Seiten-Register mit nur 200 Zeichen wäre verdächtig.

    Statistiken

    Transkriptionsfortschritt und Qualitätsmetriken.