Am 1. September 2026 habe ich auf der ICDAR 2026 in Wien die zweite der drei Keynotes gehalten, unter dem Titel »From Archives to Algorithms and Back: What Historians Need from Document Understanding«.

Ein Historiker steht dort vor einem Plenum von Informatikerinnen und Informatikern und verhandelt nicht historische Befunde sondern die Zusammenarbeit zwischen Dokumentenanalyse und Geschichtswissenschaft. Dieser Bericht ordnet zunächst die Tagung und die Kooperation ein, aus der die Einladung hervorging, hebt sodann einige Beiträge zur Konferenz hervor, auf die mein Vortrag Bezug genommen hat, und führt daraufhin in drei Schritten in das Argument der Keynote ein: wie Verwaltungskategorien entstehen und was auf dem Weg in die Daten mit ihnen geschieht, die drei Orte, an denen die Werkzeuge der Dokumentanalyse in der geschichtswissenschaftlichen Arbeit ankommen, und ein Vorschlag zur Frage, wie ein System zwischen dem gelesenen Wert und der von diesem Wert repräsentierten prozessgenerierten Kategorie differenzieren kann.
Die Tagung
Die International Conference on Document Analysis and Recognition ist die zentrale internationale Tagung eines Forschungsfeldes, das sich mit der maschinellen Analyse und Erkennung von Dokumenten befasst. Sie wird von der International Association for Pattern Recognition getragen, genauer von deren Technical Committees TC10 für Graphics Recognition und TC11 für Reading Systems, von denen das erste sie neben dem GREC-Workshop als Flaggschiff führt. Bereits 1991 fand die erste Ausgabe in Saint-Malo statt. Bis 2023 tagte die Konferenz zweijährlich und seit 2024 jährlich, sodass Wien bereits die zwanzigste Ausgabe war.1
Ausgerichtet hat die Tagung die TU Wien, organisiert vom Computer Vision Lab unter den General Chairs Robert Sablatnig und Florian Kleber. Getagt wurde am Campus Gußhaus im 4. Wiener Bezirk. Die Hauptkonferenz fand vom 31. August bis zum 2. September 2026 statt, gerahmt von einem Tutorientag am 30. August sowie zwei Workshoptagen am 3. und 4. September. In das Programm gingen 140 begutachtete Volltextbeiträge aus 300 Einreichungen ein, dazu zwölf Beiträge des Journal Track und acht Berichte aus den Wettbewerben.2
Drei Keynotes gliederten die drei Konferenztage. C. V. Jawahar vom IIIT Hyderabad eröffnete am Montag mit »The Changing Landscape of Document Understanding«. Tong Sun, Senior Director bei Adobe, schloss am Mittwoch mit »The Next Frontier: From Document Understanding to Document Agency«, verschob die Frage also, wie der Titel ankündigt, vom Verstehen von Dokumenten auf deren Handlungsfähigkeit. Der Osnabrücker Beitrag lag am Dienstagmittag dazwischen und zugleich quer zu beiden, weil er weder eine Entwicklungsgeschichte der Dokumentenanalyse erzählte noch deren weitere Aussichten prognostizierte, sondern von außen auf dieses Feld blickte und danach fragte, was Verstehen von der Sache her verlangt, wenn der Gegenstand ein Korpus aus Verwaltungsdokumenten des zwanzigsten Jahrhunderts ist.3
Die Kooperation mit der TU Dortmund
Hinter der Einladung steht eine Arbeit, die 2018 in Osnabrück begonnen hat. Die Arbeitsgruppe NGHM hat damals begonnen, historische Massenquellen maschinell zu erschließen, zunächst zwei Karteien im Niedersächsischen Landesarchiv, Abteilung Osnabrück: die Registratur der örtlichen Gestapo mit rund 50.000 Karten und die Ausländermeldekartei mit rund 80.000 Karten. Beide wurden mithilfe der Handschriftenerkennung (und gemeinsam mit externen Partnern) in Datenmodelle überführt. Was zuvor Jahre gekostet hatte, dauerte in diesen Projekten nur Monate.
Der Weg über einen kommerziellen Dienstleister stieß allerdings an seine Grenzen, sobald das Vorhaben wuchs, denn für die drei Millionen Karten eines Folgeprojekts lag der Preis so weit außerhalb dessen, was historische Forschung finanzieren kann, dass das Vorhaben nicht mehr zustande kam. Damit ist ein Punkt berührt, der über den Einzelfall hinausgeht: Historische Daten müssen als kulturelles Erbe im öffentlichen Raum bleiben, und die Werkzeuge zu ihrer Erschließung ebenfalls, weil Forschung sonst später in dieser Dimension nur noch über Abonnements proprietärer Dienste betrieben werden kann. Insofern war unser Pioniervorhaben ein »proof of concept«, der uns dazu motiviert hat, nach offenen Lösungen zu suchen.

Seither arbeiten wir gemeinsam mit Gernot A. Fink und der Pattern Recognition Group der TU Dortmund. Professor Fink war bei der ICDAR 2026 einer der vier Program Chairs und Mitherausgeber der Proceedings. Der erste Beitrag der Gruppe, an dem auch wir beteiligt waren, erschien 2025 in den Proceedings der ICDAR in Wuhan und machte aus den CM/1-Formularen einen Datensatz, an dem sich prüfen lässt, wie gut große Vision-Language-Modelle (Modelle, die Bild und Text in einem Zug verarbeiten) einen handschriftlichen Namen und ein Geburtsdatum aus sehr wenigen Trainingsbeispielen lesen.4
Die CM/1-Akten sind die Anträge, über die »Displaced Persons« in Europa nach dem Zweiten Weltkrieg Unterstützung bei der International Refugee Organization beantragten. Der Bestand 3.2.1.1 »CM/1 Akten aus Deutschland« der Arolsen Archives umfasst nach der Bestandsbeschreibung über 196.000 Akten mit Hinweisen auf rund 578.000 Namen; der 2025 veröffentlichte Datensatz zählt anders, nämlich in Vorgängen und Personen, und beruht auf 140.114 Einzelvorgängen, von denen nach der Bereinigung 135.951 Deckblätter mit 203.112 Personen bleiben. Der aktuelle Beitrag der Dortmunder Gruppe, den wir als Historiker:innen erneut unterstützen konnten, geht 2026 tiefer in die Akten hinein und weitet die Datenextraktion auf weitere Felder aus.5
Was auf der Tagung zu sehen war
Mehrfach ließ sich in der Keynote selbst auf das Programm der Konferenz verweisen, in dem zahlreiche Beiträge unmittelbar an unsere eigenen Fragen anschlossen und spannende Lösungsperspektiven vorlegten.

Sehr deutlich konnte ich solche Querbezüge an der Posterwand der Projektpräsentationen ablesen. Dort hingen zwei Arbeiten nebeneinander, die für beide Seiten desselben Problems stehen. Die eine, aus der Osnabrücker und Dortmunder Kooperation hervorgegangen, in Dortmunder Erstautorschaft vorgestellt und dort auch am Lamarr-Institut für maschinelles Lernen und künstliche Intelligenz angesiedelt, behandelt die Informationsextraktion aus Verwaltungsschriftgut des zwanzigsten Jahrhunderts, hier den CM/1-Akten, also aus lesbaren, standardisierten Formularen, von denen es weit mehr gibt, als ein Mensch je durchsehen könnte. Die andere, von Melissa Cote und Alexandra Branzan Albu, untersucht das Auffinden historischer Dokumentbilder anhand ihres Aussehens und zielt damit auf ältere Handschriften und illuminierte Seiten ab, die entziffert werden müssen, bevor sie gelesen werden können. Im Vortrag habe ich diese beiden Ebenen als »the flood« und »the cipher« bezeichnet, weil die Mustererkennung diese beiden Sphären der Geschichtswissenschaft gleichzeitig bearbeitet. Auf derselben Posterwand stand mit »Writer Retrieval at Scale« von Tim Raven, Tim Hallyburton und Gernot A. Fink auch eine weitere Dortmunder Arbeit.6

Zwei Beiträge, die ich am Vortragsmorgen noch hören konnte, sind ebenfalls gleich in meinen Foliensatz gewandert. Erik Lenas, Viktoria Löfgren und Olof Karsvall vom schwedischen Reichsarchiv haben in der Session zur historischen Dokumentanalyse unter dem Titel »Quality Prediction for Large Scale HTR – Confidence Is All You Need« das Problem behandelt, wie sich die Qualität einer Handschriftenerkennung dort schätzen lässt, wo im laufenden Betrieb keine Referenztranskription vorliegt. Sie fassen die Aufgabe als Regression auf Seitenebene, die aus dem Bild und den Laufzeitausgaben der Erkennungskette sowohl die Güte der Segmentierung als auch die der Transkription vorhersagt, und finden, dass die Verteilung der Konfidenzwerte über eine Seite mehr trägt als der Mittelwert und die Auskunft von Bild- und Sprachmerkmalen weitgehend überflüssig macht. Die Grundlage bilden nach der im Vortrag gezeigten Übersicht 43.126 vollständig annotierte Seiten aus drei Datensätzen, dem schwedischen Swedish Lion mit 20.727 Seiten aus den Jahren 1550 bis 1900, dem norwegischen Norhand mit 11.203 Seiten und dem dänischen Danish Handwriting mit 11.196 Seiten, dazu eine Prüfmenge von 338 Seiten aus Archiven, die im Training nicht vorkamen. Für ein Archiv, das dabei ist, Millionen Seiten historischer Dokumente zu verarbeiten, und nicht jede einzelne prüfen kann, ist das die Voraussetzung dafür, Qualitätskontrolle überhaupt zu steuern.7

Michael Zhang, Elise Wang, Charlotte Whatley, Seth Strickland und Dylan Bannon haben am selben Vormittag in der Session zur Handschriftenerkennung ihre Arbeit »Democratizing the Medieval English Legal Tradition« vorgestellt. Die Überlieferung des englischen Rechts liegt in handschriftlichen Rollen in stark abgekürztem mittelalterlichem Latein vor, das weltweit nur wenige Fachleute lesen können, während der digitalisierte Teil, wie sie im Vortrag zeigten, bereits rund vier Millionen Seiten umfasst. Aus 193 Straf- und Zivilverfahren der Jahre 1272 bis 1461 haben sie einen Datensatz von 4.029 Zeilen gebaut und erreichen damit eine Wortgenauigkeit von 82 Prozent, die eine nachgeschaltete Korrektur durch ein Sprachmodell auf 88 Prozent hebt. Was daran hängt, führten sie an einem Verfahren von 1375 vor, in dem die Dichter John Gower und Geoffrey Chaucer gemeinsam mit zehn weiteren Männern von einer Agnes verklagt wurden, weil sie deren Erbe unrechtmäßig in Besitz hielten: Die beiden kannten einander demnach näher und mindestens drei Jahre früher, als die Forschung bislang annahm.8
Beide Vorträge sprachen die Frage an, wie aus mehr Dokumenten, als eine Person in ihrem Leben lesen kann, verlässliche historische Daten werden, und damit genau das, was ich weiter unten als den ersten der drei Orte beschreibe. Am Donnerstag wird im Workshop zur historischen Dokumentbildverarbeitung eine weitere Arbeit aus dem Dortmunder Zusammenhang vorgestellt, die dieser Frage forschungspraktisch nachgeht.9
Was Historikerinnen und Historiker brauchen
Für die Hand- und Maschinenschriften sowie die Dokumenttypen, mit denen ich bei meiner Arbeit umgehe, ist die reine Erkennung kein wirklich schwieriges Problem mehr. Multimodale Modelle erreichen auf komplexen historischen Handschriften einstellige Zeichenfehlerraten. Wo ein zweites Modell die Lesung des ersten korrigiert, rücken sie in die Nähe menschlicher Transkriptionen. Auf gedrucktem Material liegen die Fehlerraten noch einmal deutlich niedriger. Ganze Datensätze werden inzwischen maschinell aus Archivscans zusammengesetzt.10 Was die Geschichtswissenschaft darüber hinaus braucht, so mein Argument, ist die Unterscheidung zwischen einem korrekt gelesenen Wert und einer Kategorie, die etwa eine Behörde über einen Menschen verhängt. Zu fragen ist deshalb nicht allein, welchen Wert ein Modell liefern soll, sondern was ein System mit einem Wert anfängt, den es fehlerfrei gelesen hat und der zugleich, wie in vielen der Dokumente, die wir in der NGHM-Gruppe im Rahmen unserer Forschung zu »displaced persons« bearbeiten, ein Zug in einer Verhandlung um das eigene Überleben war.
Mein erstes Beispiel indes stammt aus unserer Analyse der Osnabrücker Ausländermeldekartei: Tullio und Theresa Beltrami kamen im Februar 1905 aus Italien nach Osnabrück und blieben bis an ihr Lebensende. Die Ausländermeldekartei der Stadt wird seit 1930 geführt und enthält rückwirkende Einträge, die bis an die Jahrhundertwende reichen. Die Familie erscheint in ihr erst 1932. Ein Haushalt, der seit einem Vierteljahrhundert in der Stadt lebte, wurde nachträglich als »Ausländer« in den Bestand eingeschrieben. Die Kartei führte diesen Status über Jahrzehnte weiter, bis zu einer Enkelin, die 1957 einen deutschen Staatsangehörigen heiratete und mit dem Vermerk »siehe auch Ausländerkarte« in die Einwohnerkartei überführt wurde. Die italienische Staatsangehörigkeit der Familie war eine Tatsache vor alledem. Die deutsche Staatsbürgerschaft erhielt der größte Teil der Familie nie. Was die Karte in der Ausländermeldekartei allerdings hervorbrachte, war ein Status als verwaltete »Ausländer« in eben der Stadt, die die Beltramis ihre Heimat nannten und in der ihre Töchter geboren wurden. Die Kartei hat die Familie nicht nur verzeichnet; sie hat ihr eine Position zugewiesen und diese über drei Generationen reproduziert.

Genau das meinen wir, wenn wir in der reflexiven Migrations-forschung von einer Kategorie sprechen. Der Unterschied zum Sprachgebrauch der Informatik ist dabei ausdrücklich festzuhalten: Dort ist eine Kategorie eine Klasse, die zugewiesen wird und für die eine ground truth sagt, welche die richtige ist, während sie in der kritischen Geschichtswissenschaft (oder Migrationsforschung) eine Entscheidung bezeichnet, die ein Amt über einen Menschen getroffen, in ein Feld geschrieben und danach gegen ihn geltend gemacht hat, ohne dass irgendeine Lesung der Karte sagen könnte, ob diese Kategorisierung richtig oder wahr war.
Dass Kategorien nicht vorgefunden, sondern hergestellt werden, ist nicht einfach eine singuläre Beobachtung an dieser einen Karte. Diese Einsicht ist die Arbeitsgrundlage des Sonderforschungsbereichs 1604 »Produktion von Migration«, in dem wir in Osnabrück forschen und der Migration als das »Produkt eines gesellschaftlichen Produktionsprozesses« versteht, in dem »Kategorisierungen von Menschen, Gruppen und Praktiken« sich zu sozialen Figuren verdichten und die weiteren Aushandlungen prägen.11 Eine Ausländermeldekartei ist ein Ort, an dem sich dieser Vorgang Karte für Karte und über ein halbes Jahrhundert hinweg beobachten lässt. So gesehen erschließt, wer solche Bestände maschinell erschließt, keine Eigenschaften von Personen, sondern die Spuren eines Herstellungsvorgangs.
Meine eigene Disziplin hat daran ihren Anteil. Sie hat Wörter wie »Ausländer« verwendet, als bezeichneten sie eine Art von Menschen, die man untersuchen, zählen und erklären kann, obwohl diese Wörter in einem Amt entstanden sind und eine Kategorisierungsentscheidung festhalten. Rogers Brubaker und Frederick Cooper haben für diesen Fehler einen Begriff geprägt, nämlich die Verwechslung von Kategorien der Praxis, nach denen Menschen regiert wurden, mit Kategorien der Analyse, mit denen wir sie erklären.12 Die Karte ist dabei nicht der Fehler, sie ist das Material. Der Fehler liegt in einer Wissenschaft, die das Wort des kategorisierenden Apparates übernimmt und es zu ihrem eigenen Instrument macht. Eine Zählung kann also schon darin falsch sein, wie sie eine Kategorie zählt, lange bevor eine ihrer Zahlen nicht stimmt.
In meinem Beitrag habe ich drei Orte unterschieden, an denen die Werkzeuge der Dokumentanalyse in der geschichtswissenschaftlichen Arbeit ankommen. Jeder von ihnen hat sein eigenes Kriterium der Geltung. Am ersten Ort findet die Erschließung statt: Eine Quelle wird in digitale, lesbare, strukturierte Daten überführt. Dort gibt es eine ground truth, denn das Zeichen steht in einem Dokument, gegen das sich jede Lesart prüfen lässt. Der zweite Ort ist das Berechnen, bei dem auf den erschlossenen Daten gemessen wird. An die Stelle der ground truth tritt hier die Nachvollziehbarkeit, weil nicht mehr ein einzelner Wert geprüft wird, sondern die Art und Weise, in der dieser Wert erzeugt wird. Ein fehlerhaftes Skript lässt sich lesen und prüfen, ein von einem Modell halluziniertes Ergebnis allerdings nicht. Gebaut wird am dritten Ort, wo das Korpus entsteht, an dem sich eine historische Frage überhaupt stellen lässt. Dort wartet kein Etikett auf der Seite, denn ob ein Dokument zu einer Frage gehört, ist keine Eigenschaft dieses Dokuments, sondern ein Urteil, das jemand fällt und verantwortet.
Wie sich die Arbeit an diesen drei Orten anfühlt, habe ich im August 2026 bei meiner Forschung in vier Archiven in Oregon erfahren. Mit einem Dokumentscanner, der das Papier nicht berührt, entstanden dort Digitalisate von rund 6.000 Seiten historischer Dokumente in Handarbeit, während mir eine bereits mitlaufende Auswertung anzeigte, welche Kartons aus dem Magazin ich in meiner Bestellliste womöglich übersehen hatte und welche sich im Licht erster Auswertungen doch als relevant erweisen könnten. Parallel dazu schrieb und lief ein generatives System Skripte, die auf der Grundlage der ersten Dokumentauswertung dutzende bereits digitalisierte Sammlungen durchsuchten und rund vierhunderttausend weitere Dokumente zu meiner Fragestellung zusammentrugen, jeden Treffer mit Quelle, Repositorium, Abrufdatum und Prüfstand versehen.
Das eine Korpus entstand im Tempo eines Menschen, das andere in der Geschwindigkeit eines digitalen Rechercheprozesses. Beide Erträge liegen nun in demselben Arbeitsbestand, aus dem ich die Analyse des Materials entwickle. Dieser Bestand ist deshalb ein ungleiches Gebilde: Von den vor Ort selbst aufgenommenen Seiten ist bekannt, warum sie im Karton lagen und warum ich sie ausgewählt habe, von den vierhunderttausend maschinell gezogenen Dokumenten dagegen nur, nach welchem Suchkriterium sie gefunden wurden, nicht aber, was im Repositorium neben ihren digitalen Repräsentationen liegt oder was im analogen Archiv verblieben ist und nie digitalisiert wurde. Wer aus einem solchen Bestand argumentiert, muss angeben können, aus welchem Teil eine Aussage stammt, und braucht eine Lesart, die zwischen dem Muster in der Masse und dem einzelnen, sprechenden Dokument Brücken schlägt. Martin Mueller hat das scalable reading genannt.13

Vom ersten Ort, dem Erschließen, braucht die historische Arbeit drei Dinge. Das Erste ist eine Konfidenz zu jedem gelesenen Wert, also die Angabe, für wie sicher das Modell seine eigene Lesart hält. Dazu tritt eine Provenienz: Gemeint ist hier nicht die archivische Herkunft aus einem Bestand, sondern der Verweis auf die Stelle der Karte, aus der der Wert stammt. Ein Wert ohne diese beiden Angaben ist für uns Historiker:innen eine Tatsache ohne Fußnote. Als Drittes verlangt die Arbeit aber womöglich auch ein Attribut, das angibt, ob ein Feld bereits eine Entscheidung enthält. Wo eine Behörde festgelegt hat, welche Werte in einem Feld überhaupt vorkommen dürfen, ist die Deutung bereits vorgeprägt, bevor irgendeine geschichtswissenschaftliche Frage gestellt wird. Ein System, das diesen Umstand festhält, statt ihn zu überschreiben, macht die Stelle sichtbar, die später weiter befragt werden muss.

Auch am Beispiel der Osnabrücker Gestapo-Registratur lässt sich ablesen, was mit einer Kategorie auf ihrem Weg durch die Zeit geschieht. Die Kartei (sie ist eine von nur wenigen in Deutschland erhaltenen Gestapo-Registraturen) wurde 1928 als Kartei einer demokratischen Polizei angelegt. Nach 1933 wurde sie in denselben Karteikästen, auf denselben Formularen und in denselben Handschriften zum Instrument der Geheimen Staatspolizei des NS-Regimes. Kein einziges Zeichen musste sich ändern, damit sich die Bedeutung der Karten vollständig wandelte. Eine einfache Dokumentenanalyse liest die Karte von 1928 und die von 1938 gleich. Ein Verstehen kann sich das nicht leisten, weil zwischen beiden Karten ein Regimewechsel liegt.

Michel-Rolph Trouillot hat am Beispiel der Haitianischen Revolution gezeigt, wie Vergangenheit in der Geschichte zum Schweigen gebracht wird. Sein geschichtstheoretisches Modell verortet die Produktion dieses Schweigens in vier Momenten: beim Herstellen der Quellen, beim Herstellen der Archive, beim Herstellen der Erzählungen und bei der Herstellung von Bedeutung, die eine Gesellschaft dem Geschehenen als erzählte Geschichte im Rückblick zubilligt.14
Diese vier Momente wandern nun auch in die Verarbeitungsketten digitaler Dokumentanalyse und der Weiterverarbeitung der so gewonnenen Daten: in die Datenmodellierung, die vorab entscheidet, was überhaupt ein Feld werden darf; in die Auswahl dessen, was digitalisiert und wie es klassifiziert wird; in Ranking und Retrieval, die dem Digitalisierten einen durchsuchbaren Schatten geben, der es größer erscheinen lässt als alles Nichtdigitalisierte daneben; und schließlich in die flüssige Antwort eines Modells auf die Frage, was eine »displaced person« gewesen sei. Eine Bedingung liegt vor allen vieren: Ausgewählt, digitalisiert, modelliert und verallgemeinert werden kann nur, was überliefert ist. Die Bestände dieses Vortrags sind sämtlich Behördenschriftgut, das eine Verwaltung erzeugt und ein Archiv zu verwahren hatte.
Die Verzerrung der Überlieferung wächst in der digitalen Verarbeitung nicht notwendigerweise; sie verändert aber womöglich deren Sichtbarkeit: Im analogen historischen Dokument liegt die Entscheidung offen, im relationalen Schema ist sie schon ein Stück zurückgetreten, im trainierten KI-Modell (LLM) liegt sie über die Gewichte verteilt tief im System begraben. Finola Finn und Donal Khosrowi haben das Ergebnis dieser Produktion von Geschichte instant history genannt, die flüssige, unmittelbare Antwort eines LLMs, die verbirgt, wie jede Quelle immer bereits vermittelt war.15
Wie praxisrelevant das Problem ist, verdeutlicht ein Fall aus den CM/1-Akten. Im Januar 1948 beantragte eine Person bei der International Refugee Organization Unterstützung und gab als Nationalität »Türkisch« an, als Geburtsort »Istanbul«. Der zuständige eligibility officer schrieb das auf, zweifelte aber an dieser Erzählung und fragte bei der Stadt Osnabrück nach, unter welcher Kategorie dieser Arzt dort geführt werde. Die Auskunft kam aus derselben Kartei, aus der auch die Karte der Beltramis stammt: seit dem 1. Oktober 1943 war der Betreffende in Osnabrück verzeichnet, und zwar mit dem Geburtsort »Baku« in der Sowjetunion. Beide Einträge sind sauber lesbar und für die Dokumentenanalyse ohne Weiteres zu erfassen, wahr sein können sie indes nicht beide.
Abdulhalik Aleskerow war tatsächlich ein Feldarzt der Roten Armee aus Aserbaidschan, geriet 1942 in deutsche Gefangenschaft, durchlief das Lager Wustrau, in dem die Wehrmacht sowjetische Kriegsgefangene prüfte, die zur Kollaboration bereit waren, und wurde ab 1943 als Arzt in einem Zwangsarbeitslager in Osnabrück eingesetzt; er hatte seine biographische Erzählung geändert, weil eine Rückführung in die Sowjetunion für ihn sehr wahrscheinlich den Tod bedeutet hätte.

Im Juni 1950 wurde ihm schließlich der DP-Status aberkannt, weil vermutlich jemand aus der Formulierung, er habe die Türkei »auf eigenen Wunsch« verlassen, geschlossen hatte, ein freiwillig Gewanderter sei gar nicht verschleppt worden. Sechs Jahre lang stritten danach Behörden und Gerichte darüber, was er sei, und verwendeten dabei sieben Kategorien: »displaced person«, »heimatloser Ausländer«, »staatenlos«, »Muslim«, »Straftäter«, »Sowjetbürger«, »türkischer Staatsangehöriger«. 1956 hob ein Gericht die Ausweisungsverfügung auf. Aleskerow lebte bis 1977 in Osnabrück.16
Für eine Systemarchitektur folgt daraus, dass eine Konfidenz allein auf Lesbarkeit hinweisen kann; Aleskerows Akte war lesbar. Ob eine Kategorie umstritten ist, wie sie hergestellt und wem sie zugewiesen wurde, lässt sich der Lesbarkeit eines Eintrags nicht entnehmen. Ein komplexer Konfidenzwert, wie ihn die Geschichtswissenschaft produktiv nutzen könnte, braucht mehr.
Mein Vorschlag für ein Weiterdenken dieser Problemstellung verteilt die Arbeit deshalb auf zwei Modelle, die miteinander und mit uns Historiker:innen sprechen. Das erste, das Quellenmodell, fragt, was ein Dokument materiell und in seiner Überlieferung ist. Es liefert strukturierte Felder, heftet an jedes Feld eine Konfidenz und eine Provenienz und endet in einem quellenverankerten Graphen, also einer Datenstruktur, in der jede Aussage an ihre Belegstelle gebunden bleibt; über Bedeutung behauptet es nichts; seine Arbeit könnte uns an die äußere Quellenkritik im geschichtswissenschaftlichen Methodenseminar erinnern. Das zweite, das Expertenmodell, fragt, was das Dokument bedeutet und wie weit ihm zu trauen ist. Es markiert »Ausländer« als eine vom Amt hergestellte Kategorie, datiert die rückwirkende Eintragung der Beltramis von 1932 als interpretatives Ereignis, hält die Mehrdeutigkeit dort offen, wo die Quelle sie offengelassen hat, und verknüpft den Querverweis von 1957 über zwei Bestände hinweg.

Der eigentliche Vorschlag liegt im Austausch zwischen beiden. Wo das Quellenmodell unsicher ist, schließt das Expertenmodell die Lücke nicht still, es fordert die Bildregion hinter dem Wert an und verzichtet auf eine Antwort, wenn diese nicht eindeutig ausfällt. Ein umstrittener Wert wird markiert und an eine andere Instanz oder an einen Menschen weitergereicht. Jeder Schritt wird protokolliert; das erzeugt die Nachvollziehbarkeit, die am zweiten Ort an die Stelle der ground truth tritt, und sie erlaubt es, auch so komplexe Analysen intersubjektiv zu prüfen. In der Sprache der Dokumentanalyse handelt es sich um selective prediction with abstention und ein Provenienzprotokoll. Neu ist weder das eine noch das andere. Was diese Schleife für die Geschichtswissenschaft bedeutet, hat Andreas Fickers digitale Hermeneutik genannt, das alte Handwerk der Interpretation, aktualisiert für Quellen, die eine Maschine bereits verarbeitet hat.17 Eine Frage bleibt dabei offen: wie ein solches Expertenmodell zu bauen und zu trainieren wäre.

Eine Idee dazu habe ich in Wien als Diskussionsbeitrag vorgetragen, einen Maßstab aus drei Teilen. Die ersten beiden kann die Dokumentanalyse allein spezifizieren: eine Quellenbindung, gemessen als evidence attribution, bei der ein Befund nur zählt, wenn er nachweisbar auf die korrespondierende Stelle in der Quelle zurückzuführen ist; und eine kalibrierte Unsicherheit, die das offene Eingeständnis von Zweifel des Systems belohnt und die Produktion falscher Zuversicht härter bestraft als die ehrliche Zurückhaltung, die Lücken benennt. Der dritte Teil entstünde nur gemeinsam. Er prüft, ob ein Modell eine Kategorie als solche erkennt, also den Begriff, den eine Behörde produziert oder reproduziert, als hergestellte Kategorie markiert, statt ihn als einfache Tatsache über die Person weiterzureichen.
Wie hilfreich das wäre, zeigt die für Osnabrück ausgewertete Teilmenge der CM/1-Akten: In 575 Einträgen mit einer Religionsangabe und 584 mit einer Nationalitätsangabe stehen je sechzehn verschiedene Werte, in denen »Muslim« neben »Mohammedan« steht, »Jewish« neben »Hebrew«, und in denen »Jewish« zugleich als Nationalität auftaucht.18 Niemand hat diese Werte normalisiert. Deshalb hat die von den Werten repräsentierte Aushandlung im Durcheinander des Quellenmaterials überlebt. Bisher annotiert selbst unser veröffentlichter Datensatz in seiner zweiten Fassung zwar Nationalität, Geburtsort und Religion, aber keinen einzigen dieser Werte als umstritten. Der nächste Schritt wäre entsprechend ein Durchgang, in dem zwei Historiker:innen jeden Wert als geklärt oder umstritten markieren, ihren Dissens protokollieren und ein Modell dagegen gemessen wird, bis sichtbar ist, woran es scheitert und wie die dritte Dimension des Maßstabs erreicht werden kann.
Was offenbleibt

Welchen Anteil haben unsere methodischen Entscheidungen an der Herstellung der epistemologischen Rahmungen, in denen wir schließlich mit digitalen Methoden arbeiten? Die Beltramis haben in meinem Vortrag einen Namen, weil Handschriftenerkennung ihre über viele Karten der Ausländermeldekartei verstreuten Einträge gelesen und record linkage (die Zusammenführung von Einträgen zu derselben Person über Bestände hinweg) ihnen über fünfzig Jahre hinweg wieder eine Geschichte gegeben hat. Dieselben Werkzeuge, die auf diese Art und Weise einen Bestand aufschließen können, können ihn indes auch schließen. Ein Leben als Datensatz zurückzugewinnen kann dieses Leben zugleich ein zweites Mal zum Objekt machen. Was von beidem eintritt, hängt von der Perspektive ab, die wir uns empirisch und methodisch erarbeiten. Dass der Einsatz komplexer digitaler Werkzeuge und selbstverständlich auch von künstlicher Intelligenz die Art und Weise verändert, wie Vergangenheit in Geschichte übersetzt wird, ist längst entschieden; offen ist, wie wir diesen Technologiesprung mit all seinen Konsequenzen als Geschichtswissenschaft und im Dialog mit anderen Disziplinen gestalten. Das ist nicht nur eine technische oder fachwissenschaftliche, sondern letztlich vor allem eine kulturelle Frage.
Anmerkungen
- ICDAR 2026. The 20th International Conference on Document Analysis and Recognition, Abruf 02.09.2026; International Association for Pattern Recognition, Technical Committees; IAPR TC10 Graphics Recognition; IAPR TC11 Reading Systems,
iapr-tc11.org(nur über HTTP erreichbar).↩︎ - Zu Ort und Gremien ICDAR 2026, Conference Venue und Committees, Abruf 02.09.2026. Die Zahl der angenommenen und eingereichten Beiträge sowie die acht Wettbewerbsberichte nach dem Klappentext des Tagungsbandes: Document Analysis and Recognition – ICDAR 2026, hrsg. von Gernot A. Fink, Alicia Fornés, Koichi Kise und Daniel Lopresti, Lecture Notes in Computer Science 16972–16975, Cham 2026; die zwölf Beiträge des Journal Track nach dem Programm, Abruf 03.09.2026.↩︎
- ICDAR 2026, Keynote Speakers und Programm, Abruf 02.09.2026. Daneben standen am Dienstag die beiden Vorträge zum Young Investigator Award von Silvia Cascianelli und Jorge Calvo-Zaragoza.↩︎
- Fabian Wolf, Oliver Tüselmann, Arthur Matei, Lukas Hennies, Christoph Rass und Gernot A. Fink: CM1 – A Dataset for Evaluating Few-Shot Information Extraction with Large Vision Language Models, in: Document Analysis and Recognition – ICDAR 2025, Teil II (Lecture Notes in Computer Science 16024), Cham 2025, S. 23–39, DOI 10.1007/978-3-032-04617-8_2; Preprint arXiv:2505.04214. Zu den Größenangaben ist Vorsicht geboten, weil drei Zählungen nebeneinanderstehen: Die Bestandsbeschreibung der Arolsen Archives nennt für 3.2.1.1 über 196.000 Akten und Hinweise auf rund 578.000 Namen, der genannte Beitrag spricht von rund 350.000 erhaltenen Fallakten des gesamten CM/1-Programms, und die Sprechfassung der Keynote nannte rund 155.000 Akten. Die Angaben zum Datensatz selbst (140.114 Vorgänge, 135.951 Deckblätter, 203.112 Personen) sind dem Beitrag entnommen.↩︎
- Arthur Matei, Tim Hallyburton, Lukas Hennies, Christoph Rass und Gernot A. Fink: Recent Advances in Information Extraction from Historical Archival Records, in: Document Analysis and Recognition – ICDAR 2026, Teil III (Lecture Notes in Computer Science 16974), Cham 2026, S. 87–103, DOI 10.1007/978-3-032-36039-7_6.↩︎
- Poster Session #1, Montag, 31. August 2026. Melissa Cote und Alexandra Branzan Albu: An Exploratory Study of Text-to-Image Generation for Query-by-Example Retrieval of Historical Document Images; Tim Raven, Tim Hallyburton und Gernot A. Fink: Writer Retrieval at Scale.↩︎
- Oral Session #7, Historical document analysis, Dienstag, 1. September 2026. Erik Lenas, Viktoria Löfgren und Olof Karsvall: Quality Prediction for Large Scale HTR. Confidence Is All You Need, in: Document Analysis and Recognition – ICDAR 2026 (Lecture Notes in Computer Science 16972), Cham 2026, S. 450–466, DOI 10.1007/978-3-032-36023-6_26. Alle drei arbeiten am schwedischen Reichsarchiv in Stockholm. Die Angaben zu den verwendeten Datensätzen sind der im Vortrag gezeigten Übersicht entnommen, die als Abbildung 4 wiedergegeben ist.↩︎
- Oral Session #6, Handwriting recognition, Dienstag, 1. September 2026. Michael Zhang, Elise Wang, Charlotte Whatley, Seth Strickland und Dylan Bannon: Democratizing the Medieval English Legal Tradition, in: Document Analysis and Recognition – ICDAR 2026 (Lecture Notes in Computer Science 16972), Cham 2026, S. 378–394, DOI 10.1007/978-3-032-36023-6_22; Preprint arXiv:2605.00977. Das Material stammt aus den King’s Bench Rolls, Common Pleas Rolls und Justices Itinerant Rolls des Anglo-American Legal Tradition Archive. Die Angaben zum Umfang des digitalisierten Bestandes und der Fall von 1375 stammen aus dem Vortrag.↩︎
- Tim Hallyburton, Anna Scius-Bertrand, Arthur Neto, Andreas Fischer und Gernot Fink: Reconstruction Error Ratios for Prototype-Anchored Unsupervised Learning in Optical Character Recognition, 8th International Workshop on Historical Document Imaging and Processing, Donnerstag, 3. September 2026.↩︎
- Mark Humphries, Lianne C. Leddy, Quinn Downton u. a.: Unlocking the archives. Using large language models to transcribe handwritten historical documents, in: Historical Methods 58 (2025), H. 3, S. 175–193, DOI 10.1080/01615440.2025.2500309; Gavin Greif, Niclas Griesshaber und Robin Greif: Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents, arXiv:2504.00414 (2025); Niclas Griesshaber und Jochen Streb: Multimodal LLMs for Historical Dataset Construction from Archival Image Scans. German Patents (1877–1918), arXiv:2512.19675 (2025), mit 306.070 Patenten aus 9.562 Archivscans. Zur Verlagerung vom Lesen zum Bauen ferner Jan Černý, Kiril Avramov und Liladhar R. Pendse: A multi-stage agentic AI system for extracting information from large digital archives. Case study on the Czechoslovak year 1968 in CIA’s FOIA collection, in: The Electronic Library (2026), DOI 10.1108/EL-06-2025-0272, deren Fazit ich mir zu eigen mache: Der Effizienzgewinn ist real, die interpretatorische Verantwortung wandert nicht.↩︎
- DFG-Sonderforschungsbereich 1604 »Produktion von Migration«, Universität Osnabrück, Projektnummer 501120656, Sprecher Andreas Pott, seit 2024. Die zitierten Wendungen nach der Projektbeschreibung in GEPRIS, Abruf 02.09.2026; ferner das Forschungsprogramm des SFB.↩︎
- Rogers Brubaker und Frederick Cooper: Beyond »identity«, in: Theory and Society 29 (2000), H. 1, S. 1–47, DOI 10.1023/A:1007068714468.↩︎
- Martin Mueller: Shakespeare His Contemporaries. Collaborative curation and exploration of Early Modern drama in a digital environment, in: Digital Humanities Quarterly 8 (2014), H. 3. Die Oregoner Feldphase im August 2026 gehört zur Arbeit im SFB 1604.↩︎
- Michel-Rolph Trouillot: Silencing the Past. Power and the Production of History, Boston 1995, Einleitung.↩︎
- Finola Finn und Donal Khosrowi: AI assistants in the archive and the lure of »instant history«, in: Cambridge Forum on AI. Culture and Society 2 (2026), Artikel e6, DOI 10.1017/cfc.2025.10012.↩︎
- Jessica Wehner und Christoph Rass: Disputed (Non-)Belonging. Migrant Agency in the European Displacement Crisis 1945–56, in: Journal of Contemporary History, OnlineFirst Dezember 2025, DOI 10.1177/00220094251396890. Die beiden abgebildeten Dokumente stammen aus den Beständen 3.2.1.1/78872005 und 2.1.2.1/70716584 der Arolsen Archives; die Auskunft der Stadt Osnabrück entstammt der Ausländermeldekartei, Niedersächsisches Landesarchiv, Abteilung Osnabrück, Dep 3 c Akz. 2019/83.↩︎
- Andreas Fickers: Update für die Hermeneutik. Geschichtswissenschaft auf dem Weg zur digitalen Forensik?, in: Zeithistorische Forschungen 17 (2020), H. 1, S. 157–168, DOI 10.14765/zzf.dok-1765; ferner Andreas Fickers, Juliane Tatarinov und Tim van der Heijden: Digital history and hermeneutics. Between theory and practice, in: Andreas Fickers und Juliane Tatarinov (Hg.): Digital History and Hermeneutics, Berlin/Boston 2022, S. 1–20, DOI 10.1515/9783110723991-001.↩︎
- Auswertung der für Osnabrück verarbeiteten Teilmenge des Bestandes 3.2.1.1 der Arolsen Archives, vorgestellt auf Folie 13 der Keynote. Die Teilmenge umfasst die CM/1-Akten von Personen, die in Osnabrück verblieben sind.↩︎
Schlagworte: ICDAR 2026 · Document Analysis and Recognition · Handschriftenerkennung · Vision-Language-Modelle · Kategorien · »Displaced Persons« · CM/1 · Ausländermeldekartei · Arolsen Archives · TU Dortmund · SFB 1604 »Produktion von Migration«
Zur Keynote: Christoph A. Rass, From Archives to Algorithms and Back: What Historians Need from Document Understanding, Keynote #2 der ICDAR 2026, TU Wien, 1. September 2026. Die Arbeiten, über die der Vortrag berichtet, entstehen gemeinsam mit Gernot A. Fink, Arthur Matei und Tim Hallyburton (Pattern Recognition Group, TU Dortmund), mit Lukas Hennies, Jessica Wehner und dem Team der Arbeitsgruppe NGHM der Universität Osnabrück, in Zusammenarbeit mit dem Niedersächsischen Landesarchiv, Abteilung Osnabrück, den Arolsen Archives und dem SFB 1604 »Produktion von Migration«.
Zum Autor: Christoph A. Rass ist Professor für Neueste Geschichte und Historische Migrationsforschung an der Universität Osnabrück (ORCID 0000-0001-9492-907X).









































































































