Artikel

Doppelte Orte und doppelte Bilder erkennen

Ähnliche Einträge sind nicht automatisch dieselben Orte, und gleiche Motive sind nicht dieselben Dateien. Der Artikel entwickelt eine nachvollziehbare Dublettenprüfung, die technische Hinweise nutzt, redaktionelle Unterschiede erhält und Zusammenführungen überprüfbar macht.

BlackZackBlackZack

1610 Wörter · 9 Min. Lesezeit

  • lostplaces
  • dubletten
  • datenqualität
Doppelte Orte und doppelte Bilder erkennen

KI-generierte Illustration eines fiktiven Orts; keine Aufnahme einer besuchten Location.

Zwei Einträge tragen verschiedene Namen, zeigen aber dieselbe Fassade. Zwei Dateien sehen gleich aus, besitzen jedoch unterschiedliche Abmessungen. Eine dritte Aufnahme zeigt denselben Raum zu einem anderen Zeitpunkt und ergänzt eine wichtige Beobachtung. Alle drei Situationen können in einer schnellen Dublettensuche ähnlich erscheinen, verlangen aber unterschiedliche Entscheidungen. Ein brauchbares Verfahren beginnt deshalb mit der Frage, welche Art von Gleichheit überhaupt gesucht wird.

Für eine Lost-Places-Sammlung sind mindestens drei Ebenen zu unterscheiden: identische Dateien, verschiedene Darstellungen derselben Aufnahme und mehrere Beschreibungen desselben Ortes. Hinzu kommen ähnliche Motive, die gerade keine Dubletten sind. Werden diese Ebenen vermischt, kann eine automatische Bereinigung wertvolle Bilder oder eigenständige Gebäudeteile entfernen. Die Technik sollte daher Kandidaten sichtbar machen und Beziehungen erklären. Eine redaktionelle Zusammenführung braucht anschließend eine nachvollziehbare Entscheidung.

Identische Dateien zuerst gesondert erkennen

Wenn zwei Dateien denselben Inhalt besitzen, lässt sich dieser Fall relativ klar eingrenzen. Ein kryptografischer Hashwert wie SHA-256 eignet sich als technischer Vergleichswert für die Dateibytes. Die Python-Dokumentation zu hashlib beschreibt entsprechende Funktionen. Für eine praktische Dublettensuche werden gleiche Dateigröße und gleicher Hashwert als starke Kandidatenmerkmale verwendet; vor einer endgültigen automatischen Entfernung kann zusätzlich der vollständige Bytevergleich erfolgen.

Diese Prüfung sagt nichts darüber aus, ob zwei verschieden gespeicherte Dateien dasselbe Bild zeigen. Bereits veränderte Metadaten können den Dateihash verändern, obwohl die sichtbaren Pixel gleich bleiben. Ein neuer JPEG-Export verändert typischerweise ebenfalls die Datei. Deshalb darf eine Liste ohne identische Hashwerte nicht als Beweis gelten, dass der Bestand keine mehrfachen Aufnahmen enthält. Der technische Vergleich beantwortet eine engere Frage: Welche Dateien sind auf dieser Ebene gleich?

Ein kurzer lesender Beispielcode kann Kandidaten in einer ausdrücklich ausgewählten Testgruppe sammeln. Er verändert oder löscht keine Dateien. Der Ausschnitt ist ein illustrativer Entwurf für lokale, zuvor geprüfte Dateien und kein bereits eingebautes Merkmal des LostPlaces-Projekts.

from collections import defaultdict
from hashlib import sha256
from pathlib import Path
 
gruppen = defaultdict(list)
for pfad in Path("testbilder").glob("*.jpg"):
    digest = sha256()
    with pfad.open("rb") as datei:
        for block in iter(lambda: datei.read(1024 * 1024), b""):
            digest.update(block)
    gruppen[(pfad.stat().st_size, digest.hexdigest())].append(pfad.name)
 
for namen in gruppen.values():
    if len(namen) > 1:
        print(namen)

Die Ausgabe wird als Prüfliste behandelt. Auch bei identischen Dateien kann die Zuordnung zu mehreren Beiträgen wichtig sein. Die Dateikopie lässt sich möglicherweise vereinheitlichen, während ihre Verwendungsnachweise erhalten bleiben müssen. Eine technische Dublette bedeutet nicht, dass eine ihrer redaktionellen Beziehungen überflüssig ist. Genau diese Trennung verhindert, dass eine Speicherbereinigung unbemerkt Bildverweise oder Herkunftsinformationen beschädigt.

Verschiedene Exporte als Varianten verbinden

Eine große Arbeitsfassung, ein enger Webbeschnitt und eine quadratische Vorschau können aus derselben Ausgangsaufnahme entstehen. Sie sind keine zufälligen doppelten Dateien, sondern besitzen unterschiedliche Aufgaben. Wenn ihre gemeinsame Herkunft bekannt ist, werden sie über eine stabile Bildkennung verbunden. Der Katalog kann dann zeigen, welches Original zu welchen Ausgabeversionen gehört. Eine visuelle Suche ist in diesem Fall nur nötig, wenn diese Beziehung im bisherigen Bestand verloren gegangen ist.

Bei einer nachträglichen Untersuchung helfen Abmessungen, Dateinamen und eingebettete Kennungen als Hinweise. Keines dieser Merkmale allein beweist die Herkunft. Ein ähnlicher Dateiname kann zufällig entstehen, und unterschiedliche Dateinamen können dieselbe Aufnahme bezeichnen. Deshalb wird ein Kandidatenpaar geöffnet und anhand konkreter Bildmerkmale verglichen. Wiederkehrende kleine Strukturen, identische Schattenverläufe und dieselbe Perspektive können die Zuordnung stützen, ohne dass ein einzelner allgemeiner Farbton dafür ausreicht.

Die Pillow-Dokumentation zum Image-Modul beschreibt Werkzeuge zum Öffnen und Umformen von Bildern. Solche Funktionen können eine vereinheitlichte Vergleichsansicht erzeugen. Die redaktionelle Schlussfolgerung bleibt davon getrennt: Ein auf gleiche Größe gebrachtes Vorschaubild erleichtert den Vergleich, bestätigt aber keine historische oder räumliche Identität. Besonders starke Beschnitte können wichtige Unterschiede entfernen und sollten zusammen mit den vollständigen Fassungen betrachtet werden.

Ähnlichkeit nur als Hinweis verwenden

Ein visuelles Ähnlichkeitsverfahren kann Aufnahmen mit ähnlicher Verteilung von Formen oder Helligkeiten gruppieren. Für Architektur ist das nützlich, aber fehleranfällig. Fensterreihen, lange Flure und gleichartige Hallen ähneln sich auch dann, wenn sie verschiedene Orte zeigen. Umgekehrt kann dieselbe Aufnahme durch einen engen Ausschnitt oder eine starke Bearbeitung sehr anders wirken. Ein Schwellenwert erzeugt deshalb Kandidaten mit unvermeidlichen Fehlzuordnungen und übersehenen Fällen.

Die Oberfläche einer solchen Prüfliste sollte erklären, warum Bilder gemeinsam erscheinen. Ein Hinweis wie „ähnlicher Bildaufbau“ ist ehrlicher als „Duplikat erkannt“, solange keine sichere Gleichheit festgestellt wurde. Die Redaktion kann Kandidaten bestätigen, verwerfen oder als Varianten verbinden. Diese drei Ausgänge sind verschieden. Wer jedes bestätigte ähnliche Motiv sofort löscht, verliert möglicherweise eine Aufnahme, die einen anderen Zeitpunkt oder eine ergänzende Perspektive dokumentiert.

Für den Anfang ist eine kleine manuelle Vergleichsgruppe oft ausreichend. Die eigene Sammlung muss nicht sofort mit einem komplexen Suchsystem ausgestattet werden. Wenn regelmäßig Bilder aus wenigen Aufnahmegruppen geprüft werden, liefern klare Kennungen und gute Kontaktbögen bereits viel Nutzen. Automatisierung lohnt dort, wo sie eine wiederkehrende konkrete Arbeit erleichtert. Ihr Ergebnis sollte jederzeit auf die Ausgangsdateien und eine verständliche Prüfentscheidung zurückgeführt werden können.

Ein Beispiel mit vier scheinbar gleichen Bildern

Im fiktiven Testbestand liegen vier Dateien einer Fensteransicht. Die ersten beiden sind bytegleich und wurden versehentlich zweimal importiert. Die dritte ist ein kleiner Webexport derselben Aufnahme. Die vierte zeigt dasselbe Motiv aus nahezu gleicher Position, entstand aber bei einem späteren dokumentierten Termin. Auf kleinen Vorschaubildern wirken alle ähnlich. Eine einzige pauschale Dublettenregel würde die unterschiedlichen Beziehungen nicht ausreichend erfassen.

Zuerst werden die beiden identischen Dateien als technische Kopien markiert. Ihre Verwendungen werden zusammengetragen, bevor eine gemeinsame Ablage vorgesehen wird. Der Webexport erhält anschließend einen Verweis auf die Ausgangsaufnahme. Er bleibt als konkrete veröffentlichte Fassung erhalten, solange diese Version benötigt wird. Die spätere Aufnahme bekommt eine eigene Bildkennung und bleibt eigenständig. Ihr anderer Zeitbezug ist für einen möglichen Vergleich relevant, selbst wenn der Bildaufbau kaum abweicht.

Beim direkten Vergleich fällt auf, dass eine Rahmenfläche in der späteren Aufnahme anders aussieht. Die Redaktion beschreibt nur den sichtbaren Unterschied und behauptet keine Ursache. Die Dublettenprüfung hat damit einen möglichen Vergleichsbeitrag erschlossen, statt ihn zu entfernen. Das Beispiel zeigt, warum Ähnlichkeit in einem dokumentarischen Archiv auch wertvoll sein kann. Wiederholte Ansichten sind nicht automatisch schlechte Redundanz, sondern manchmal gerade das Material für eine präzisere Beobachtung.

Die Testentscheidung wird kurz protokolliert: identische Kopie vereinheitlichen, Ausgabeversion verknüpfen, spätere Aufnahme behalten. Ein zweiter Blick prüft, ob alle bisherigen Artikel weiterhin auf die richtige Fassung zeigen. Erst danach wäre eine tatsächliche Bereinigung sinnvoll. Der Ablauf trennt Erkennung, Entscheidung und Umsetzung. So kann jeder Schritt geprüft werden, ohne dass die erste Vermutung bereits irreversible Folgen für den Bestand hat.

Bei Orten zählt die beschriebene Einheit

Zwei Einträge können denselben Gebäudekomplex betreffen und trotzdem unterschiedliche Einheiten beschreiben. Ein Hauptbau und ein eigenständiger Seitenflügel sind nicht allein deshalb Dubletten, weil ihre ungefähren Kartenpositionen nahe beieinanderliegen. Zuerst wird geprüft, was die jeweiligen Texte und Bilder umfassen. Eine Zusammenführung ist sinnvoll, wenn beide tatsächlich denselben Gegenstand mit derselben Abgrenzung beschreiben. Sonst kann eine übergeordnete Beziehung die bessere Lösung sein.

Namen sind dabei nur Hinweise. Historische Namen, heutige Bezeichnungen und persönliche Arbeitstitel können denselben Ort meinen. Derselbe gebräuchliche Name kann aber auch mehrfach vorkommen. Eine Kandidatensuche darf ähnliche Titel hervorheben, sollte die Entscheidung jedoch mit Bildern, Quellen und beschriebener räumlicher Einheit verbinden. Öffentlich reduzierte Kartenangaben werden nicht durch eine immer genauere öffentliche Vergleichsansicht ersetzt. Die Prüfung bleibt innerhalb der für die zuständige Rolle vorgesehenen Informationen.

Auch unterschiedliche Zeitbezüge können erklären, warum Einträge zunächst widersprüchlich wirken. Ein älterer Beitrag beschreibt einen früher dokumentierten Zustand, ein neuerer eine spätere Beobachtung. Werden sie zusammengeführt, müssen beide Zeitbezüge erhalten bleiben. Ein einzelner gemischter Text kann sonst so wirken, als seien alle Merkmale gleichzeitig beobachtet worden. Eine saubere Zusammenführung ordnet die Informationen und löscht nicht ihre zeitliche Herkunft.

Eine Zusammenführung braucht einen überprüfbaren Plan

Vor einer Ortszusammenführung wird festgelegt, welcher Eintrag die dauerhafte Hauptadresse erhält. Danach werden Beschreibungen, Bilder, Quellen und Kommentare einzeln betrachtet. Widersprüchliche Aussagen werden nicht automatisch durch die längere Fassung ersetzt. Die Redaktion prüft ihre Grundlagen und hält offene Unterschiede sichtbar. Auch eine umfangreiche Beschreibung kann ältere Fehler enthalten. Umfang ist kein zuverlässiges Kriterium für den Vorrang eines Datensatzes.

Bestehende Verweise müssen anschließend weiterhin sinnvoll funktionieren. Eine alte Adresse kann auf den zusammengeführten Eintrag führen, sofern die Sichtbarkeitsregeln dabei erhalten bleiben. Private oder eingeschränkte Informationen dürfen durch die Zusammenführung nicht in einen öffentlichen Zusammenhang geraten. Deshalb wird für jede übernommene Information ihr vorgesehener Umfang geprüft. Die Zusammenführung ist nicht bloß eine Datenbankoperation, sondern eine Änderung des veröffentlichten Zusammenhangs.

Der Entwurf sollte außerdem eine Rücknahme ermöglichen. Dafür wird festgehalten, welche Inhalte aus welchem Eintrag stammen und welche Beziehungen geändert wurden. Wenn sich später herausstellt, dass zwei Gebäude verwechselt wurden, kann die Redaktion die Entscheidung gezielt korrigieren. Ein pauschales Überschreiben ohne Herkunftsnachweis macht diese Korrektur deutlich schwieriger. Die Möglichkeit einer Fehlentscheidung gehört von Anfang an zum Verfahren und nicht erst in die Fehlerbehandlung danach.

Ablehnungen einer Dublette ebenfalls festhalten

Wenn ein geprüftes Kandidatenpaar eindeutig verschiedene Orte zeigt, sollte diese Entscheidung wiederauffindbar bleiben. Andernfalls taucht dasselbe Paar nach jedem neuen Suchlauf erneut auf und bindet dieselbe redaktionelle Arbeit. Eine kurze Notiz kann die ausschlaggebende Unterscheidung nennen, etwa einen anderen Gebäudeteil oder eine belegte andere Zuordnung. Sie beschreibt die Entscheidung, ohne unnötige genaue Standortinformationen in eine allgemein sichtbare Prüfliste zu schreiben.

Diese Notiz ist jedoch kein ewiges Verbot einer erneuten Prüfung. Neue Bilder oder bessere Quellen können die Lage verändern. Sinnvoll ist deshalb, den damals verglichenen Stand und den Grund zu speichern. Ändert sich einer der Einträge wesentlich, kann das Paar erneut relevant werden. So vermeidet das Verfahren sowohl endlose Wiederholungsarbeit als auch eine starre frühere Entscheidung, die trotz neuer Erkenntnisse unangetastet bleibt.

Für Bilder gilt dieselbe Überlegung. Zwei ähnliche Fassadenaufnahmen können als eigenständige Motive bestätigt worden sein. Wird später eine andere Datei unter derselben Kennung ergänzt, passt die alte Entscheidung möglicherweise nicht mehr. Der Bezug auf konkrete Versionen hält die Prüfliste verständlich und macht ihren Wartungsbedarf sichtbar.

Die Prüfliste an bewusst schwierigen Fällen testen

Ein sinnvoller Testbestand enthält identische Dateien, neu exportierte Varianten, andere Ausschnitte, ähnliche fremde Motive und spätere Aufnahmen desselben Motivs. Für Orte kommen gleichnamige verschiedene Gebäude und unterschiedlich benannte gleiche Gebäude hinzu. Die erwartete Einordnung wird vor dem Test festgelegt. So zeigt sich, welche Fälle die Methode gut findet und wo menschliche Prüfung unverzichtbar bleibt. Eine reine Erfolgsdemo mit offensichtlichen Kopien würde diese Grenzen verbergen.

Eine gute Dublettenprüfung macht den Bestand übersichtlicher, ohne seine Beziehungen zu vereinfachen. Sie erkennt technische Wiederholungen, verbindet zusammengehörige Varianten und bewahrt eigenständige Beobachtungen. Für eine Lost-Places-Sammlung ist das entscheidend: Das Ziel ist nicht die kleinstmögliche Dateizahl, sondern ein nachvollziehbarer Bestand, in dem jede Aufnahme und jeder Ort die passende Identität und den richtigen Zusammenhang behalten.