Bevor KI Datensätze zusammenführt: Die maßgebliche Quelle festlegen
KI kann wahrscheinliche Duplikate aufzeigen, sollte aber nicht stillschweigend entscheiden, welche Identität, welches Feld oder welche Historie überlebt. Nutzen Sie einen Merge-Vertrag, bevor Datensätze kombiniert werden.

Ein doppelter Datensatz sieht nach einem Aufräumproblem aus, bis die beiden Zeilen nicht übereinstimmen. Ein Lieferanteneintrag enthält die aktuelle Bankverifizierung, ein anderer die genehmigten Zahlungsbedingungen, und eine Drittanbieter-Adressprüfung zeigt auf einen anderen Ort. Ein KI-System kann das Paar als wahrscheinliche Übereinstimmung einstufen, aber ein hoher Ähnlichkeitswert beantwortet nicht die entscheidenden Fragen: Handelt es sich wirklich um dieselbe Entität, welche Felder sollen überleben und welche Historie muss sichtbar bleiben?
Deshalb braucht eine KI-gestützte Zusammenführung eine vom Menschen verantwortete Quelle der Wahrheit. Der UK Government Data Quality Framework behandelt Einzigartigkeit, Vollständigkeit und Konsistenz als separate Dimensionen; ein Datensatz kann einzigartig, aber unvollständig sein oder dupliziert, während jede Kopie gültige Belege enthält. Das ONS weist auch darauf hin, dass Abgleiche zu falsch positiven und falsch negativen Ergebnissen führen können. Der sicherste Workflow trennt daher den Vorschlag zur Übereinstimmung von der Genehmigung zur Zusammenführung.

Erstellen Sie einen TRACE-Merge-Vertrag vor dem ersten Klick
Ein Merge-Vertrag ist eine kurze, wiederverwendbare Entscheidungsregel für einen Datensatztyp. Er sagt den Prüfern, was als Identitätsnachweis zählt, welches System für jedes Feld maßgeblich ist und wann der Prozess gestoppt werden muss. Verwenden Sie TRACE, um ihn zu entwerfen:
TRACE-Merge-Vertrag
Zielentität
Benennen Sie das zu identifizierende Objekt: einen rechtlichen Lieferanten, eine Person, ein Konto, einen Standort oder einen Vertrag. Lassen Sie nicht zu, dass ein gemeinsamer Name eine gemeinsame Identität ersetzt.
Datensatznachweise
Listen Sie die Nachweise auf, die eine Übereinstimmung belegen können, z. B. eine verifizierte Steuernummer, Kundennummer oder genehmigte Adresse. Kennzeichnen Sie schwache Signale, einschließlich Rechtschreibähnlichkeit, nur als unterstützende Beweise.
Autorität pro Feld
Benennen Sie die maßgebliche Quelle für jedes wichtige Feld. Das Finanzsystem kann die Zahlungsbedingungen besitzen, während der Einkauf den Lieferantenstatus besitzt.
Konfliktprotokoll
Protokollieren Sie jede Abweichung und den Grund für den gewählten Wert. Ein Prüfer sollte die Entscheidung ohne erneuten KI-Lauf nachvollziehen können.
Eskalieren und Beibehalten
Definieren Sie Felder, die eine automatische Zusammenführung blockieren, und bewahren Sie dann beide Originaldatensätze und deren Herkunft nach einer Entscheidung auf.
Ähnlichkeit ist keine Identität
Namen, Domänen und Adressen können helfen, Kandidaten zu finden. Sie sollten jedoch nicht allein eine Zusammenführung autorisieren, wenn Kennungen, Eigentumsverhältnisse oder regulierte Attribute in Konflikt stehen.
Praxisbeispiel: zwei Lieferantendatensätze, eine unsichere Identität
Angenommen, ein KI-Assistent kennzeichnet „Northline Studio Ltd“ und „North Line Studios“ als Duplikate. Die Namen und die Postleitzahl sind ähnlich. Die Steuernummern unterscheiden sich jedoch, ein Datensatz ist für Bankzahlungen genehmigt, und der andere enthält ein aktuelles Versicherungszertifikat. Behandeln Sie den Vorschlag als Prüfwarteschlange, nicht als Zusammenführungsbefehl.
Lesen ist der Anfang. Üben macht den Unterschied.
Jetzt starten| AI suggestion | Human decision | |
|---|---|---|
| Identität | Likely duplicate from name and address | Hold: conflicting tax IDs must be resolved by procurement |
| Zahlungsbedingungen | Prefer the newest value | Use the finance-owned approved value |
| Risikostatus | Combine both labels | Retain both until the legal entity is confirmed |
| Historie | Keep the merged row | Keep both originals, the decision log and a reversible link |
Bestätigt der Einkauf, dass die Abweichung der Steuernummer ein Dateneingabefehler war, wählt der Prüfer einen primären Datensatz, wendet feldweise Überlebensregeln an und protokolliert, warum jeder Wert gewonnen hat. Der sekundäre Datensatz kann deaktiviert werden, bleibt aber sichtbar. Das Department for Education verwendete ein ähnliches Muster in seinem Design für doppelte Datensätze: Side-by-Side-Vergleich, ein gewählter primärer Datensatz, individuelle Feldentscheidungen, Kommentare und ein beibehaltener sekundärer Datensatz. Ist die Identität nicht bewiesen, bleiben beide Datensätze aktiv und der Fall wird eskaliert.
Führen Sie die Zusammenführung als kontrollierte Entscheidung durch
Fünf Prüfschritte
- 1
Kandidaten einfrieren
Erfassen Sie beide Datensätze und deren Aktualisierungsdaten vor jeglichen Änderungen.
- 2
Entität beweisen
Überprüfen Sie den Identitätsnachweis des Vertrags. Klassifizieren Sie das Paar als exakt, wahrscheinlich oder zweideutig.
- 3
Feldweise lösen
Wenden Sie die benannte Quellautorität an, anstatt die am vollständigsten aussehende Zeile zu wählen.
- 4
Ausnahme protokollieren
Protokollieren Sie Konflikte, fehlende Nachweise, Prüfer und Grund. Stoppen Sie bei jedem Eskalationsfeld.
- 5
Bewahren und testen
Bewahren Sie die Originale auf, erstellen Sie die reversible Verknüpfung und überprüfen Sie nachgelagerte Summen, Berechtigungen und Warnungen.
Diese Kontrolle unterstützt auch die Genauigkeit. Das ICO rät Organisationen, die Quelle und den Status personenbezogener Daten klar darzulegen und in einigen Fällen einen genauen Datensatz eines Fehlers zu behalten, anstatt jede Spur davon zu löschen. Ein Merge-Protokoll ist daher keine administrative Unordnung; es ist ein Beweis dafür, dass der aktuelle Datensatz erklärt werden kann.
- Choose two low-risk records that a system has flagged as possible duplicates.
- Write the target entity and two pieces of identity evidence that would prove a match.
- Name the authoritative source for three conflicting fields.
- Mark one condition that must stop the merge and require escalation.
- Decide how both originals and the review decision will remain accessible.
Regel wiederverwendbar machen
Nach dem Testen wird der Vertrag zusammen mit dem Workflow gespeichert und bei System- oder Verantwortungsänderungen überprüft. Ein guter Vertrag funktioniert mit einem Annahme-Logbuch, einem Workflow-Änderungsprotokoll und einer KI-Übergabekarte. Gemeinsam verwandeln sie eine einmalige Korrektur in eine kontrollierte, nachvollziehbare Betriebspraxis.
Die zentrale Disziplin ist einfach: Lassen Sie die KI plausible Paare finden, aber verlangen Sie von den Menschen, Identität, Autorität und Historie zu definieren, bevor Daten kombiniert werden. Die Quelle der Wahrheit ist nicht die Zeile, die am vollständigsten aussieht, sondern der Datensatz, der durch eine explizite, überprüfbare Entscheidung entsteht.
Quellen
- The Government Data Quality Framework — UK Government
- Data linkage and matching policy — Office for National Statistics
- Principle (d): Accuracy — Information Commissioner's Office
- Resolving potential duplicate records — UK Department for Education
Lesen ist der Anfang. Üben macht den Unterschied.
Bokili macht aus solchen Fähigkeiten Zehn-Minuten-Missionen für das ganze Team – mit sofortigem Feedback und sichtbarem Fortschritt.
Jetzt startenWeiterlesen

KI-Weiterbildung im Unternehmen: Coaching und Prüfung trennen
KI-Lernentwicklung ist schwer vertrauenswürdig, wenn dasselbe Tool eine Aufgabe coacht, umschreibt und bewertet. Nutzen Sie drei klare Zonen, um Arbeitsnachweise aussagekräftig zu machen.

KI-Weiterbildung für Teams: Den Arbeitsalltag proben
KI-Weiterbildung für Teams muss im Arbeitsalltag bestehen. Eine zweistufige Probe testet dieselbe Fähigkeit unter Zeit-, Input- und Unterbrechungszwängen.

Checkliste, Rubrik oder Beispiel? Das richtige KI-Review-Tool wählen
Eine Checkliste deckt Fehlendes auf, eine Rubrik bewertet die Qualität und ein Referenzbeispiel verdeutlicht die Absicht. Nutzen Sie jedes Tool für die Entscheidung, die es am besten unterstützt.