Name screening ist ein zentraler Bestandteil von Compliance-Prozessen wie dem Kunden-Onboarding und dem Sanktionsscreening. Gleichzeitig stellt er eine erhebliche Herausforderung dar, da Namen auf unterschiedlichste Weise geschrieben werden können. Bei nicht-lateinischen Schriftsystemen und Ideogrammen, etwa im Chinesischen, nimmt diese Komplexität noch weiter zu.
Das von Babel Street unterstützte Namensabgleichssystem in Siron®One verbessert die Genauigkeit bei der Identifizierung von Namen. Herkömmliche Verfahren des unscharfen fuzzy name matching Namensabgleichs stoßen bei chinesischen Schriftzeichen und Ideogrammen jedoch häufig an ihre Grenzen, was zu unzuverlässigen oder langsamen Ergebnissen führen kann.
In diesem Interview erläutert Gil Irizarry, CIO von Babel Street, warum der Namensabgleich bei chinesischen Schriftsystemen und Ideogrammen besonders komplex ist. Er zeigt die Grenzen klassischer Fuzzy-Matching-Verfahren auf und erklärt, wie Babel Street mit der sogenannten Pairwise-Methode einen einzigartigen hybriden Ansatz entwickelt hat, der präzise Ergebnisse in weniger als einer Sekunde ermöglicht.
Nachfolgend finden Sie eine schriftliche Zusammenfassung des Interviews:
Chinesische Schriftsysteme und ihre Komplexität verstehen
Frage 1: Geben Sie uns einen Überblick über die Komplexität chinesischer Schriftsysteme und Ideogramme, ihre Verwendung in den Sprachen anderer Länder sowie darüber, wie Kultur, Geschichte und Politik diese Sprachen beeinflusst haben.
Zusammenfassung von Gils Antwort:
„„Das chinesische Schriftsystem ist mehr als 4.000 Jahre alt und hat sich von Piktogrammen zu stilisierten Ideogrammen entwickelt. Es hat zahlreiche Sprachen in Asien beeinflusst: In China werden Hanzi verwendet, Japan übernahm Kanji, Korea verwendet Hanja, und auch im traditionellen Vietnamesischen kamen chinesische Schriftzeichen zum Einsatz. Die Komplexität dieser Zeichen ist sehr unterschiedlich. Einige bestehen aus bis zu 172 Strichen. Darüber hinaus ist Chinesisch eine tonale Sprache, bei der sich die Aussprache abhängig von der Betonung beziehungsweise Tonhöhe verändert. Dies führt bei der Transliteration in lateinische Schrift zu zusätzlichen Herausforderungen. Für eine korrekte Wiedergabe ist es daher entscheidend zu erkennen, ob es sich um chinesische, japanische oder koreanische Schriftzeichen handelt.“
Herausforderungen bei der Transliteration zwischen Han-Schrift und lateinischer Schrift
Frage 2: Welche Herausforderungen bestehen bei der Transliteration aus Sprachen mit Han-Schrift und in diese Sprachen sowie bei der Übertragung aus der lateinischen Schrift und in diese?
Zusammenfassung von Gils Antwort:
„Transliteration unterscheidet sich von Übersetzung: Sie konzentriert sich auf die Wiedergabe der Aussprache und nicht der Bedeutung. Die chinesische Hauptstadt ‚北京‘ wird beispielsweise als ‚Beijing‘ transliteriert und nicht mit ‚Nördliche Hauptstadt‘ übersetzt. Romanisierungssysteme wie Pinyin verwenden Tonzeichen, um die Aussprache möglichst genau wiederzugeben. Bei der Transliteration japanischer und koreanischer Begriffe sind solche Tonzeichen dagegen nicht erforderlich. Die zentrale Herausforderung besteht darin, eine korrekte Darstellung sicherzustellen und gleichzeitig die sprachliche Integrität zu bewahren.“
Fuzzy Name Matching und seine Bedeutung für nicht-lateinische Schriftsysteme
Frage 3: Was ist Fuzzy Name Matching, wie funktioniert es und wie wirksam ist es bei nicht-lateinischen Schriftsystemen?
Zusammenfassung von Gils Antwort:
„Fuzzy Name Matching ermöglicht es, Namen trotz unterschiedlicher Schreibweisen, Transkriptionen oder Transliterationen zu erkennen. Der Name ‚Sophia‘ kann beispielsweise sowohl S-O-P-H-I-A als auch S-O-F-I-A geschrieben werden, wobei beide Varianten gültig sind. Dies ist insbesondere bei nicht-lateinischen Schriftsystemen relevant, da häufig mehrere Transliterationsstandards existieren. Der chinesische Nachname ‚Wu‘ kann beispielsweise als W-U oder W-O-O erscheinen. Auch der arabische Name ‚Muhammad‘ kann unter anderem als Mohammed, Muhammed oder Mohammad geschrieben werden. Fuzzy Name Matching berücksichtigt solche Varianten und verbessert dadurch die Genauigkeit bei der Identitätsprüfung.“
Pairwise Matching und seine Anwendung bei chinesischen Namen
Frage 4: Was ist Pairwise Matching und wie löst es die Herausforderungen bei der Transliteration chinesischer Namen?
Zusammenfassung von Gils Antwort:
„Pairwise Name Matching ist eine spezialisierte Form des Fuzzy Name Matching, bei der zwei konkrete Namen auf ihre Ähnlichkeit geprüft werden. Das Verfahren dient als zusätzliche Plausibilitätsprüfung bestehender Systeme und stellt sicher, dass unterschiedliche Namensvarianten korrekt erkannt werden. Der Name ‚Yang‘ kann beispielsweise als Y-A-N-G oder Y-O-N-G transliteriert werden. Pairwise Matching hilft dabei festzustellen, ob sich beide Schreibweisen auf dieselbe Person beziehen. Dadurch verbessert das Verfahren die Zuverlässigkeit der Transliteration chinesischer Namen in regulatorischen Anwendungsfällen.“
Die hybride Zwei-Pass-Methode für das Namensscreening
Frage 5: Wie funktioniert die hybride Zwei-Pass-Methode, in welchem Umfang reduziert sie falsch-positive und falsch-negative Ergebnisse und wie viel zusätzliche Zeit benötigt das Screening mit diesem Verfahren?
Zusammenfassung von Gils Antwort:
„Das von Babel Street unterstützte Namensabgleichssystem in Siron®One verwendet einen zweistufigen Ansatz, um Präzision und Trefferquote optimal auszubalancieren. Im ersten Durchlauf werden mithilfe von Hashing-Funktionen breit gefasste potenzielle Übereinstimmungen ermittelt. Im zweiten Durchlauf werden KI- und Machine-Learning-Algorithmen eingesetzt, um die Genauigkeit weiter zu verbessern. Dieses Verfahren verbindet Geschwindigkeit mit Präzision und liefert Ergebnisse innerhalb von Millisekunden. Das System ist darauf ausgelegt, große Mengen an Namen effizient zu verarbeiten und gleichzeitig sowohl falsch-positive als auch falsch-negative Ergebnisse zu reduzieren.“
Deep-Learning-Neuronale Netze für den Abgleich japanischer Namen
Frage 6: Erzählen Sie uns etwas über das Deep-Learning-Neuronale Netz, das Sie für den Abgleich japanischer Namen trainieren mussten.
Zusammenfassung von Gils Antwort:
„Traditionelle Hidden Markov Models, kurz HMMs, prognostizieren Zeichenfolgen auf Basis von Wahrscheinlichkeiten. Deep Learning verbessert die Genauigkeit, indem vollständige Wortsequenzen berücksichtigt werden. Babel Street hat speziell für den Abgleich von Katakana mit lateinischer Schrift ein Deep-Learning-Modell entwickelt. Dieses bietet eine höhere Genauigkeit als eine einfache zeichenweise Transliteration und verbessert den Namensabgleich in japanischsprachigen Anwendungen erheblich.“
Zukünftige Weiterentwicklungen für das regulatorische Namensscreening
Frage 7: Welche Entwicklungen und Meilensteine sind für Match geplant und wie werden diese das regulatorische Namensscreening verbessern?
Zusammenfassung von Gils Antwort:
„Babel Street entwickelt sein Namensabgleichssystem kontinuierlich weiter und konzentriert sich dabei insbesondere auf folgende Bereiche:
- Geschwindigkeitsoptimierung: Einsatz GPU-beschleunigter Verarbeitung für nahezu sofortige Ergebnisse.
- Erweiterung der Sprachunterstützung: Das System unterstützt derzeit mehr als 25 Sprachen; weitere sollen hinzukommen.
- Dynamische Modelle zur Namenshäufigkeit: Anpassung an neue Namensmuster, die durch Migration und Globalisierung entstehen.
- Anpassbare Modelle: Nutzer können die Modelle anhand spezifischer regionaler Daten individuell konfigurieren und optimieren.
Diese Weiterentwicklungen ermöglichen ein schnelleres und präziseres regulat.
To watch the full interview click here.
Read our previous blog article: The Challenges of Name Screening for Chinese and Non-Latin Scripts (and How to Solve Them).


