Personenbezogene Daten erkennen: Regex, NLP und hybride Verfahren
Wenn Sie die Erkennungsverfahren verstehen, können Sie für Ihren Anwendungsfall das passende Verhältnis von Präzision, Erfassungsgrad und Geschwindigkeit wählen.
Die Verfahren im Überblick
Jedes System zur Erkennung personenbezogener Daten nutzt eines von drei grundlegenden Verfahren oder kombiniert sie. Jedes hat eigene Stärken, Grenzen und geeignete Einsatzbereiche.
Regex und Musterabgleich
Feste Regeln gleichen bekannte Datenformate ab. Eine Kartennummer besteht die Luhn-Prüfung oder besteht sie nicht. Dieselbe Eingabe führt daher immer zum selben Ergebnis, ohne maschinelles Lernen.
- IBANs, Kreditkartennummern, US-Sozialversicherungsnummern
- E-Mail-Adressen, Telefonnummern
- IP-Adressen, Passnummern
- Schnell und wiederholbar
NLP und Erkennung benannter Entitäten
Modelle des maschinellen Lernens erfassen den sprachlichen Zusammenhang: spaCy als frei verfügbare Bibliothek für Sprachverarbeitung, Stanza als Werkzeug der Stanford University und XLM-RoBERTa als sprachenübergreifendes Transformer-Modell. Sie erkennen Angaben ohne festes Format.
- Personennamen, Organisationen
- Orte und Datumsangaben im Zusammenhang
- Unterscheidung anhand des Zusammenhangs
- Verarbeitet unstrukturierte Texte
Hybrid
Dieses Verfahren verbindet beide Erkennungsmaschinen mit einer Analyse des Zusammenhangs und einer Prüfsummenprüfung. Beides passt die Zuverlässigkeitswerte an. Eine Erkennungsgenauigkeit oder Rate falscher Treffer wird nicht veröffentlicht, da keine Vergleichsmessung vorliegt.
- Führt Ergebnisse aus NLP und Musterabgleich zusammen
- Löst Konflikte anhand von Zuverlässigkeitswerten
- Prüfsummenprüfung beseitigt falsche Treffer
- Am besten geeignet für produktiv genutzte Systeme
So arbeiten die Verfahren
Die Verfahren unterscheiden sich nicht nur in der Genauigkeit. Sie können unterschiedliche Arten personenbezogener Daten erkennen und gehen verschieden mit mehrdeutigen Angaben um.
Erkennung mit Regex
Regex steht für reguläre Ausdrücke. Von Hand erstellte Muster gleichen bekannte Datenformate Zeichen für Zeichen ab. Das Verfahren ist vollständig regelgebunden: Dieselbe Eingabe ergibt immer dieselbe Ausgabe. Die Verarbeitungszeit wird in Mikrosekunden gemessen. Damit ist es das schnellste verfügbare Erkennungsverfahren.
Die Grenze ist grundsätzlicher Natur: Regex erkennt nur personenbezogene Daten mit vorhersehbarem Format. Seine Stärke liegt bei IBANs, Kreditkartennummern, US-Sozialversicherungsnummern, E-Mail-Adressen und Telefonnummern. Personennamen kann es nicht erkennen, weil sie keinem festen Muster folgen.
- 100 % regelgebunden und bei jedem Durchlauf gleich
- Keine Modelldownloads oder Infrastruktur für maschinelles Lernen nötig
- Auf bekannte, strukturierte Formate begrenzt
/[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}/
/[A-Z]{2}\d{2}[\s]?[\dA-Z]{4}[\s]?(?:[\dA-Z]{4}[\s]?){2,7}[\dA-Z]{1,4}/
/\b(?:\d[\s-]*?){13,19}\b/
Erkennung mit NLP
NLP steht für die Verarbeitung natürlicher Sprache. Trainierte statistische Modelle erkennen die Grenzen benannter Angaben im Zusammenhang. Statt Zeichenmuster abzugleichen, berücksichtigen sie die umgebenden Wörter. So bestimmen sie, ob eine Textstelle eine Person, Organisation, einen Ort oder ein Datum bezeichnet.
Im Satz „Dr. Smith called John yesterday“ erkennt das Modell „Smith“ und „John“ anhand des Zusammenhangs als Personen. Es braucht dafür kein festes Namensmuster. Deshalb ist NLP für personenbezogene Daten ohne festes Format unverzichtbar.
- Berücksichtigt den umgebenden Text
- Unterscheidet mehrdeutige Angaben wie „Jordan“ als Person oder Staat
- Mehrsprachig: spaCy, Stanza und Transformer-Modelle für 48 Sprachen bei anonym.legal
- Benötigt einen Modelldownload und Zeit für die Auswertung
Die erkannte Sprache bestimmt automatisch die Erkennungsmaschine. Es gibt keine Überschneidung: Jede Sprache ist genau einer NLP-Erkennungsmaschine zugeordnet.
Hybride Erkennung
Bei der hybriden Erkennung laufen Regex und NLP in einem Durchgang. Anschließend werden ihre Ergebnisse anhand von Zuverlässigkeitswerten und dem sprachlichen Zusammenhang zusammengeführt. Erkennen beide dieselbe Textstelle, wählt das Verfahren durch Bewertung der Zuverlässigkeitswerte und Auflösung des Konflikts das genaueste Ergebnis aus.
Prüfsummen für strukturierte Daten filtern falsche Treffer, die ein reiner Musterabgleich liefern könnte: Luhn bei Kreditkartennummern und MOD-97 bei IBANs. Der NLP-Zusammenhang klärt mehrdeutige Funde. Eine Erkennungsgenauigkeit oder Rate falscher Treffer wird nicht veröffentlicht, da keine Vergleichsmessung vorliegt.
- Führt beide Erkennungsmaschinen gleichzeitig aus
- Führt überlappende Funde anhand von Zuverlässigkeitswerten zusammen
- Verringert falsche Treffer bei strukturierten Daten durch Prüfsummen
- Ermöglicht über Zuverlässigkeitswerte die Abstimmung von Präzision und Erfassungsgrad
Vergleich der Verfahren
Jedes Verfahren hat andere Stärken. Regex ist bei strukturierten Daten stark, NLP bei Angaben, die vom Zusammenhang abhängen. Das hybride Verfahren verbindet beides und erreicht so den größten Erfassungsbereich.
| Eigenschaft | Nur Regex | Nur NLP | Hybrid |
|---|---|---|---|
| Strukturierte Daten | Durch Prüfsumme bestätigt | Nicht anwendbar | Durch Prüfsumme bestätigt |
| Erkennung von Namen | Sehr begrenzt | Stark, berücksichtigt den Zusammenhang | Stark, berücksichtigt den Zusammenhang |
| Geschwindigkeit | Am schnellsten | Mittel | Mittel |
| Falsche Treffer | Niedrig (Prüfsummenprüfung) | Mittel | Am niedrigsten |
| Unterstützte Sprachen | Abhängig vom Muster | 48 Sprachen | 48 Sprachen |
| Aufwand für die Einrichtung | Einfach | Modell erforderlich | Verwaltet |
| Berücksichtigung des Zusammenhangs | Keine | Hoch | Am höchsten |
Warum NLP für Namen unverzichtbar ist
Regex kann Namen nicht wirksam erkennen, weil sie kein festes Format haben. Es kann Anreden wie „Mr.“ oder „Dr.“ finden. Ohne den umgebenden Text kann es aber „Jordan“ nicht als Person oder Staat einordnen und „Smith“ nicht als Nachnamen erkennen. Genau hier liegt die Stärke von NLP.
Wo welches Verfahren seine Stärken hat
Unterschiedliche Dokumente brauchen unterschiedliche Erkennungsverfahren. Die folgenden Beispiele zeigen, warum die hybride Erkennung einem einzelnen Verfahren durchgehend überlegen ist.
Medizinische Unterlagen
Medizinische Dokumente enthalten Patientennamen, die NLP benötigen, und Aktennummern, die Regex benötigen. Hinzu kommen Diagnosen mit Datumsangaben, deren Bedeutung vom Zusammenhang abhängt. Keines der beiden Verfahren allein deckt alles ab.
Aktennummer: [MRN] ← Regex
Hybrid ist im Vorteil — erkennt beides
Finanzdokumente
Regex erkennt IBANs und Kreditkartennummern mit Prüfsummenprüfung einwandfrei. Für Namen von Kontoinhabern, Felder für Begünstigte und Buchungsbeschreibungen ist dagegen NLP nötig.
Begünstigte Person: [NAME] ← NLP
Hybrid ist im Vorteil — prüft und erkennt
Rechtsverträge
Namen der Vertragsparteien, Anschriften, Geburtsdaten und Unterschriften von Zeugen hängen stark vom Zusammenhang ab. Regex findet Steuerkennungen mit festem Format. Für die meisten personenbezogenen Daten in Verträgen ist jedoch NLP erforderlich.
Unterzeichnende Person: [NAME] ← NLP
NLP ist unverzichtbar — der Zusammenhang zählt
Protokolldateien
Serverprotokolle enthalten IP-Adressen, E-Mail-Adressen und URLs, die Regex einwandfrei verarbeitet. Zeichenfolgen zur Beschreibung des verwendeten Programms und Fehlermeldungen können jedoch Nutzernamen oder Dateipfade mit personenbezogenen Daten enthalten.
Nutzerpfad: /home/[NAME]/ ← NLP
Hybrid erkennt beides
Zwei Produkte, zwei Erkennungsmaschinen
Es gibt kein gemeinsames System: anonym.legal arbeitet gehostet und anonym.plus lokal. Jedes Produkt betreibt seine eigene Erkennungsmaschine unabhängig vom anderen. Beide verbinden Mustererkenner, NLP-Modelle und Zuverlässigkeitswerte.
anonym.plus: lokale Mustererkennung
317 eigene Mustererkenner laufen auf dem Rechner des Kunden; die Erkennung stellt keinen Netzaufruf. Jedes Muster enthält eine Formatprüfung. Viele prüfen zusätzlich Prüfsummen, etwa mit Luhn oder MOD-97, oder wenden Formatregeln an.
- 317 eigene Mustererkenner
- Läuft lokal; die Erkennung stellt keinen Netzaufruf
- Prüfsummenprüfung eingebaut
- Länderspezifische Formatregeln
anonym.legal: gehostete NLP-Erkennung
267 Arten personenbezogener Daten in 48 Sprachen werden auf unseren Servern in Deutschland verarbeitet. Die Sprache bestimmt das NLP-Modell: spaCy für die meisten Sprachen, Stanza oder Transformer-Modelle für die übrigen.
- 267 Arten personenbezogener Daten
- 48 Sprachen
- spaCy, Stanza und Transformer-Modelle
- Modellauswahl nach Sprache
In beiden: Zuverlässigkeitswerte und Prüfung
Diese Ebene führt Ergebnisse zusammen und prüft sie. Sie löst Konflikte, wenn beide Erkennungsmaschinen dieselbe Textstelle finden, prüft strukturierte Funde mit Prüfsummen und vergibt Zuverlässigkeitswerte von 0,0 bis 1,0.
- Klärt Konflikte bei überlappenden Textstellen
- Prüfsummenprüfung mit Luhn und MOD-97
- Zuverlässigkeitswerte von 0,0 bis 1,0
- Sprachspezifische Verringerung von Fehlern
Regelgebunden, nicht KI-basiert
Unsere Erkennungskette verwendet NLP-Modelle und Regex-Muster. Sie verwendet keine großen Sprachmodelle und ist nicht von externen KI-Schnittstellen abhängig.
Auswirkung im Betrieb
Prüfsummen und die Erkennung anhand des Zusammenhangs passen die Zuverlässigkeitswerte an und filtern einige falsche Treffer heraus. Wir veröffentlichen weder Zahlen zur Erkennungsgenauigkeit oder zu falschen Treffern noch einen Vergleich mit der Ausgangsversion von Microsoft Presidio, dem frei verfügbaren Rahmenwerk zur Erkennung personenbezogener Daten, auf dem unsere Erkennungsmaschinen aufbauen. Dafür liegt keine Vergleichsmessung vor.
Gilt das für Ihre Organisation?
Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.
Erkennungsverfahren selbst ausprobieren
Sehen Sie anhand von Datensätzen aus der Praxis, wie Regex, NLP und die hybride Erkennung arbeiten:
Auf Servern in Deutschland — anonym.legal
Unsere Server stehen in Deutschland. 267 Arten personenbezogener Daten, 48 Sprachen. Kostenloser Tarif, danach ab 3 € im Monat.
anonym.legal öffnen ↗Auf Ihrem Rechner — anonym.plus
Ein lokal arbeitendes Desktop-Programm. Der Text verlässt den Rechner nie. 317 eigene Mustererkenner. Kostenlos für einen Rechner, danach eine einmalig bezahlte Lizenz ab 149 €.
anonym.plus öffnen ↗