Die Verfahren im Überblick

Jedes System zur Erkennung personenbezogener Daten nutzt eines von drei grundlegenden Verfahren oder kombiniert sie. Jedes hat eigene Stärken, Grenzen und geeignete Einsatzbereiche.

Regex und Musterabgleich

Feste Regeln gleichen bekannte Datenformate ab. Eine Kartennummer besteht die Luhn-Prüfung oder besteht sie nicht. Dieselbe Eingabe führt daher immer zum selben Ergebnis, ohne maschinelles Lernen.

  • IBANs, Kreditkartennummern, US-Sozialversicherungsnummern
  • E-Mail-Adressen, Telefonnummern
  • IP-Adressen, Passnummern
  • Schnell und wiederholbar

NLP und Erkennung benannter Entitäten

Modelle des maschinellen Lernens erfassen den sprachlichen Zusammenhang: spaCy als frei verfügbare Bibliothek für Sprachverarbeitung, Stanza als Werkzeug der Stanford University und XLM-RoBERTa als sprachenübergreifendes Transformer-Modell. Sie erkennen Angaben ohne festes Format.

  • Personennamen, Organisationen
  • Orte und Datumsangaben im Zusammenhang
  • Unterscheidung anhand des Zusammenhangs
  • Verarbeitet unstrukturierte Texte

Hybrid

Dieses Verfahren verbindet beide Erkennungsmaschinen mit einer Analyse des Zusammenhangs und einer Prüfsummenprüfung. Beides passt die Zuverlässigkeitswerte an. Eine Erkennungsgenauigkeit oder Rate falscher Treffer wird nicht veröffentlicht, da keine Vergleichsmessung vorliegt.

  • Führt Ergebnisse aus NLP und Musterabgleich zusammen
  • Löst Konflikte anhand von Zuverlässigkeitswerten
  • Prüfsummenprüfung beseitigt falsche Treffer
  • Am besten geeignet für produktiv genutzte Systeme

So arbeiten die Verfahren

Die Verfahren unterscheiden sich nicht nur in der Genauigkeit. Sie können unterschiedliche Arten personenbezogener Daten erkennen und gehen verschieden mit mehrdeutigen Angaben um.

Erkennung mit Regex

Regex steht für reguläre Ausdrücke. Von Hand erstellte Muster gleichen bekannte Datenformate Zeichen für Zeichen ab. Das Verfahren ist vollständig regelgebunden: Dieselbe Eingabe ergibt immer dieselbe Ausgabe. Die Verarbeitungszeit wird in Mikrosekunden gemessen. Damit ist es das schnellste verfügbare Erkennungsverfahren.

Die Grenze ist grundsätzlicher Natur: Regex erkennt nur personenbezogene Daten mit vorhersehbarem Format. Seine Stärke liegt bei IBANs, Kreditkartennummern, US-Sozialversicherungsnummern, E-Mail-Adressen und Telefonnummern. Personennamen kann es nicht erkennen, weil sie keinem festen Muster folgen.

  • 100 % regelgebunden und bei jedem Durchlauf gleich
  • Keine Modelldownloads oder Infrastruktur für maschinelles Lernen nötig
  • Auf bekannte, strukturierte Formate begrenzt
MUSTER FÜR E-MAIL-ADRESSEN
/[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}/
MUSTER FÜR IBANS
/[A-Z]{2}\d{2}[\s]?[\dA-Z]{4}[\s]?(?:[\dA-Z]{4}[\s]?){2,7}[\dA-Z]{1,4}/
MUSTER FÜR KREDITKARTENNUMMERN (MIT LUHN-PRÜFUNG)
/\b(?:\d[\s-]*?){13,19}\b/
+ anschließende Prüfung der Luhn-Prüfsumme

Erkennung mit NLP

NLP steht für die Verarbeitung natürlicher Sprache. Trainierte statistische Modelle erkennen die Grenzen benannter Angaben im Zusammenhang. Statt Zeichenmuster abzugleichen, berücksichtigen sie die umgebenden Wörter. So bestimmen sie, ob eine Textstelle eine Person, Organisation, einen Ort oder ein Datum bezeichnet.

Im Satz „Dr. Smith called John yesterday“ erkennt das Modell „Smith“ und „John“ anhand des Zusammenhangs als Personen. Es braucht dafür kein festes Namensmuster. Deshalb ist NLP für personenbezogene Daten ohne festes Format unverzichtbar.

  • Berücksichtigt den umgebenden Text
  • Unterscheidet mehrdeutige Angaben wie „Jordan“ als Person oder Staat
  • Mehrsprachig: spaCy, Stanza und Transformer-Modelle für 48 Sprachen bei anonym.legal
  • Benötigt einen Modelldownload und Zeit für die Auswertung
AUSWAHL DER NLP-ERKENNUNGSMASCHINE
spaCy
VORRANGIG — 25 Sprachen, schnellste Auswertung
Stanza
ERGÄNZEND — 7 Sprachen, die spaCy nicht abdeckt
XLM-R
ERSATZWEG — 16 weitere Sprachen über ein Transformer-Modell

Die erkannte Sprache bestimmt automatisch die Erkennungsmaschine. Es gibt keine Überschneidung: Jede Sprache ist genau einer NLP-Erkennungsmaschine zugeordnet.

Hybride Erkennung

Bei der hybriden Erkennung laufen Regex und NLP in einem Durchgang. Anschließend werden ihre Ergebnisse anhand von Zuverlässigkeitswerten und dem sprachlichen Zusammenhang zusammengeführt. Erkennen beide dieselbe Textstelle, wählt das Verfahren durch Bewertung der Zuverlässigkeitswerte und Auflösung des Konflikts das genaueste Ergebnis aus.

Prüfsummen für strukturierte Daten filtern falsche Treffer, die ein reiner Musterabgleich liefern könnte: Luhn bei Kreditkartennummern und MOD-97 bei IBANs. Der NLP-Zusammenhang klärt mehrdeutige Funde. Eine Erkennungsgenauigkeit oder Rate falscher Treffer wird nicht veröffentlicht, da keine Vergleichsmessung vorliegt.

  • Führt beide Erkennungsmaschinen gleichzeitig aus
  • Führt überlappende Funde anhand von Zuverlässigkeitswerten zusammen
  • Verringert falsche Treffer bei strukturierten Daten durch Prüfsummen
  • Ermöglicht über Zuverlässigkeitswerte die Abstimmung von Präzision und Erfassungsgrad
ABLAUF DER HYBRIDEN ZUSAMMENFÜHRUNG
1
Mustererkenner ausführen: Regex und Prüfsummen
2
NLP-Erkennungsmaschine ausführen, automatisch nach Sprache gewählt
3
Ergebnisse zusammenführen und überlappende Textstellen klären
4
Prüfsummen prüfen: Luhn, MOD-97 und Formatregeln
5
Zuverlässigkeitswerte anwenden und erkannte Angaben ausgeben

Vergleich der Verfahren

Jedes Verfahren hat andere Stärken. Regex ist bei strukturierten Daten stark, NLP bei Angaben, die vom Zusammenhang abhängen. Das hybride Verfahren verbindet beides und erreicht so den größten Erfassungsbereich.

Eigenschaft Nur Regex Nur NLP Hybrid
Strukturierte Daten Durch Prüfsumme bestätigt Nicht anwendbar Durch Prüfsumme bestätigt
Erkennung von Namen Sehr begrenzt Stark, berücksichtigt den Zusammenhang Stark, berücksichtigt den Zusammenhang
Geschwindigkeit Am schnellsten Mittel Mittel
Falsche Treffer Niedrig (Prüfsummenprüfung) Mittel Am niedrigsten
Unterstützte Sprachen Abhängig vom Muster 48 Sprachen 48 Sprachen
Aufwand für die Einrichtung Einfach Modell erforderlich Verwaltet
Berücksichtigung des Zusammenhangs Keine Hoch Am höchsten

Warum NLP für Namen unverzichtbar ist

Regex kann Namen nicht wirksam erkennen, weil sie kein festes Format haben. Es kann Anreden wie „Mr.“ oder „Dr.“ finden. Ohne den umgebenden Text kann es aber „Jordan“ nicht als Person oder Staat einordnen und „Smith“ nicht als Nachnamen erkennen. Genau hier liegt die Stärke von NLP.

Wo welches Verfahren seine Stärken hat

Unterschiedliche Dokumente brauchen unterschiedliche Erkennungsverfahren. Die folgenden Beispiele zeigen, warum die hybride Erkennung einem einzelnen Verfahren durchgehend überlegen ist.

Medizinische Unterlagen

Medizinische Dokumente enthalten Patientennamen, die NLP benötigen, und Aktennummern, die Regex benötigen. Hinzu kommen Diagnosen mit Datumsangaben, deren Bedeutung vom Zusammenhang abhängt. Keines der beiden Verfahren allein deckt alles ab.

Patient: [NAME] ← NLP
Aktennummer: [MRN] ← Regex
Hybrid ist im Vorteil — erkennt beides

Finanzdokumente

Regex erkennt IBANs und Kreditkartennummern mit Prüfsummenprüfung einwandfrei. Für Namen von Kontoinhabern, Felder für Begünstigte und Buchungsbeschreibungen ist dagegen NLP nötig.

IBAN: [IBAN] ← Regex + MOD-97
Begünstigte Person: [NAME] ← NLP
Hybrid ist im Vorteil — prüft und erkennt

Namen der Vertragsparteien, Anschriften, Geburtsdaten und Unterschriften von Zeugen hängen stark vom Zusammenhang ab. Regex findet Steuerkennungen mit festem Format. Für die meisten personenbezogenen Daten in Verträgen ist jedoch NLP erforderlich.

Vertragspartei: [ORG] ← NLP
Unterzeichnende Person: [NAME] ← NLP
NLP ist unverzichtbar — der Zusammenhang zählt

Protokolldateien

Serverprotokolle enthalten IP-Adressen, E-Mail-Adressen und URLs, die Regex einwandfrei verarbeitet. Zeichenfolgen zur Beschreibung des verwendeten Programms und Fehlermeldungen können jedoch Nutzernamen oder Dateipfade mit personenbezogenen Daten enthalten.

IP: [IP] ← Regex
Nutzerpfad: /home/[NAME]/ ← NLP
Hybrid erkennt beides

Zwei Produkte, zwei Erkennungsmaschinen

Es gibt kein gemeinsames System: anonym.legal arbeitet gehostet und anonym.plus lokal. Jedes Produkt betreibt seine eigene Erkennungsmaschine unabhängig vom anderen. Beide verbinden Mustererkenner, NLP-Modelle und Zuverlässigkeitswerte.

anonym.plus: lokale Mustererkennung

317 eigene Mustererkenner laufen auf dem Rechner des Kunden; die Erkennung stellt keinen Netzaufruf. Jedes Muster enthält eine Formatprüfung. Viele prüfen zusätzlich Prüfsummen, etwa mit Luhn oder MOD-97, oder wenden Formatregeln an.

  • 317 eigene Mustererkenner
  • Läuft lokal; die Erkennung stellt keinen Netzaufruf
  • Prüfsummenprüfung eingebaut
  • Länderspezifische Formatregeln

anonym.legal: gehostete NLP-Erkennung

267 Arten personenbezogener Daten in 48 Sprachen werden auf unseren Servern in Deutschland verarbeitet. Die Sprache bestimmt das NLP-Modell: spaCy für die meisten Sprachen, Stanza oder Transformer-Modelle für die übrigen.

  • 267 Arten personenbezogener Daten
  • 48 Sprachen
  • spaCy, Stanza und Transformer-Modelle
  • Modellauswahl nach Sprache

In beiden: Zuverlässigkeitswerte und Prüfung

Diese Ebene führt Ergebnisse zusammen und prüft sie. Sie löst Konflikte, wenn beide Erkennungsmaschinen dieselbe Textstelle finden, prüft strukturierte Funde mit Prüfsummen und vergibt Zuverlässigkeitswerte von 0,0 bis 1,0.

  • Klärt Konflikte bei überlappenden Textstellen
  • Prüfsummenprüfung mit Luhn und MOD-97
  • Zuverlässigkeitswerte von 0,0 bis 1,0
  • Sprachspezifische Verringerung von Fehlern

Regelgebunden, nicht KI-basiert

Unsere Erkennungskette verwendet NLP-Modelle und Regex-Muster. Sie verwendet keine großen Sprachmodelle und ist nicht von externen KI-Schnittstellen abhängig.

Auswirkung im Betrieb

Prüfsummen und die Erkennung anhand des Zusammenhangs passen die Zuverlässigkeitswerte an und filtern einige falsche Treffer heraus. Wir veröffentlichen weder Zahlen zur Erkennungsgenauigkeit oder zu falschen Treffern noch einen Vergleich mit der Ausgangsversion von Microsoft Presidio, dem frei verfügbaren Rahmenwerk zur Erkennung personenbezogener Daten, auf dem unsere Erkennungsmaschinen aufbauen. Dafür liegt keine Vergleichsmessung vor.

Gilt das für Ihre Organisation?

Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.

Erkennungsverfahren selbst ausprobieren

Sehen Sie anhand von Datensätzen aus der Praxis, wie Regex, NLP und die hybride Erkennung arbeiten:

Unsere Server stehen in Deutschland. 267 Arten personenbezogener Daten, 48 Sprachen. Kostenloser Tarif, danach ab 3 € im Monat.

anonym.legal öffnen ↗

Auf Ihrem Rechner — anonym.plus

Ein lokal arbeitendes Desktop-Programm. Der Text verlässt den Rechner nie. 317 eigene Mustererkenner. Kostenlos für einen Rechner, danach eine einmalig bezahlte Lizenz ab 149 €.

anonym.plus öffnen ↗
Beide Produkte vergleichen →