Genauigkeit von Grund auf
Unsere Erkennung verbindet regelgebundene Musterprüfung mit Modellen für natürliche Sprache. So erreicht sie eine hohe Genauigkeit bei strukturierten und unstrukturierten Daten. Jede Erkennung erhält einen Wert für ihre Zuverlässigkeit, damit Sie das Ergebnis prüfen können.
Regelgebundene Erkennung
In der Erkennung kommen keine großen Sprachmodelle zum Einsatz. Jede Regel ist eindeutig festgelegt. Ein erneuter Lauf mit derselben Version der Erkennungssoftware, denselben Modellen und derselben Konfiguration soll daher dasselbe Ergebnis liefern. Ein Langzeittest hat das noch nicht bestätigt.
Zuerst Muster prüfen
Regelgebundene Erkenner mit regulären Ausdrücken verarbeiten strukturierte Daten: Kreditkarten mit Luhn-Prüfung, IBANs mit MOD-97-Prüfsumme, Steuerkennungen, Passnummern und weitere Formate. Prüfsummenprüfung heißt: Eine Kartennummer erfüllt die Luhn-Regel oder nicht. Das ist eine Berechnung, keine Schätzung.
Sprachverarbeitung für kontextabhängige Daten
Namen, Organisationen und Orte lassen sich nur mit ihrem Zusammenhang einordnen. Für die Namenserkennung nutzt anonym.legal drei Arten von Modellen zur Verarbeitung natürlicher Sprache (NLP): spaCy, eine quelloffene NLP-Bibliothek für 24 Sprachen, Stanza, ein NLP-Werkzeug der Stanford University für 7 Sprachen, und 11 spezialisierte HuggingFace-Modelle zur Erkennung benannter Entitäten. In den übrigen 6 der 48 Sprachen arbeiten ausschließlich Mustererkenner, ohne Namenserkennung. Die Genauigkeit hängt von Sprache und Datenart ab. Die Erkennung englischer Texte ist am weitesten entwickelt.
Zuverlässigkeitsbewertung
Jede Erkennung erhält einen Zuverlässigkeitswert von 0,0 bis 1,0. Ein hoher Wert (0,85–1,0) zeigt eine starke Übereinstimmung mit dem Format und einen stützenden Zusammenhang an. Ein mittlerer Wert (0,5–0,85) kennzeichnet wahrscheinlich richtige Treffer zur Überprüfung.
Erkennungsqualität nach Datenart
Die Genauigkeit hängt von der Datenart ab. Strukturierte Formate mit Prüfsummenprüfung erreichen eine sehr hohe Genauigkeit. Bei kontextabhängigen Angaben wie Namen unterscheidet sie sich je nach Sprache.
| Datenkategorie | Erkennungsverfahren | Merkmal der Genauigkeit | Beispiele |
|---|---|---|---|
| Strukturierte Daten mit Prüfsumme | Regulärer Ausdruck + Prüfsummenprüfung | Durch Prüfsumme bestätigt | Kreditkarten (Luhn), IBANs (MOD-97) |
| Strukturierte Daten ohne Prüfsumme | Regulärer Ausdruck + Wörter im Zusammenhang | Hoch | US-Sozialversicherungsnummern (Format- und Bereichsregeln), Steuerkennungen, Telefonnummern, Postleitzahlen, IP-Adressen, Datumsangaben |
| Namen und Organisationen | NLP (spaCy/Stanza/HuggingFace) | Je nach Sprache unterschiedlich | Personennamen, Unternehmensnamen, Orte |
| Dokumente mit gemischten Daten | Kombination aus regulären Ausdrücken und NLP | Größte Gesamtabdeckung | Verträge, E-Mails, Krankenakten |
Hinweis: Strukturierte Daten mit Prüfsummenprüfung, etwa Kreditkarten und IBANs, erreichen die höchste Genauigkeit. Ihre Format- und Prüfsummenregeln sind eindeutig festgelegt. Bei Angaben, die NLP erkennt, etwa Namen und Orten, hängt die Genauigkeit von Sprache und Zusammenhang ab. Die Erkennung englischer Texte ist am weitesten entwickelt.
Drei NLP-Systeme mit automatischer Auswahl
Jedes NLP-System deckt bestimmte Sprachen ab. Anhand der erkannten Sprache wählt das System automatisch das passende aus. Die Bereiche überschneiden sich nicht: Jede Sprache gehört genau zu einem System. Für 6 Sprachen gibt es kein Modell zur Namenserkennung; dort arbeiten nur Mustererkenner.
spaCy (vorrangig)
spaCy ist eine quelloffene NLP-Bibliothek. Für die Hälfte der unterstützten Sprachen ist es das vorrangige System. Trainierte Modelle erkennen benannte Entitäten mit hoher Beständigkeit.
- 24 Sprachen
- 24 abgedeckte Sprachen
- Am besten geeignet für: Namen, Organisationen, Orte
- Schnellste Verarbeitung
Stanza (ergänzend)
Stanza ist ein NLP-Werkzeug der Stanford University. Es dient als ergänzendes System für Sprachen, für die keine spaCy-Modelle verfügbar sind. Seine Genauigkeit entspricht dem Forschungsniveau.
- 7 Sprachen
- 7 abgedeckte Sprachen
- Am besten geeignet für: Sprachen ohne spaCy-Abdeckung
- Forschungsmodelle der Stanford University
HuggingFace-Modelle zur Erkennung benannter Entitäten
Spezialisierte HuggingFace-Modelle erkennen benannte Entitäten in Sprachen ohne geeignetes spaCy- oder Stanza-Modell. Dazu gehören Tschechisch, Persisch, Arabisch und Thailändisch.
- 11 Sprachen
- 11 abgedeckte Sprachen
- Am besten geeignet für: Sprachen ohne spaCy- oder Stanza-Modell
- Weitere 6 Sprachen: nur Muster, keine Namenserkennung
Wir veröffentlichen keinen Prozentwert für die Erkennungsgenauigkeit. Die früher hier gezeigten Werte für einzelne Systeme stammten aus der Dokumentation fremder Modelle; wir können diese Messungen nicht wiederholen. Eine Zahl, die Sie nicht nachvollziehen können, sollten Sie keinem Anbieter abnehmen. Die Erkennung strukturierter Daten durch reguläre Ausdrücke, etwa bei E-Mail-Adressen, US-Sozialversicherungsnummern, Kreditkarten und IBANs, arbeitet unabhängig von NLP-Systemen und liefert zu 100 % wiederholbare Ergebnisse.
Vergleich mit anderen Lösungen
Dieser Funktionsvergleich mit verbreiteten Lösungen zur Erkennung personenbezogener Daten beruht auf öffentlich zugänglicher Dokumentation.
| Funktion | anonymize.solutions | Presidio zum Selbstbetrieb | Google DLP | Strac | Nightfall |
|---|---|---|---|---|---|
| Arten personenbezogener Daten | 267 | Integrierte Auswahl, erweiterbar | Siehe Anbieterdokumentation | Siehe Anbieterdokumentation | Siehe Anbieterdokumentation |
| Unterstützung mehrerer Sprachen | 48 Sprachen | Hängt von der Einrichtung ab | Etwa 50 Sprachen | Begrenzt | Etwa 25 Sprachen |
| Erkennungsverfahren | Reguläre Ausdrücke + NLP (regelgebunden) | Reguläre Ausdrücke + NLP | Maschinelles Lernen | Maschinelles Lernen | Maschinelles Lernen |
| Umgang mit falschen Treffern | Prüfsumme + Zuverlässigkeitsbewertung | Manuelle Anpassung | Wahrscheinlichkeitsstufen | Schwellenwerte für Zuverlässigkeit | Zuverlässigkeitswerte |
| Datenspeicherung in der EU | 100 % EU | Betrieb auf eigenen Servern | Siehe Anbieterdokumentation | Siehe Anbieterdokumentation | Siehe Anbieterdokumentation |
| Betreuter Dienst | Ja (auf Servern in Deutschland: anonym.legal) · lokales Programm: anonym.plus | Nein (Selbstbetrieb) | Ja | Ja | Ja |
Hinweis: Die Angaben zu Mitbewerbern beruhen auf öffentlich zugänglicher Dokumentation aus dem 1. Quartal 2026. Die Zahlen zu Datenarten und unterstützten Sprachen sind Näherungswerte und können sich ändern. Einzelheiten finden Sie auf den jeweiligen Vergleichsseiten.
Zuverlässigkeitsbewertung und Prüfung des Zusammenhangs
Falsche Treffer mindern das Vertrauen. Ein System, das „IBAN: DE89370400440532013000“ markiert, aber auch „Dezember 2025“ für eine Kreditkarte hält, ist schlechter als gar kein System. Eine mehrstufige Prüfung verringert solche Meldungen.
Prüfsummenprüfung
IBANs werden mit MOD-97 geprüft, Kreditkarten mit dem Luhn-Verfahren und US-Sozialversicherungsnummern anhand von Formatregeln und bekannten ungültigen Nummernbereichen. Eine Ziffernfolge, die wie eine Kreditkartennummer aussieht, aber die Luhn-Prüfung nicht besteht, wird vor der Ausgabe verworfen.
Zuverlässigkeitsbewertung (0,0–1,0)
Jede Erkennung erhält einen Zuverlässigkeitswert. Hoch (0,85–1,0): starke Übereinstimmung mit dem Format und stützender Zusammenhang. Mittel (0,5–0,85): wahrscheinlich richtig; Überprüfung empfohlen. Niedrig (0,3–0,5): allgemeines Muster; manuelle Überprüfung. Einstellbare Schwellenwerte erlauben Ihnen, das Verhältnis zwischen Genauigkeit der Treffer und Vollständigkeit der Erkennung anzupassen.
Mehrdeutigkeit anhand des Zusammenhangs auflösen
Das NLP-System berücksichtigt die umgebenden Wörter. „Jordan“ nach „Michael“ bezeichnet eine Person; „Jordan“ nach „flew to“ einen Ort. Der Zusammenhang löst Mehrdeutigkeiten auf, die Systeme mit ausschließlich musterbasierter Erkennung nicht klären können.
Sprachspezifische Verarbeitung
Jede Sprache hat eigene Muster, die die Erkennungsqualität beeinflussen. Dazu zählen deutsche zusammengesetzte Wörter, arabische Namensmuster und japanische Höflichkeitsformen. Spezialisierte NLP-Modelle bearbeiten diese sprachlichen Besonderheiten: spaCy für 24 Sprachen, Stanza für 7 und eigene HuggingFace-Modelle für 11; in 6 Sprachen kommen nur Muster zum Einsatz. Die automatische Spracherkennung wählt das passende System. Falls sie keine Sprache zuordnen kann, verwendet sie Englisch.
Auf Microsoft Presidio aufgebaut
Die Erkennung von anonym.legal basiert auf Microsoft Presidio, einem quelloffenen, unter der MIT-Lizenz veröffentlichten Rahmenwerk zur Erkennung personenbezogener Daten. Sie erweitert Presidio um zusätzliche Erkenner und NLP-Systeme und läuft bei Hetzner in Falkenstein, Deutschland. Die 317 eigenen Mustererkenner gehören zu anonym.plus. Dieses Programm läuft auf Ihrem Rechner.
Gilt das für Ihre Organisation?
Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.