Offizielle Definition

“PII (Personally Identifiable Information) refers to any information that can be used to distinguish or trace an individual’s identity, either alone or when combined with other information that is linked or linkable to a specific individual.”

— NIST SP 800-122. Sinngemäß: PII sind alle Informationen, mit denen sich die Identität einer Person unterscheiden oder zurückverfolgen lässt, allein oder zusammen mit anderen Informationen, die einer bestimmten Person zugeordnet sind oder zugeordnet werden können.

Arten personenbezogener Daten

Nicht alle personenbezogenen Daten bergen dasselbe Risiko. Die drei Kategorien helfen Ihnen, für jede Datenart den passenden Schutz festzulegen.

Direkte Identifikatoren

Diese Daten können eine Person ohne weitere Informationen oder Abgleiche identifizieren.

  • Vollständiger Name
  • US-Sozialversicherungsnummer (SSN)
  • Reisepassnummer
  • Führerscheinnummer
  • Biometrische Daten (Fingerabdrücke, Gesichtsscans)

Quasi-Identifikatoren

Diese Daten identifizieren eine Person für sich genommen nicht. Zusammen mit anderen Quasi-Identifikatoren oder externen Datensätzen können sie das jedoch ermöglichen.

  • Geburtsdatum
  • Postleitzahl
  • Geschlecht
  • Berufsbezeichnung
  • Staatsangehörigkeit

Sensible personenbezogene Daten

Werden diese Daten offengelegt, können Diskriminierung, Schäden oder erhebliche Eingriffe in die Privatsphäre folgen. Deshalb benötigen sie stärkeren Schutz.

  • Krankenakten
  • Finanzdaten (Kreditkarten, Bankkonten)
  • Ethnische Herkunft
  • Politische Meinungen
  • Sexuelle Orientierung

Kategorien personenbezogener Daten auf einen Blick

Die Übersicht zeigt Kategorien personenbezogener Daten, typische Beispiele, das jeweilige Risiko und die wichtigsten geltenden Vorschriften.

Kategorie Beispiele Risiko Wichtige Vorschrift
Identität Name, SSN, Reisepassnummer Hoch Alle
Kontakt E-Mail-Adresse, Telefonnummer, Postanschrift Mittel DSGVO, CCPA
Finanzen Kreditkarte, IBAN, Steueridentifikationsnummer Kritisch PCI-DSS, DSGVO
Gesundheit Krankenakten, Verschreibungen Kritisch HIPAA, DSGVO
Digitale Kennungen IP-Adresse, Gerätekennung, Cookies Mittel DSGVO, ePrivacy
Biometrie Fingerabdrücke, Gesichtsscans, Stimmabdrücke Kritisch DSGVO Art. 9
Beschäftigung Personalnummer, Gehalt, Leistungsbeurteilungen Mittel DSGVO
Bildung Schüler- und Studierendenakten, Noten, Leistungsnachweise Mittel FERPA

Wie Gesetze personenbezogene Daten definieren

Eine weltweit einheitliche Definition personenbezogener Daten gibt es nicht. Die beiden wichtigsten Regelwerke, die Datenschutz-Grundverordnung (DSGVO) und das US-Recht, verfolgen grundlegend unterschiedliche Ansätze.

DSGVO — personenbezogene Daten (Art. 4 Nr. 1)

Die Datenschutz-Grundverordnung der EU verwendet die weltweit weiteste Definition im Datenschutzrecht.

  • Alle Informationen, die sich auf eine identifizierte oder identifizierbare natürliche Person beziehen
  • Einschließlich Online-Kennungen (IP-Adressen, Cookie-Kennungen, Geräte-Fingerabdrücke)
  • Pseudonymisierte Daten bleiben personenbezogene Daten
  • Nur vollständig anonymisierte Daten fallen aus dem Anwendungsbereich der DSGVO heraus
  • Besondere Kategorien (Art. 9): Gesundheitsdaten, biometrische Daten, ethnische Herkunft, politische Meinungen

US-Recht — Definitionen nach Bereich

In den USA gibt es kein einheitliches Datenschutzgesetz auf Bundesebene. Die Definition von PII hängt vom Bereich, Bundesstaat und der jeweiligen Vorschrift ab.

  • Keine einheitliche Definition von PII auf Bundesebene
  • CCPA (Kalifornien): weit gefasst — umfasst IP-Adressen und Browserverläufe
  • HIPAA (Gesundheit): geschützte Gesundheitsinformationen (PHI), 18 Arten von Identifikatoren
  • FERPA (Bildung): Bildungsakten von Schülern und Studierenden
  • Im Allgemeinen enger gefasst als die DSGVO — häufig müssen die Daten eine Person direkt identifizieren

Wo personenbezogene Daten verborgen sind

Personenbezogene Daten stehen selten nur in einer Datenbankspalte. Sie verteilen sich über Systeme, Dokumente und Arbeitsabläufe — oft an Stellen, an die Unternehmen bei einer Prüfung nie denken.

E-Mails und Nachrichten

Namen, Telefonnummern, Adressen und Kontodaten stehen in E-Mail-Verläufen, Slack-Nachrichten und Support-Anfragen. Sie werden oft ohne Schwärzung weitergeleitet und kopiert.

Dokumente und Tabellen

Verträge, Rechnungen, Personalakten und Excel-Exporte enthalten SSN, Gehälter, Gesundheitsinformationen und Kundendaten, die zwischen Abteilungen weitergegeben werden.

KI-Eingaben und Chatprotokolle

Nutzer fügen Kundendaten, Codeausschnitte mit Zugangsdaten und persönliche Angaben in ChatGPT, Claude und Copilot ein. Der jeweilige KI-Anbieter protokolliert all diese Eingaben.

Datenbankfelder

In Freitextspalten, Notizfeldern und unstrukturierten Daten von CRM-, ERP- und Ticketsystemen werden personenbezogene Daten ohne Prüfung oder Kennzeichnung eingetragen.

Protokolldateien und Analyse

Anwendungs- und Webserverprotokolle sowie Analyseplattformen erfassen IP-Adressen, Angaben zum verwendeten Programm, Sitzungskennungen und manchmal vollständige Anfragen mit personenbezogenen Daten.

Bilder und gescannte Dokumente

Gescannte Ausweise, Passfotos, medizinische Formulare und Bildschirmaufnahmen enthalten sichtbare personenbezogene Daten. Eine reine Textschwärzung erfasst sie nicht, weil sie als Bildpunkte und nicht als Zeichen vorliegen.

So schützen Sie personenbezogene Daten

Wirksamer Schutz personenbezogener Daten erfordert eine automatisierte Erkennung auch großer Datenmengen, mehrere Anonymisierungsmethoden und eine Architektur, die einzelne Ausfallpunkte beseitigt.

  • Automatisierte Erkennung personenbezogener Daten — 267 Arten personenbezogener Daten in 48 Sprachen. Sprachverarbeitung und Mustererkenner prüfen die Daten auch anhand von Prüfsummen. Eine manuelle Kennzeichnung ist nicht erforderlich.
  • Mehrere Anonymisierungsmethoden — Ersetzen Sie Daten durch einen festen Platzhalter, entfernen Sie sie vollständig, maskieren Sie sie teilweise, bilden Sie für einheitliche Zuordnungen einen Hashwert oder verschlüsseln Sie sie für einen umkehrbaren Schutz. Wählen Sie die Methode je Datenart.
  • Schutz bei der KI-Nutzung — Ein MCP-Server bindet Entwicklungsumgebungen ein, eine Chrome-Erweiterung schützt Chats mit KI-Plattformen und eine REST-API unterstützt automatisierte Abläufe. Anonymisieren Sie Daten, bevor sie irgendein großes Sprachmodell erreichen.
  • Voreingestellte Regeln für Rechtsvorschriften — Vorkonfigurierte Erkennungsprofile richten sich nach gesetzlichen Anforderungen, etwa der DSGVO. Wählen Sie ein Profil; das System prüft dann automatisch die entsprechenden Datenarten.
  • Auf Ihrem Gerät abgeleitete Schlüssel — Ihre Daten werden übermittelt, anonymisiert und zurückgegeben. Die Verschlüsselungsschlüssel werden mit Argon2id auf Ihrem Gerät abgeleitet. Der Erkennungsdienst muss den Text lesen, den er analysiert. Wo er überhaupt nicht gelesen werden darf, hält das lokal arbeitende Desktop-Programm ihn auf Ihrem eigenen Rechner.

Regelgebunden, nicht KI-basiert

Wir erkennen personenbezogene Daten mit Sprachverarbeitung und Mustererkennung — nicht mit großen Sprachmodellen.

100 % Infrastruktur in der EU

Die gesamte Verarbeitung erfolgt auf Infrastruktur von Hetzner in Deutschland. Keine Daten verlassen die EU. Kein Zugriffsrisiko über den US Cloud Act. Hetzner stellt das Hosting in Falkenstein, Deutschland, auf Grundlage eines Auftragsverarbeitungsvertrags nach Art. 28 DSGVO bereit.

Häufig gestellte Fragen

Antworten auf häufige Fragen zu personenbezogenen Daten, Datenschutzvorschriften und automatisierter Anonymisierung.

Die Definition „personenbezogener Daten“ in der DSGVO ist weiter gefasst als der US-amerikanische Begriff „PII“. Nach der DSGVO zählen dazu alle Informationen, die sich auf eine identifizierte oder identifizierbare natürliche Person beziehen. Das schließt Online-Kennungen wie IP-Adressen und Cookie-Kennungen ein. US-Definitionen von PII unterscheiden sich je nach Bereich und Bundesstaat. Sie sind im Allgemeinen enger gefasst und verlangen häufig, dass die Daten eine Person direkt identifizieren. Eine Anonymisierung nach dem Anwendungsbereich der DSGVO erfasst in der Praxis meist auch Datenarten, die unter US-Definitionen von PII fallen. Sie erfüllt für sich genommen jedoch nicht die gesonderten Pflichten aus HIPAA, CCPA/CPRA, FERPA oder einzelstaatlichem Recht. Diese müssen eigenständig geprüft werden.

In den meisten Fällen ja. Die E-Mail-Adresse einer Person ist meist ein direkter Identifikator, weil sie eine bestimmte Person ohne weitere Informationen eindeutig identifizieren kann. Das gilt sowohl nach der DSGVO (als personenbezogenes Datum) als auch nach US-Datenschutzvorschriften (als PII). Selbst eine allgemeine geschäftliche Adresse wie info@company.com kann darunterfallen, wenn sie sich einer bestimmten Person zuordnen lässt. Eine persönliche Adresse wie firstname.lastname@provider.com gilt nach wichtigen Datenschutzregelungen wie der DSGVO und dem CCPA/CPRA als personenbezogenes Datum oder PII.

Nach der DSGVO ja: IP-Adressen gelten ausdrücklich als personenbezogene Daten, weil sich damit eine Person identifizieren lässt, insbesondere zusammen mit Daten eines Internetanbieters. Der Gerichtshof der Europäischen Union bestätigte dies 2016 in der Rechtssache Breyer gegen Bundesrepublik Deutschland. In den USA kommt es auf den Zusammenhang an. Der CCPA zählt IP-Adressen zu personenbezogenen Informationen. Andere Regelungen auf Bundesebene stufen sie möglicherweise erst dann als PII ein, wenn eine direkte Verbindung zu einer bestimmten Person besteht. Als bewährte Praxis sollten Sie IP-Adressen unabhängig vom Rechtsraum als PII behandeln.

Die Folgen sind schwerwiegend und vielschichtig. Bußgelder: Die DSGVO sieht Geldbußen von bis zu 4 % des weltweiten Jahresumsatzes oder 20 Millionen € vor, je nachdem, welcher Betrag höher ist. Rechtliche Haftung: Sammelklagen, individuelle Schadensersatzansprüche und Meldungen an die Aufsichtsbehörde innerhalb von 72 Stunden, wenn die Verletzung voraussichtlich die Rechte von Personen gefährdet (Art. 33 DSGVO). In den USA gelten je nach Bundesstaat unterschiedliche Fristen. Rufschäden: verlorenes Kundenvertrauen, negative Berichterstattung und langfristige Auswirkungen auf die Marke. Betriebskosten: forensische Untersuchungen, Abhilfemaßnahmen, Überwachung der Kreditwürdigkeit betroffener Personen und höhere Versicherungsprämien.

Der gehostete Dienst anonym.legal deckt 267 Arten personenbezogener Daten in 48 Sprachen ab. Seine kombinierte Erkennung verbindet die Erkennung benannter Einheiten durch Sprachverarbeitung (25 spaCy-Sprachen + 7 Stanza + 16 XLM-RoBERTa) mit Mustererkennern einschließlich Prüfsummenprüfung (Luhn für Kreditkarten, MOD-97 für IBANs, Formatregeln für SSN). Die Datenarten umfassen Identität, Kontakt, Finanzen, Gesundheit, digitale Kennungen, Biometrie, Beschäftigung und Bildung. Damit decken sie das gesamte Spektrum von PII ab, wie es wichtige Vorschriften einschließlich der DSGVO definieren.

Anonymisieren Sie die Daten vor der Verarbeitung: Erkennen und entfernen Sie personenbezogene Daten, bevor sie das große Sprachmodell erreichen. So beseitigen Sie das Risiko an der Quelle, statt sich auf die Regeln des KI-Anbieters zur Datenverarbeitung zu verlassen. Nutzen Sie eine regelgebundene, wiederholbare Erkennung und kein weiteres großes Sprachmodell. So vermeiden Sie einen Zirkelschluss, bei dem Sie sensible Daten an eine KI senden, um sie vor einer anderen zu schützen. Achten Sie darauf, dass die Anonymisierung umkehrbare Token unterstützt, damit berechtigte Nutzer Daten in KI-Antworten bei Bedarf wieder zuordnen können. Für die Einbindung eignen sich ein MCP-Server für Entwicklungsumgebungen, eine Chrome-Erweiterung für KI-Chats im Browser oder eine REST-API für automatisierte Abläufe.

Weiterführend: Wie die Anonymisierung personenbezogener Daten Datenschutzverletzungen verhindert →

Gilt das für Ihre Organisation?

Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.

Testen Sie die Erkennung personenbezogener Daten

Sie können dieselbe Erkennung auf zwei Arten nutzen — auf unseren Servern oder auf Ihren eigenen:

Unsere Server stehen in Deutschland. 267 Arten personenbezogener Daten, 48 Sprachen. Kostenloser Tarif, danach ab 3 € im Monat.

anonym.legal öffnen ↗

Auf Ihrem Rechner — anonym.plus

Ein lokal arbeitendes Desktop-Programm. Der Text verlässt den Rechner nie. 317 eigene Mustererkenner. Kostenlos für einen Rechner, danach eine einmalig bezahlte Lizenz ab 149 €.

anonym.plus öffnen ↗
Beide Produkte vergleichen →