Plattform Produkte
anonym.legal — gehostet in Deutschland anonym.plus — läuft auf Ihren Rechnern API und MCP
Branchen Enterprise Preise Leistungen Wissen
Wissensdatenbank Leitfäden Nach Rechtsvorschrift Vergleiche Artikel
Unternehmen
Über uns Nachweise Kontakt
English Sprechen Sie mit uns
DSGVO-LEITFADEN

KI-Trainingsdaten nach der DSGVO: So anonymisieren Sie vor dem Feintuning

Das Feintuning großer Sprachmodelle (LLMs) mit echten Unternehmensdaten gehört zu den wirkungsvollsten Dingen, die ein Team für maschinelles Lernen tun kann. Es gehört zugleich zu den rechtlich riskantesten. Artikel 5 Absatz 1 Buchstabe c der Datenschutz-Grundverordnung (DSGVO) verlangt Datenminimierung. Artikel 10 der EU-KI-Verordnung stellt Anforderungen an Daten-Governance und Datenqualität bei Trainings-, Validierungs- und Testdaten für Hochrisiko-KI-Systeme. Wenn Sie vor dem Training personenbezogene Daten entfernen, die Sie nicht benötigen, hilft das bei der Einhaltung beider Vorschriften.

Zwei Vorschriften, ein Ansatz

Wer als Fachkraft für maschinelles Lernen mit Daten aus der EU arbeitet, muss zwei Regelwerke mit sich überschneidenden Anforderungen beachten:

  • DSGVO, Artikel 5 Absatz 1 Buchstabe c: Datenminimierung. Personenbezogene Daten müssen „dem Zweck angemessen und erheblich sowie auf das für die Zwecke der Verarbeitung notwendige Maß beschränkt sein“.
  • DSGVO, Artikel 25: Datenschutz durch Technikgestaltung. Technische Maßnahmen zur Begrenzung der Verarbeitung personenbezogener Daten müssen von Anfang an vorgesehen sein, nicht erst nachträglich.
  • EU-KI-Verordnung, Artikel 10: Für Trainings-, Validierungs- und Testdaten von Hochrisiko-KI-Systemen gelten Daten-Governance- und Datenverwaltungsverfahren. Artikel 4a, zuvor Artikel 10 Absatz 5 und durch die Verordnung (EU) 2026/1744 geändert, erlaubt die Verarbeitung besonderer Kategorien personenbezogener Daten zur Erkennung und Korrektur von Verzerrungen nur, soweit sie unbedingt erforderlich ist und Schutzvorkehrungen bestehen.

Die gute Nachricht: Anonymisierung dient beiden Regelwerken. Daten, die nach Erwägungsgrund 26 der DSGVO anonym sind, sind keine personenbezogenen Daten mehr. Dabei sind „alle Mittel“ zu berücksichtigen, die „nach allgemeinem Ermessen wahrscheinlich genutzt werden“, um eine Person zu identifizieren. Anonymisierung allein erfüllt jedoch nicht die weiteren Pflichten der KI-Verordnung für Hochrisiko-Systeme: Risikomanagement, Dokumentation, menschliche Aufsicht und Konformitätsbewertung.

Was Datenminimierung für Trainingsdaten bedeutet

Weder die DSGVO noch die KI-Verordnung schreibt pauschal vor, dass Trainingsdaten frei von personenbezogenen Daten sein müssen. Die DSGVO verlangt, dass Sie nur die personenbezogenen Daten verarbeiten, die Sie benötigen (Artikel 5 Absatz 1 Buchstabe c), und den Datenschutz von Anfang an einbauen (Artikel 25). Bei den meisten Texten für das Feintuning eines LLM sind Namen, Kontaktdaten und Identifikationsnummern für das Trainingsziel nicht nötig. Sie zu entfernen ist daher ein naheliegender Weg, das Prinzip der Datenminimierung umzusetzen.

Bei manchen Datenarten ist das schwieriger: medizinische Bilddaten, Sprachaufnahmen und Videos können durch eine vollständige Entfernung identifizierender Merkmale ihren Wert für das Training verlieren. Für Textdaten, die häufigste Datenart beim LLM-Training, gibt es Werkzeuge zur Erkennung personenbezogener Daten. Identifizierende Angaben zu entfernen ist hier meist praktikabel.

Die 4 Arten personenbezogener Daten in KI-Trainingsdaten

1. Direkte Identifikatoren

Diese Angaben sind eindeutig personenbezogen: vollständige Namen, E-Mail-Adressen, Sozialversicherungsnummern, Passnummern, Telefonnummern, Geburtsdatum zusammen mit dem Namen und Wohnanschriften. Direkte Identifikatoren müssen immer anonymisiert werden. Es gibt kein berechtigtes Argument dafür, sie in LLM-Trainingsdaten zu erhalten.

2. Quasi-Identifikatoren

Einzeln identifizieren diese Angaben keine Person, in Kombination aber gefährlich: Geburtsdatum ohne Namen, Postleitzahl, Berufsbezeichnung, Arbeitgeber und Staatsangehörigkeit. Eine wegweisende Studie von Latanya Sweeney zeigte, dass sich 87 % der Menschen in den USA allein anhand von drei Quasi-Identifikatoren eindeutig identifizieren lassen: fünfstellige Postleitzahl, Geburtsdatum und Geschlecht. LLMs, die mit Quasi-Identifikatoren trainiert werden, können lernen, identifizierende Kombinationen zu erzeugen, selbst wenn die Trainingsdaten keine direkten personenbezogenen Angaben enthalten.

3. Besondere Kategorien personenbezogener Daten (DSGVO, Artikel 9)

Diese Daten stehen unter erhöhtem Schutz der DSGVO: Gesundheits- und medizinische Daten, rassische oder ethnische Herkunft, politische Meinungen, religiöse Überzeugungen, Gewerkschaftszugehörigkeit, genetische Daten, biometrische Daten, sexuelle Orientierung und strafrechtliche Verurteilungen. Solche Daten in Trainingsbeständen erhöhen die rechtlichen Risiken mehrfach: durch mögliche Verstöße gegen Artikel 9 der DSGVO, eine mögliche Einstufung als Hochrisiko-KI-System nach der EU-KI-Verordnung und bei Gesundheitsdaten durch mögliche Verstöße gegen HIPAA.

4. Erzeugte personenbezogene Daten (Risiko bei Modellausgaben)

Ein seltener diskutiertes Risiko: LLMs, die mit Beständen echter personenbezogener Daten trainiert wurden, können in ihren Ausgaben realistisch wirkende personenbezogene Angaben erzeugen. Ein mit E-Mail-Datenbeständen trainiertes Modell kann Ausgaben erzeugen, die echten E-Mail-Adressen ähneln. Ein mit Krankenakten trainiertes Modell kann glaubhafte, aber erfundene Patientendaten erzeugen, die mit echten Akten verwechselt werden könnten. Die Anonymisierung von Trainingsdaten senkt dieses Ausgaberisiko erheblich, beseitigt es aber nicht. Übersehene Angaben und verbliebene Quasi-Identifikatoren können weiterhin in Ausgaben gelangen.

Konsistente Pseudonymisierung: Warum sie für RAG wichtig ist

Für Verfahren mit abrufgestützter Generierung (Retrieval-Augmented Generation, RAG) ist Konsistenz die wichtigste Eigenschaft der Anonymisierung von Trainingsdaten: Dieselbe reale Entität muss immer demselben Pseudonym zugeordnet werden.

Denken Sie an einen Bestand von Supportanfragen, mit dem ein LLM für den Kundenservice feinabgestimmt wird. Wenn „Sarah Chen“ in 23 Anfragen vorkommt, aber in manchen durch „PERSON_1“ und in anderen durch „PERSON_7“ ersetzt wird, lernt das Modell, dass es sich um 23 verschiedene Entitäten handelt. Der Zusammenhang zwischen den Anfragen wird zerstört. Die Qualität des Abrufs sinkt, weil das Modell zusammengehörige Kontakte nicht mehr verbinden kann.

Bei konsistenter Pseudonymisierung wird „Sarah Chen“ im gesamten Datenbestand jedes Mal zu „Emma Williams“. Das Modell lernt die richtige Beziehungsstruktur. Weil das Pseudonym gleich bleibt, funktionieren Ähnlichkeitssuche und die Zuordnung von Erwähnungen derselben Entität korrekt.

# Einen Trainingsdatenbestand mit der REST-API von anonym.legal anonymisieren # (zwei Aufrufe je Dokument: erkennen, dann anonymisieren) import requests BASE = "https://anonym.legal/api/presidio" HEADERS = {"Authorization": f"Bearer {API_TOKEN}"} documents = load_training_corpus() anonymized_docs = [] for doc in documents: found = requests.post(f"{BASE}/analyze", headers=HEADERS, json={ "text": doc["content"], "language": "en" }).json() result = requests.post(f"{BASE}/anonymize", headers=HEADERS, json={ "text": doc["content"], "analyzer_results": found["results"], "operators": {"PERSON": {"type": "replace", "new_value": "<PERSON>"}} }).json() anonymized_docs.append(result["text"]) # Hinweis: Jeder Name erhält hier dieselbe Kennzeichnung. Der Code vergibt # kein eigenes, dokumentübergreifend gleichbleibendes Pseudonym je Person. # Anonymisierten Datenbestand für das Training speichern save_training_corpus(anonymized_docs)

Die Anonymisierung von Trainingsdaten in 5 Schritten

1

Quellen Ihrer Trainingsdaten erfassen

Dokumentieren Sie vor der Verarbeitung jede Quelle Ihrer Trainingsdaten: Herkunft, Erhebungsdatum, ob gegebenenfalls eine Einwilligung vorliegt und welche Kategorien personenbezogener Daten enthalten sind. Dieses Verzeichnis bildet die Grundlage für Ihre technische Dokumentation nach Artikel 11 der KI-Verordnung und Ihr Verzeichnis von Verarbeitungstätigkeiten nach der DSGVO.

2

Nach personenbezogenen Daten suchen

Prüfen Sie Ihren unbearbeiteten Datenbestand zunächst nur auf personenbezogene Daten, bevor Sie ihn anonymisieren. So erfassen Sie das Ausmaß der enthaltenen personenbezogenen Daten. Das liefert einen Ausgangswert für Ihre Dokumentation und hilft Ihnen, die Empfindlichkeit der Erkennung einzustellen. Nutzen Sie für webbasierte Quellen piisafe.eu. Für mehrere Dateien verwenden Sie die REST-API im Erkennungsmodus.

3

Anonymisierung anwenden

Verarbeiten Sie Ihren gesamten Trainingsdatenbestand und geben Sie für jedes Dokument die Sprache an. Soll dieselbe Person in allen Dokumenten dasselbe Pseudonym erhalten, reicht der Anonymisierungsaufruf allein dafür nicht aus. Führen Sie in Ihrer Verarbeitung eine eigene Zuordnungstabelle oder prüfen Sie, ob eine Typkennzeichnung wie <PERSON> für Ihr Trainingsziel genügt.

4

Qualität der Anonymisierung prüfen

Prüfen Sie den anonymisierten Datenbestand anschließend ein zweites Mal auf verbliebene personenbezogene Daten. Das Ziel sind null erkannte Entitäten. Jede verbleibende Erkennung ist entweder ein falsch negatives Ergebnis (echte personenbezogene Daten wurden übersehen) oder ein falsch positives Ergebnis (die Prüfung hat harmlose Angaben fälschlich als personenbezogen erkannt). Prüfen Sie markierte Stellen manuell, um festzustellen, welcher Fall vorliegt.

5

Prüfprotokoll archivieren

Exportieren Sie die Protokolle der Erkennung und Anonymisierung als CSV oder JSON. Archivieren Sie sie zusammen mit den Metadaten Ihres Trainingslaufs. Halten Sie fest: Verarbeitungsdatum, verwendete Version von anonymize.solutions, berücksichtigte Arten personenbezogener Daten, Gesamtzahl der ersetzten Entitäten und Zuverlässigkeitswerte der Erkennung.

Was Sie für die Einhaltung der Vorschriften dokumentieren sollten

Für das Verzeichnis von Verarbeitungstätigkeiten nach der DSGVO und die technische Dokumentation nach Artikel 11 der EU-KI-Verordnung sollte Ihr Abschnitt zur Anonymisierung Folgendes enthalten:

  • Quellen der Trainingsdaten und Rechtsgrundlage ihrer ursprünglichen Erhebung
  • Datum der Anonymisierung und Version der verwendeten Werkzeuge
  • Berücksichtigte Arten personenbezogener Daten mit Verweis auf die Liste der 267 Datenarten
  • Verwendete Anonymisierungsmethode (Ersetzen/Entfernen/Maskieren/Hashwert bilden/Verschlüsseln)
  • Vorgehen zur konsistenten Zuordnung von Entitäten über mehrere Dokumente hinweg
  • Ergebnisse der Überprüfung mit der Anzahl erkannter Entitäten vor und nach der Verarbeitung
  • Zertifizierung der Infrastruktur (ISO 27001:2022, Hetzner in Deutschland)
  • Ergebnis der Bewertung des Risikos einer erneuten Identifizierung

Fazit: Erst anonymisieren, dann trainieren

Regulatorische Probleme vermeiden die Teams für maschinelles Lernen, die die Anonymisierung zu einem Schritt ihrer Datenverarbeitung machen – nicht zu einem nachträglichen Gedanken, wenn das Training abgeschlossen ist. Personenbezogene Daten nachträglich aus einem Modell zu entfernen ist technisch nicht möglich. Sie müssen es von Grund auf neu trainieren. Wenn Sie die Anonymisierung von Anfang an einbauen, fallen je Trainingsdurchlauf einige API-Aufrufe oder lokale Verarbeitungszeit an. Bauen Sie sie erst nach einer behördlichen Maßnahme ein, kostet das Monate für das erneute Training, Anwaltskosten und mögliche Geldbußen.

Bereit für die Umsetzung? Die REST-API von anonym.legal nimmt Daten in Stapeln an. Deren Größe hängt vom Tarif ab. Die Anonymisierung ist auf 30 Aufrufe pro Minute begrenzt. Bei großen Trainingsdatenbeständen verarbeitet anonym.plus die Daten auf Ihren eigenen Rechnern, ohne sie hochzuladen. Lesen Sie die API-Dokumentation oder fragen Sie eine Vorführung an, um Ihre konkrete Architektur für Trainingsdaten zu besprechen.

Grenzen und ehrliche Einschränkungen

Die Anonymisierung von Trainingsdaten hat Grenzen. Eine tatsächliche Anonymisierung ist schwierig: Lassen sich Personen anhand der Modellausgaben oder verbliebener Quasi-Identifikatoren herausgreifen, handelt es sich um Pseudonymisierung. Die Daten bleiben dann nach der DSGVO personenbezogen. Anonymisierung eignet sich auch nicht für jeden Datenbestand. Bei manchen Konstellationen rund um die Rechtsgrundlage und besondere Kategorien personenbezogener Daten sind eine Einwilligung oder eine Datenschutz-Folgenabschätzung nötig, unabhängig davon, wie gründlich Sie identifizierende Angaben entfernen. Anonymisierung senkt Ihr Risiko, ersetzt aber keine dokumentierte Rechtsgrundlage.

Anonymisieren Sie Ihre Trainingsdaten noch heute

Unterstützt die Datenminimierung nach der DSGVO vor dem Training. Betrieb auf der nach ISO 27001 zertifizierten Infrastruktur von Hetzner in Falkenstein, Deutschland.

Gilt das für Ihre Organisation?

Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.