Personenbezogene Daten in LLM-Eingaben: Risiken und Lösungen
Jedes Mal, wenn Sie Text in einen KI-Chat einfügen, eine Eingabe über eine API senden oder Dokumente in eine RAG-Verarbeitung geben, riskieren Sie, personenbezogene Daten gegenüber Systemen offenzulegen, die Sie nicht kontrollieren.
Das Ausmaß des Problems
Beschäftigte in Unternehmen fügen regelmäßig sensible Daten in KI-Werkzeuge ein. Branchenuntersuchungen legen nahe, dass ein erheblicher Anteil der Eingaben in KI-Werkzeuge personenbezogene Daten enthält. Nach dem Absenden können diese Daten protokolliert, für das Training verwendet oder anderen Nutzern in Ausgaben offengelegt werden.
Vier Wege der Offenlegung personenbezogener Daten in LLM-Abläufen
Jedes Mal, wenn personenbezogene Daten in ein KI-System gelangen, entstehen mehrere Möglichkeiten der Offenlegung. Diese Wege zu verstehen ist der erste Schritt, um sie zu beseitigen.
Verunreinigte Trainingsdaten
Personenbezogene Daten, die an KI-Dienste gesendet werden, können in das Modelltraining einfließen und dadurch für jeden Nutzer abrufbar werden. Gelangen sie einmal in die Modellgewichte, gibt es keinen verlässlichen Weg, sie zu entfernen. Sie können später unvorhersehbar in Ausgaben erscheinen.
Protokollierung von Eingaben
API-Anbieter protokollieren Eingaben zur Fehlersuche und Verbesserung. Damit stehen auch Ihre personenbezogenen Daten in ihren Protokollen. Diese können unbegrenzt gespeichert, von Beschäftigten des Kundendienstes eingesehen oder in zusammenfassende Auswertungen über den gesamten Kundenstamm einbezogen werden.
Offenlegung in Ausgaben
Große Sprachmodelle (LLMs) können personenbezogene Daten aus Trainingsdaten speichern und in Antworten an andere Nutzer wiedergeben. Untersuchungen haben Angriffe gezeigt, mit denen sich Namen, Telefonnummern und E-Mail-Adressen aus Modellen auslesen lassen, die mit personenbezogenen Daten trainiert wurden.
Offenlegung über APIs
API-Anbindungen an Drittanbieter schaffen weitere Möglichkeiten der Offenlegung, die über den LLM-Anbieter hinausgehen. Abläufe mit KI-Agenten, RAG-Verarbeitungen und Erweiterungen leiten Daten durch mehrere Dienste. Jeder davon kann eine mögliche Stelle für einen Datenabfluss sein.
Rechtliche Folgen personenbezogener Daten in LLM-Eingaben
Jeder Weg der Offenlegung personenbezogener Daten entspricht bestimmten Rechtsverstößen. Die Sanktionen sind real, und die Durchsetzung nimmt zu.
| Risiko | Folgen nach der DSGVO | Folgen nach HIPAA | Folgen nach PCI-DSS |
|---|---|---|---|
| Personenbezogene Daten in Eingaben | Rechtsgrundlage nach Art. 6 erforderlich | Verstoß durch Offenlegung geschützter Gesundheitsdaten | Offenlegung von Karteninhaberdaten |
| Grenzüberschreitende Übermittlung | Bei einem US-amerikanischen LLM sind Standarddatenschutzklauseln nach Art. 46 erforderlich | Business Associate Agreement (BAA) erforderlich | Nicht zulässig |
| Kein Recht auf Löschung | Recht auf Löschung nach Art. 17 nicht erfüllbar | Verstoß gegen Aufbewahrungsvorgaben | Nicht regelkonform |
| Aufnahme in Trainingsdaten | Zweckbindung nach Art. 5 | Verstoß gegen das Gebot der Beschränkung auf das erforderliche Maß | Verstoß gegen Vorgaben zum Geltungsbereich |
| Protokollierung durch den Anbieter | Auftragsverarbeitungsvertrag nach Art. 28 | Prüfpflicht | Fehlende Zugriffskontrolle |
Drei Anbindungen für die Anonymisierung vor der Verarbeitung
Beseitigen Sie die Möglichkeit einer Offenlegung an der Quelle, bevor Daten das LLM überhaupt erreichen. Wählen Sie die Anbindung, die zu Ihrem Arbeitsablauf passt.
MCP-Server
Für Entwickler: Der MCP-Server stellt Werkzeuge bereit, mit denen geeignete Anwendungen oder Agenten Text vor der Weitergabe prüfen und anonymisieren können. Die Einrichtung dauert 5 Minuten.
- Claude Desktop, Cursor, VS Code
- Prüfen und Anonymisieren auf Anfrage
- 9 MCP-Werkzeuge
- Kontrollierte Datenfreigabe
Chrome-Erweiterung
Für geschäftliche Nutzer: Die Erweiterung fängt Text ab und anonymisiert ihn, bevor er an ChatGPT, Claude, Gemini oder jeden anderen KI-Chat gesendet wird. Der Schutz lässt sich mit einem Klick nutzen.
- ChatGPT, Claude, Gemini, Copilot
- Abfangen von Eingaben in Echtzeit
- Automatische Wiederherstellung in Antworten
- Unterbrechungsfreie Nutzung des Browsers
REST-API
Für Verarbeitungsketten: Die API anonymisiert Daten programmgesteuert für die Aufnahme in RAG-Systeme, ETL-Abläufe, Stapelverarbeitung und die Vorbereitung von Trainingsdaten für maschinelles Lernen.
- Anbindung an RAG-, ETL- und ML-Verarbeitungsketten
- Stapelverarbeitung
- Anfragen und Antworten im JSON-Format
- JWT-Authentifizierung und Ratenbegrenzung
Anonymisierung vor der Verarbeitung
Ein regelgebundener, wiederholbarer Verarbeitungsschritt entfernt alle personenbezogenen Daten, bevor sie einen KI-Dienst erreichen. Optional ermöglichen umkehrbare Token die spätere Wiederherstellung des Personenbezugs.
Der Ablauf Schritt für Schritt
„Kontaktieren Sie John Smith unter john@acme.com“
// Nach der Anonymisierung
„Kontaktieren Sie [NAME_1] unter [EMAIL_1]“
Die wichtigsten Vorteile
- Verschlüsselte eigene Muster — Eigene Muster, die Sie speichern, werden in Ihrem Browser verschlüsselt. Die Anmeldung ist nicht Zero-Knowledge. Text wird übertragen, anonymisiert und zurückgegeben. Die Erkennung liest den Text — genau darin besteht Erkennung. Wo der Text gar nicht gelesen werden darf, hält das lokal arbeitende Desktop-Programm ihn auf Ihrem Rechner.
- Umkehrbar — Wenn Sie dazu berechtigt sind, können Sie Token in der LLM-Antwort wieder den ursprünglichen Werten zuordnen. Ein einzelner API-Aufruf ordnet [NAME_1] den Ausgangsdaten zu.
- Prüfprotokoll — Ein vollständiges Verarbeitungsprotokoll enthält für jede Erkennung Zuverlässigkeitswerte, Arten personenbezogener Daten und Fundstellen. So lässt sich die Verarbeitung für Compliance-Prüfungen vollständig nachvollziehen.
ZUSAGEN ZUR VERARBEITUNG
- Erkennung: Microsoft Presidio (quelloffenes Rahmenwerk zur Erkennung personenbezogener Daten), Verarbeitung natürlicher Sprache und reguläre Ausdrücke
- Datenarten: 267 Arten in 48 Sprachen
- Methoden: Durch Platzhalter ersetzen, entfernen, teilweise maskieren, Hashwert bilden, verschlüsseln
- Betrieb: 100 % EU-Infrastruktur (Hetzner, Deutschland)
Eingabemanipulation und Angriffe zum Auslesen personenbezogener Daten
Bei einer Eingabemanipulation (Prompt Injection) wird ein LLM dazu gebracht, Anweisungen zu missachten und Daten preiszugeben. Befinden sich personenbezogene Daten im Modellkontext — aus Eingaben, RAG-Dokumenten oder Systemanweisungen —, können solche Angriffe sie auslesen.
Direkte Eingabemanipulation
Ein Angreifer erstellt eine Eingabe, die die Systemanweisung übersteuert. Dadurch kann das Modell personenbezogene Daten aus seinem Kontextfenster ausgeben. Wenn eine RAG-Verarbeitung Dokumente mit personenbezogenen Daten abruft, können manipulierte Nutzeranfragen diese Daten wörtlich auslesen.
Indirekte Eingabemanipulation
Ein LLM kann schädliche Anweisungen ausführen, die in abgerufenen Dokumenten oder Webseiten eingebettet sind. Enthalten diese Dokumente neben den eingeschleusten Anweisungen auch personenbezogene Daten, kann das Modell angewiesen werden, sie an externe Endpunkte weiterzugeben.
Anonymisierung vor der Verarbeitung verkleinert die Angriffsfläche. Personenbezogene Daten, die vor dem Eintritt in den LLM-Kontext ersetzt werden, lassen sich durch Eingabemanipulation nicht aus diesem Kontext auslesen. Daten, die der Erkenner übersieht, bleiben angreifbar. Diese Maßnahme folgt dem Prinzip der gestaffelten Verteidigung (Defence in Depth) und wirkt unabhängig von der eingesetzten Angriffstechnik.
Funktionen für die KI-Sicherheit im Überblick
Einen umfassenden Überblick über unsere Funktionen für die KI-Sicherheit finden Sie auf der Seite „KI-Sicherheit“. Dort erfahren Sie mehr über den MCP-Server, die Architektur der Anbindungen, Einsatzfälle für RAG-Verarbeitungen, Abläufe mit KI-Agenten und die Vorbereitung der Feinabstimmung von LLMs.
KI-Sicherheit ansehenKI-SICHERHEIT
MCP + API + Erweiterung
Gilt das für Ihre Organisation?
Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.
KI-Schutz direkt ausprobieren
Schützen Sie personenbezogene Daten, bevor sie ein LLM oder einen anderen KI-Dienst erreichen:
Auf Servern in Deutschland — anonym.legal
Unsere Server stehen in Deutschland. 267 Arten personenbezogener Daten, 48 Sprachen. Kostenloser Tarif, danach ab 3 € im Monat.
anonym.legal öffnen ↗Auf Ihrem Rechner — anonym.plus
Ein lokal arbeitendes Desktop-Programm. Der Text verlässt den Rechner nie. 317 eigene Mustererkenner. Für einen Rechner kostenlos, danach eine einmalig bezahlte Lizenz ab 149 €.
anonym.plus öffnen ↗