Das Risiko: personenbezogene Daten in KI-Abläufen

KI-Datensicherheit bedeutet, personenbezogene Daten aus Eingaben, RAG-Abfragen und Trainingsdaten zu entfernen, bevor ein großes Sprachmodell (LLM) sie verarbeitet. Große Sprachmodelle nehmen alles auf, was Sie ihnen senden. Sobald personenbezogene Daten in ein LLM gelangen, verlieren Sie die Kontrolle darüber, wie sie gespeichert, verarbeitet oder wieder ausgegeben werden.

  • Verunreinigung von Trainingsdaten — Personenbezogene Daten können in künftige Modellgewichte eingehen
  • Protokollierung von Eingaben — KI-Anbieter können Eingaben zur Fehlersuche, Sicherheitsprüfung oder Modellverbesserung protokollieren
  • Datenabfluss über Ausgaben — Personenbezogene Daten aus der Eingabe einer Person können in der Antwort an eine andere Person erscheinen
  • Keine Löschmöglichkeit — Sobald Daten in ein Modell gelangt sind, lassen sie sich nicht zuverlässig entfernen
  • Grenzüberschreitende Übermittlung — Aufrufe von KI-APIs können Daten durch Rechtsräume außerhalb der EU leiten

Pipeline zur Vorverarbeitung

Eine regelgebundene, wiederholbare Vorverarbeitung verringert die Weitergabe personenbezogener Daten, bevor diese einen KI-Dienst erreichen. Umkehrbare Platzhalter ermöglichen berechtigten Personen, die Zuordnung später wiederherzustellen.

1. ABFANGEN
→
Text erfassen, bevor er das LLM erreicht
2. ERKENNEN
→
Sprachverarbeitung und Mustererkennung identifizieren alle Arten personenbezogener Daten
3. ANONYMISIEREN
→
Personenbezogene Daten durch Platzhalter, Schwärzungen oder verschlüsselte Werte ersetzen
4. SENDEN
→
Anonymisierte Daten gehen an das LLM — die Weitergabe personenbezogener Daten wird verringert
5. WIEDERHERSTELLEN
→
Platzhalter in der KI-Antwort bei entsprechender Berechtigung wieder zuordnen

Die KI sieht nie echte Namen, E-Mail-Adressen oder sensible Daten. Sie arbeitet mit sicheren Platzhaltern, die Zusammenhang und Bedeutung erhalten.

MCP-Server — KI-Sicherheit in Ihrer Entwicklungsumgebung

Das Model Context Protocol (MCP) bindet anonymize.solutions direkt in Claude Desktop, Cursor und VS Code ein. Der MCP-Server stellt Werkzeuge zur Anonymisierung bereit, die der Assistent bei Bedarf aufruft. Er ist kein automatischer Filter vor jeder Eingabe: Text, den Sie direkt in den Chat schreiben oder einfügen, erreicht das Modell unverändert.

Einrichtung in 5 Minuten

Tragen Sie den MCP-Server in die Konfigurationsdatei Ihres KI-Werkzeugs ein. Ein JSON-Block und ein API-Schlüssel genügen. Der Schutz beginnt sofort für jede Unterhaltung.

Claude, Cursor, VS Code

Funktioniert mit Claude Desktop, Claude Code, Cursor IDE, Windsurf und jedem MCP-kompatiblen KI-Assistenten über Streamable HTTP.

Verarbeitung, und was Zero-Knowledge abdeckt

Ihr Text wird übertragen, anonymisiert und zurückgegeben. Der Erkennungsdienst muss den Text lesen, den er analysiert. Wo er gar nicht gelesen werden darf, hält das lokal arbeitende Desktop-Programm ihn auf Ihrem eigenen Rechner.

SO FUNKTIONIERT ES

Der Assistent ruft ein MCP-Werkzeug für Ihren Text auf → personenbezogene Daten werden durch sichere Platzhalter ersetzt → das LLM verarbeitet die bereinigten Daten → die Zuordnung wird in der Antwort automatisch wiederhergestellt.

MCP-Einrichtungsanleitung

Drei Wege zum Schutz von KI-Abläufen

Wählen Sie den Anbindungspunkt, der zu Ihrem Ablauf passt, oder kombinieren Sie alle drei für Schutz vom Anfang bis zum Ende.

MCP-Server

Für Entwickler und technische Teams. Die direkte Anbindung an Ihre Entwicklungsumgebung gibt dem Assistenten Werkzeuge, um Text vor der weiteren Verarbeitung zu anonymisieren.

  • Claude Desktop, Cursor, VS Code
  • Anonymisierung beim Werkzeugaufruf des Assistenten
  • 9 MCP-Werkzeuge
  • Kontrollierte Freigabe von Daten
MCP-Details

Chrome-Erweiterung

Für Fachanwender und Teams ohne technische Spezialisierung. Sie schützt Eingaben in KI-Chats auf ChatGPT, Claude und Gemini, indem sie personenbezogene Daten in Echtzeit abfängt und die Zuordnung in Antworten automatisch wiederherstellt.

  • ChatGPT, Claude, Gemini, Copilot
  • Eingaben in Echtzeit abfangen
  • Antworten automatisch wiederherstellen
  • Reibungslose Nutzung im Browser
Details zur Erweiterung

REST-API

Für Pipelines und automatisierte Abläufe. Binden Sie die API programmatisch in die Aufnahme von RAG-Daten, ETL-Prozesse, Pipelines zum Trainieren von Modellen und jedes System ein, das Daten an LLMs sendet.

  • Anbindung an RAG-, ETL- und ML-Pipelines
  • Stapelverarbeitung
  • Anfragen und Antworten im JSON-Format
  • JWT-Authentifizierung und Ratenbegrenzung
API-Details

Wo KI-Sicherheit besonders wichtig ist

Jeder KI-Ablauf, der personenbezogene Daten verarbeitet, benötigt eine Vorverarbeitung. Dies sind die häufigsten Szenarien.

Schutz für KI-Chatbots

Chatbots im Kundendienst verarbeiten personenbezogene Daten wie Namen, Kontonummern, Adressen und Gesundheitsinformationen. Anonymisieren Sie Eingaben, bevor das LLM eine Antwort erzeugt. Stellen Sie anschließend die Zuordnung der Platzhalter in der Ausgabe für den zuständigen Mitarbeiter wieder her.

Nutzer: „Ich bin John Doe, mein Konto ist 4532-8821“
LLM sieht: „Ich bin [NAME_1], mein Konto ist [ACCOUNT_1]“

Schutz für RAG-Pipelines

Anonymisieren Sie Dokumente vor der Umwandlung in Vektoren, damit Ihre Wissensdatenbank deutlich weniger personenbezogene Daten enthält. Wenn das System zur Generierung mit abgerufenen Informationen Kontext bereitstellt, bleiben erkannte personenbezogene Daten aus LLM-Eingaben und -Antworten heraus. Das verringert das Risiko, ist aber keine Garantie.

Dokument → Anonymisieren → In Vektoren umwandeln → Vektordatenbank
Abfrage → Bereinigte Abschnitte abrufen → LLM

Abläufe mit KI-Agenten

In mehrstufigen Agentenketten durchlaufen Daten mehrere LLM-Aufrufe, Werkzeugaufrufe und externe APIs. Jeder Schritt kann Daten offenlegen. Anonymisieren Sie die Daten am Eingang und stellen Sie die Zuordnung am Ausgang wieder her.

Eingabe → Anonymisieren → Agentenschritt 1 → Schritt 2
→ Schritt 3 → Zuordnung wiederherstellen → Ausgabe

Vorbereitung der LLM-Feinabstimmung

Entfernen Sie personenbezogene Daten aus Trainingsdatensätzen vor der Feinabstimmung. Dadurch verringern Sie die Menge personenbezogener Daten, die Ihr angepasstes Modell aus Trainingsbeispielen speichern kann. Zugleich unterstützt dies die Grundsätze der Datenminimierung und Zweckbindung nach Art. 5 DSGVO.

Trainingsdaten → Stapelweise anonymisieren → Bereinigte JSONL-Datei
→ Modell mit den bereinigten Daten feinabstimmen

Warum regelgebundene, wiederholbare Erkennung für KI wichtig ist

Wir erkennen personenbezogene Daten mit Sprachverarbeitung und Mustererkennung, nicht mit LLMs. Diese bewusste Architekturentscheidung bringt konkrete Vorteile für die KI-Sicherheit.

Das Problem bei der Erkennung durch LLMs

Manche Anonymisierungswerkzeuge erkennen personenbezogene Daten mit KI-Modellen. So entsteht eine Abhängigkeit im Kreis: Sie senden sensible Daten an ein LLM, um sie vor einem anderen LLM zu schützen. Unser Ansatz beseitigt diesen Widerspruch vollständig.

Vorteile für KI-Abläufe

  • Kein Halluzinationsrisiko — Muster- und Sprachverarbeitungssysteme können falsch positive Treffer nicht aus Fantasie erfinden
  • Vollständiges Prüfprotokoll — Jeder Treffer hat einen Zuverlässigkeitswert, eine Art personenbezogener Daten und eine Position und ist vollständig nachvollziehbar
  • Keine Daten an fremde KI-Dienste — Die Erkennung erfolgt auf unserer EU-Infrastruktur, nie über externe KI-APIs
  • Keine LLM-Aufrufe — Die Erkennung nutzt Musterabgleich und Sprachverarbeitungsmodelle (spaCy, Stanza, Transformer), keine großen Sprachmodelle

Regelgebundene Erkennung im Vergleich zur KI-basierten Erkennung

Eigenschaft Unser Ansatz LLM-basiert
Halluzinationsrisiko ✓ Keines ✗ Vorhanden
Prüfprotokoll ✓ Vollständig ✗ Begrenzt
Offenlegung von Daten ✓ Keine ✗ An KI-Anbieter
DSGVO-Konformität ✓ Integriert ✗ Abhängig vom Einsatz

WESENTLICHE UNTERSCHIEDE

  • Erkennung: Microsoft Presidio, Sprachverarbeitung und reguläre Ausdrücke
  • Datenarten: 267 Arten in 48 Sprachen
  • Methoden: Ersetzen, Entfernen oder Schwärzen, Maskieren, Hashwert bilden, Verschlüsseln
  • Betrieb: 100 % EU-Infrastruktur (Hetzner, Deutschland)

Benötigen Sie eine umfassende Strategie für KI-Governance?

anonymize.solutions übernimmt die technische Ebene: Erkennung und Anonymisierung personenbezogener Daten. Für die Beratung von Unternehmen zu KI-Governance, Richtlinien, Risikobewertungen und der Einhaltung der EU-KI-Verordnung bietet curta.solutions, das Team hinter dieser Plattform, eigene Beratungsleistungen an.

GOVERNANCE

Richtlinien + Technik

Gilt das für Ihre Organisation?

Dieser Leitfaden ist allgemein; Ihre Pflichten sind es nicht. Nennen Sie uns Ihre Branche und sagen Sie uns, wohin Ihre Daten gelangen dürfen. Wir sagen Ihnen, was für Sie gilt.