Die Frist rückt näher: 2. Dezember 2027
Die EU-KI-Verordnung trat am 1. August 2024 in Kraft. Sie gilt schrittweise: Die Verbote gelten seit dem 2. Februar 2025, die Transparenzpflichten aus Artikel 50 und die Regeln für KI mit allgemeinem Verwendungszweck seit dem 2. August 2026. Nach dem Digital Omnibus gelten die Anforderungen an Hochrisiko-KI-Systeme ab dem 2. Dezember 2027 für Systeme nach Anhang III und ab dem 2. August 2028 für Systeme nach Anhang I. Ab diesen Terminen können nationale Marktüberwachungsbehörden ermitteln, Bußgelder verhängen und verlangen, dass nicht konforme KI-Systeme vom EU-Markt genommen werden.
Die Bußgelder sind in 3 Stufen gegliedert:
| Art des Verstoßes | Fester Betrag | % des weltweiten Umsatzes |
|---|---|---|
| Verbotene KI-Praktiken, etwa soziale Bewertung oder biometrische Echtzeitüberwachung | 35.000.000 € | 7 % |
| Verstöße gegen Anforderungen an Hochrisiko-KI-Systeme, etwa Artikel 10 oder 11 | 15.000.000 € | 3 % |
| Irreführende oder unvollständige Angaben gegenüber Behörden | 7.500.000 € | 1 % |
Maßgeblich ist der höhere Wert aus festem Betrag und Prozentsatz. Für kleine und mittlere Unternehmen sowie Start-ups gilt der niedrigere Wert. Bei einem mittelgroßen Unternehmen mit 500 Mio. € weltweitem Umsatz könnte ein Verstoß gegen Hochrisiko-Anforderungen ein Bußgeld von 15 Mio. € bedeuten. Bei einem Fortune-500-Unternehmen könnte es mehr als 1 Mrd. € sein.
Wer ist betroffen?
Die EU-KI-Verordnung gilt für jede Organisation, die:
- KI-Systeme auf dem EU-Markt in Verkehr bringt oder
- KI-Systeme in der EU in Betrieb nimmt oder
- Anbieter, Betreiber, Einführer oder Händler von KI-Systemen ist, die von Menschen mit Wohnsitz in der EU genutzt werden
Entscheidend ist: Der Sitz des Unternehmens spielt dabei keine Rolle. Unternehmen aus den USA, dem Vereinigten Königreich, Kanada und Asien, die KI für europäische Kunden bereitstellen, unterliegen der EU-KI-Verordnung vollständig. Die Prüfung des räumlichen Anwendungsbereichs richtet sich nach dem Markt, anders als die auf betroffene Personen bezogene Prüfung der DSGVO. Anbieter und Betreiber fallen unabhängig von ihrem Sitz darunter, wenn sie ein KI-System auf dem EU-Markt in Verkehr bringen, es in der EU in Betrieb nehmen oder dessen Ausgabe in der EU verwendet wird.
Zu den Hochrisiko-KI-Systemen nach Anhang III gehören insbesondere biometrische Identifizierung, die Steuerung sicherheitskritischer Infrastruktur für Energie, Wasser und Verkehr, Bewertungen in Bildung und Berufsausbildung, Personalauswahl und Bewerberprüfung, die Bewertung von Kredit- und Versicherungsrisiken, Strafverfolgung und vorausschauende Polizeiarbeit, Migrations- und Asylverfahren sowie die Rechtspflege.
Artikel 10: Was er über personenbezogene Daten sagt
Artikel 10 ist die Vorschrift, die Datenteams, die Abläufe für das Training von KI entwickeln, am unmittelbarsten betrifft. Er legt Anforderungen an die Daten-Governance für Trainings-, Validierungs- und Testdatensätze von Hochrisiko-KI-Systemen fest.
„Für Trainings-, Validierungs- und Testdatensätze gelten Daten-Governance- und Datenverwaltungsverfahren, die für die Zweckbestimmung des Hochrisiko-KI-Systems geeignet sind … Die Trainings-, Validierungs- und Testdatensätze müssen im Hinblick auf die Zweckbestimmung relevant, hinreichend repräsentativ und so weit wie möglich fehlerfrei und vollständig sein …“
— EU-KI-Verordnung, Artikel 10 Absatz 2 und Artikel 10 Absatz 3
Artikel 10 verlangt nicht, dass Trainingsdaten frei von personenbezogenen Daten sind. Anonymisierung ist eine Schutzmaßnahme, die Sie wählen können. Die Verordnung schreibt sie nicht vor. Artikel 4a, eingefügt durch die Verordnung (EU) 2026/1744 anstelle des früheren Artikels 10 Absatz 5, weist in dieselbe Richtung: Besondere Kategorien personenbezogener Daten dürfen zur Erkennung von Verzerrungen nur verarbeitet werden, wenn dies „durch die Verarbeitung anderer Daten, einschließlich synthetischer oder anonymisierter Daten, nicht effektiv durchgeführt werden“ kann. Soweit personenbezogene Daten im Trainingsdatensatz verbleiben, gilt für sie weiterhin die DSGVO.
5 Maßnahmen für personenbezogene Daten vor Ablauf der Frist
Prüfen Sie Ihre Trainingsdatenbestände
Bevor Sie Daten anonymisieren können, müssen Sie Ihren Bestand kennen. Erfassen Sie jeden Trainingsdatensatz vollständig: seine Herkunft, die enthaltenen personenbezogenen Daten und die Art seiner Beschaffung. Prüfen Sie mit piisafe.eu öffentlich zugängliche Dokumentationsseiten und Modellbeschreibungen auf offengelegte personenbezogene Daten. Die Oberfläche der Website-Prüfung ist kostenlos; für die Erkennung personenbezogener Daten benötigen Sie einen anonym.legal-API-Schlüssel ab 3 € pro Monat. Mit der REST-API von anonym.legal können Sie dateibasierte Datensätze in Stapeln prüfen.
Dokumentieren Sie Ihre Ergebnisse. Diese Prüfung brauchen Sie als Teil Ihrer technischen Dokumentation nach Artikel 11. Auch die Aufsichtsbehörden werden bei Konformitätsbewertungen danach fragen.
Anonymisieren Sie personenbezogene Daten in Trainingskorpora
Anonymisieren Sie systematisch alle Trainingsdaten, die personenbezogene Angaben enthalten. Bei Trainingsdaten für die Verarbeitung natürlicher Sprache (NLP) bedeutet das eine Anonymisierung einzelner Datenarten: Ersetzen Sie Namen, E-Mail-Adressen, Telefonnummern, nationale Identifikationsnummern und andere personenbezogene Daten durch einheitliche Platzhalter oder synthetische Ersatzwerte.
Entscheidend ist die Einheitlichkeit: Wenn „John Smith“ in Ihrem Trainingskorpus 47-mal vorkommt, muss jedes Vorkommen durch dasselbe Pseudonym ersetzt werden. Uneinheitliche Anonymisierung verfälscht die statistischen Zusammenhänge, die Ihr Modell lernen soll.
Dokumentieren Sie Ihre Anonymisierungsmethode
Artikel 11 verlangt eine technische Dokumentation, zu der auch Ihre Verfahren zur Daten-Governance nach Artikel 10 gehören. Die Dokumentation muss so konkret sein, dass eine nationale Behörde Ihre Einhaltung der Vorgaben beurteilen kann. Pauschale Aussagen wie „Wir haben die Daten anonymisiert“ reichen nicht aus.
Eine konforme Beschreibung der Methode könnte lauten: „Trainingsdaten mit anonym.legal anonymisiert (Erkennung auf Basis von Presidio, 267 Datenarten, 48 Sprachen). Berücksichtigte Datenarten: [Liste]. Verarbeitung auf einer nach ISO 27001 zertifizierten Infrastruktur von Hetzner in Falkenstein. Text wird im Arbeitsspeicher verarbeitet; der Verlauf ist deaktiviert.“
Schützen Sie die Verarbeitung bei der Anwendung des Modells
Artikel 10 konzentriert sich auf Trainingsdaten. Die DSGVO gilt aber auch für die Verarbeitung bei der Anwendung eines Modells. Wenn Ihr Hochrisiko-KI-System dabei personenbezogene Daten verarbeitet, etwa eine medizinische KI bei der Analyse von Patientenakten oder eine KI für die Personalarbeit bei der Sichtung von Lebensläufen, verlangt Artikel 25 DSGVO technische Maßnahmen zur Minimierung der Verarbeitung personenbezogener Daten.
Bei RAG-Verfahren (Retrieval-Augmented Generation), die Dokumente mit personenbezogenen Daten abrufen und an ein großes Sprachmodell (LLM) weitergeben, sorgt einheitliche Pseudonymisierung dafür, dass das Modell die ursprünglichen personenbezogenen Daten nie sieht. anonymize.solutions unterstützt die umkehrbare Zuordnung: Sie können Daten vor der Verarbeitung durch das Sprachmodell pseudonymisieren und die Antwort anschließend wieder Personen zuordnen, um berechtigten Nutzern personalisierte Ergebnisse bereitzustellen.
Richten Sie eine laufende Überwachung ein
Artikel 72 der EU-KI-Verordnung verlangt die Überwachung von Hochrisiko-KI-Systemen nach dem Inverkehrbringen. Ihre Pflichten zur Daten-Governance enden nicht mit der Bereitstellung. Jede neue Charge von Trainingsdaten, die beim weiteren Training oder erneuten Training hinzukommt, muss denselben Anonymisierungsablauf durchlaufen. Binden Sie die Prüfung auf personenbezogene Daten als Qualitätskontrolle in Ihre Abläufe für den Betrieb von Modellen (MLOps) ein: Keine Trainingscharge sollte ohne einen Prüfbericht ohne Befund in Ihre Trainingsumgebung gelangen.
So prüfen Sie Ihre öffentliche KI-Dokumentation
Modellbeschreibungen, README-Dateien, Datenblätter und technische Dokumentationen werden als mögliche Quellen offengelegter personenbezogener Daten häufig übersehen. Forschende nehmen oft echte Beispielausgaben mit personenbezogenen Daten auf oder verweisen in ihrer Dokumentation auf echte Beispiele aus Datensätzen.
Prüfen Sie Ihre öffentlich zugängliche KI-Dokumentation mit piisafe.eu, einer Website-Prüfung auf personenbezogene Daten mit kostenloser Oberfläche. Für die Erkennung benötigen Sie einen anonym.legal-API-Schlüssel ab 3 € pro Monat. Bewahren Sie die Prüfergebnisse zusammen mit Ihrer technischen Dokumentation auf.
Prüfliste für die technische Dokumentation nach Artikel 11
Artikel 11 und Anhang IV legen die Anforderungen an die technische Dokumentation für Hochrisiko-KI-Systeme fest. Bevor Ihre Hochrisiko-Pflichten gelten, bei Systemen nach Anhang III ab dem 2. Dezember 2027, sollten Sie Folgendes für eine behördliche Prüfung vorbereitet und verfügbar haben:
- Allgemeine Beschreibung des KI-Systems: Zweckbestimmung, Versionsverlauf und Einsatzumfeld
- Entwurf und Architektur: Systemkomponenten, Datenflussdiagramme und Trainingsinfrastruktur
- Daten-Governance für Trainingsdaten nach Artikel 10: Quellen, Vorverarbeitungsschritte, Methode zur Anonymisierung personenbezogener Daten und Bewertung von Verzerrungen
- Validierung und Tests: Genauigkeitswerte, Leistung für verschiedene Bevölkerungsgruppen und Bewertungsdatensätze
- Risikomanagement nach Artikel 9: erkannte Risiken, Maßnahmen zur Risikominderung und Bewertung verbleibender Risiken
- Plan für die Überwachung nach dem Inverkehrbringen: überwachte Kennzahlen, Verfahren zur Weiterleitung von Vorfällen und Aktualisierungsrhythmus
DSGVO und EU-KI-Verordnung: beide Vorgaben erfüllen
Viele Organisationen behandeln die EU-KI-Verordnung als eigenständiges Projekt zur Einhaltung von Vorgaben und übersehen dabei eine Möglichkeit, Arbeit wiederzuverwenden. Anonymisierungsarbeiten für die DSGVO können auch für die EU-KI-Verordnung genutzt werden:
- Erwägungsgrund 26 der DSGVO nimmt anonymisierte Daten vom Anwendungsbereich der DSGVO aus. Entscheidend sind dabei „alle Mittel“, die zur Identifizierung einer Person „nach allgemeinem Ermessen wahrscheinlich genutzt werden“.
- Artikel 4a der EU-KI-Verordnung, zuvor Artikel 10 Absatz 5, nennt synthetische oder anonymisierte Daten („einschließlich synthetischer oder anonymisierter Daten“) als erste Wahl, bevor besondere Kategorien personenbezogener Daten zur Erkennung von Verzerrungen verarbeitet werden dürfen.
Eine Anonymisierung nach Maßgabe der DSGVO unterstützt Ihre Daten-Governance nach Artikel 10, erfüllt dessen Anforderungen allein aber nicht. Der Artikel verlangt außerdem dokumentierte Verfahren zur Daten-Governance, Prüfungen auf Relevanz und Repräsentativität sowie Untersuchungen auf Fehler und Verzerrungen. Organisationen mit bestehenden Anonymisierungsprogrammen für die DSGVO können diese Arbeit als einen Teil davon wiederverwenden.
Bußgelder sind keine bloße Theorie
Einige Teams für die Einhaltung rechtlicher Vorgaben behandeln die EU-KI-Verordnung als Zukunftsthema und erwarten in den ersten Jahren eine zurückhaltende Durchsetzung. Diese Annahme ist gefährlich. Die Datenschutzbehörden der EU haben bei der DSGVO gezeigt, dass sie hohe Bußgelder verhängen. Deren Höhe nahm mit der Zeit zu: Google 50 Mio. € (CNIL, 2019), Amazon 746 Mio. € (luxemburgische CNPD, 2021), Meta 1,2 Mrd. € (irische DPC, 2023).
Die EU-KI-Verordnung sieht in jedem Mitgliedstaat eigene nationale Marktüberwachungsbehörden vor, die mit ihrer Durchsetzung betraut sind. Das Europäische Amt für künstliche Intelligenz koordiniert die grenzüberschreitende Durchsetzung. Während sich die frühe Durchsetzung der DSGVO auf Datenschutzverletzungen konzentrierte, können bei der EU-KI-Verordnung auch Beschwerden zivilgesellschaftlicher Organisationen, Hinweise von Hinweisgebern und Eingaben von Wettbewerbern Maßnahmen auslösen. Jeder dieser Wege könnte Ihr KI-System früher als erwartet in den Blick der Behörden rücken.
Fazit: Beginnen Sie jetzt statt in letzter Minute
Mit der näher rückenden Frist wird die verfügbare Zeit knapper. Eine vollständige Prüfung der Trainingsdaten dauert für ein mittelgroßes Team für maschinelles Lernen (ML) 2 bis 4 Wochen. Die Umsetzung eines Anonymisierungsablaufs benötigt weitere 1 bis 2 Wochen. Für die Dokumentation kommt eine Woche hinzu. Die rechtliche Prüfung der technischen Dokumentation benötigt noch eine Woche. Insgesamt sind das geschätzt etwa 5 bis 8 Wochen. Die tatsächliche Dauer hängt vom Datenumfang, der Risikoeinstufung des Systems und der Tiefe der rechtlichen Prüfung ab.
Kostenloser erster Schritt: Prüfen Sie noch heute Ihre öffentliche KI-Dokumentation mit piisafe.eu. Die Oberfläche ist kostenlos; für die Erkennung personenbezogener Daten benötigen Sie einen anonym.legal-API-Schlüssel ab 3 € pro Monat. Kontaktieren Sie anschließend unser Team, um die Umsetzung eines Anonymisierungsablaufs für Ihre Trainingsdaten vor Ablauf der Frist zu besprechen.