Der verbreitetste Irrtum bei KI-Projekten lautet: Je mehr Kontext das System bekommt, desto besser wird es. Für personenbezogene Daten gilt das Gegenteil. Jede Angabe, die nicht für den konkreten Zweck erforderlich ist, verbessert das Ergebnis selten, erhöht aber den Erklärungsbedarf gegenüber Betroffenen, Aufsichtsbehörden und dem eigenen Datenschutzbeauftragten.
Dieser Beitrag bietet unternehmerische und technische Orientierung. Rechtliche Pflichten müssen für den konkreten Einsatz durch qualifizierte Stellen geprüft werden.
Vier Orte, an denen personenbezogene Daten auftauchen
Wer nur an den Prompt denkt, übersieht drei weitere Stellen:
- Eingaben: Texte, hochgeladene Dokumente, kopierte E-Mails und Tabellen mit Namen, Kontaktdaten oder Bewertungen.
- Wissensbasis: Verträge, Tickets, Gesprächsnotizen und Personalunterlagen, die ein Retrieval-System durchsuchbar macht, oft ohne Rücksicht auf bestehende Zugriffsrechte.
- Protokolle: Chatverläufe, Anbieterlogs, Monitoring-Daten und Fehlerberichte, in denen Eingaben und Ausgaben vollständig gespeichert bleiben.
- Ausgaben: Zusammenfassungen, die Namen und Einschätzungen über Personen enthalten und anschließend in Dokumente, E-Mails oder CRM-Felder übernommen werden.
Die Speicherdauer von Protokollen und der Zugriff darauf werden in Projekten am häufigsten vergessen, obwohl sie technisch am einfachsten zu regeln sind.
Warum Anonymität keine technische Eigenschaft ist
Der Europäische Datenschutzausschuss hat in seiner Stellungnahme zu KI-Modellen klargestellt, dass die Frage, ob ein Modell als anonym gilt, im Einzelfall zu prüfen ist und nicht pauschal aus der technischen Form folgt. Für die meisten mittelständischen Unternehmen, die Modelle nutzen statt sie zu trainieren, ist eine andere Frage relevanter: Was geschieht mit den Daten, die in Eingaben und Protokollen landen, und ob sie beim Anbieter zur Weiterentwicklung verwendet werden.
Prüffragen vor der Werkzeugauswahl
| Frage | Warum sie zählt | Antwort, die Nacharbeit auslöst |
|---|---|---|
| Welcher konkrete Zweck wird verfolgt? | Zweckbindung | „Allgemeine Effizienzsteigerung“ |
| Welche Daten sind dafür zwingend nötig? | Datenminimierung | „Wir geben den ganzen Datensatz hinein“ |
| Wo werden Eingaben gespeichert und wie lange? | Speicherbegrenzung, Auftragsverarbeitung | „Das regelt der Anbieter“ |
| Werden Eingaben zum Training genutzt? | Kontrolle über Weiterverarbeitung | „Standardeinstellung“ |
| Wer kann Protokolle einsehen? | Zugriffskontrolle | „Alle Administratoren“ |
| Wie werden Auskunft, Berichtigung und Löschung umgesetzt? | Betroffenenrechte | „Noch nicht geklärt“ |
Jede Antwort aus der rechten Spalte bedeutet nicht, dass das Vorhaben scheitert. Sie bedeutet, dass die Entscheidung noch nicht getroffen werden kann.
Beispiel: Bewerbungen strukturieren, ohne sie zu bewerten
Eine Personalabteilung möchte eingehende Bewerbungen schneller sichten. Lebensläufe enthalten regelmäßig Angaben, die zu den besonders geschützten Kategorien zählen, etwa zu Gesundheit oder Religion. Systeme, die Bewerber auswählen oder bewerten, zählen im AI Act zudem zu den Hochrisiko-Anwendungen mit eigenen Pflichten.
Eine tragfähige Lösung beschränkt den Einsatz deshalb auf das Übertragen der vom Bewerber selbst angegebenen Qualifikationen in eine einheitliche Vorlage, ohne Bewertung, Rangfolge oder Empfehlung. Die Sichtung bleibt vollständig bei Menschen. Der Zweck ist dokumentiert, die verarbeiteten Felder sind benannt, die Protokolle werden nach Abschluss des Verfahrens gelöscht, und die datenschutzrechtliche Prüfung erfolgt vor dem ersten Einsatz. Das ist weniger spektakulär als eine automatische Vorauswahl und deutlich einfacher zu verantworten.
Datenminimierung als Designentscheidung
- Namen und Kennungen vor der Eingabe durch Platzhalter ersetzen, wenn die Aufgabe sie nicht benötigt.
- Nur die Felder übergeben, die für die Antwort gebraucht werden, statt vollständiger Datensätze.
- Wissensbasen nach Zugriffsrechten trennen, damit ein Retrieval-System keine Berechtigungen aushebelt.
- Protokolle mit fester Löschfrist und benanntem Zugriffskreis konfigurieren.
- Ausgaben, die Aussagen über Personen enthalten, vor der Übernahme in Systeme prüfen.
Weniger Daten sind kein Qualitätsverlust. Ein Modell, das eine Serviceanfrage beantworten soll, braucht den Anfragetext und die Produktinformation, nicht die vollständige Kundenhistorie. Der Kontext, der tatsächlich hilft, ist fast immer kleiner als der Kontext, der verfügbar wäre.
Wer welche Entscheidung trifft
Der Fachbereich legt Zweck und zwingend notwendige Daten fest. Die IT verantwortet Speicher-, Zugriffs- und Löschwege. Datenschutzbeauftragte oder externe Berater bewerten Rechtsgrundlage und die Notwendigkeit einer Datenschutz-Folgenabschätzung. Diese Aufteilung funktioniert nur, wenn die Anwendung vorher im KI-Inventar beschrieben wurde und Mitarbeiter eine einfache Datenampel kennen, bevor sie etwas in ein Eingabefeld kopieren.