KI-Modelle wie ChatGPT oder Gemini haben ihr „Wissen“ größtenteils aus dem Internet gelernt – gesammelt durch sog. Web-Scraping: automatisierte Software, die systematisch Inhalte von Websites ausliest. Der Europäische Datenschutzausschuss (EDSA) hat dazu am 7. Juli 2026 neue Leitlinien (Guidelines 03/2026, Version 1.0) vorgelegt.
Dort stellt der EDSA klar, dass das Scraping öffentlich zugänglicher personenbezogener Daten datenschutzrechtlich nicht ausgeschlossen ist. Neben der Einhaltung der üblichen, geltenden Datenschutzgrundsätzen, wie der Transparenz und der Datenminimierung, kann das Scraping nur dann DSGVO-konform erfolgen, wenn die Voraussetzungen des Art. 6 Abs. 1 S. 1 lit. f DSGVO vorliegen. An die erforderliche Interessenabwägung sind hier hohe Anforderungen gestellt. Im Mittelpunkt steht dabei die Frage, welche „vernünftigen Erwartungen“ (reasonable expectations) die betroffenen Personen hinsichtlich der Verarbeitung ihrer Daten haben.
„Öffentlich“ heißt nicht frei verwendbar
Oftmals herrscht ein Irrglaube, dass Daten, die öffentlich im Netz stehen, frei genutzt werden können. Dies widerlegt der EDSA nun jedoch. Sobald beim Scraping Namen, Fotos oder andere Daten erfasst werden, die sich einer Person zuordnen lassen, gilt die DSGVO unabhängig davon, ob die Daten bspw. aus einem alten Forumsbeitrag oder einem aktuellen Artikel stammen.
Wer ist verantwortlich?
Scrapt jemand im Auftrag eines KI-Entwicklers nach dessen Vorgaben, ist er Auftragsverarbeiter und der Auftraggeber bleibt verantwortlich. Nutzt ein KI-Entwickler einen bereits von einem Dritten erstellten Datensatz, sind Scraper und KI-Entwickler grundsätzlich jeweils eigenständig für ihre eigene Verarbeitung verantwortlich; der Scraper haftet dabei grundsätzlich nicht für die Weiterverwendung durch Dritte. Legen jedoch beide Parteien Zwecke und Mittel gemeinsam fest (z. B. gemeinsame Entscheidung zur Modellentwicklung mit gemeinsam festgelegten Erhebungskriterien), liegt eine gemeinsame Verantwortlichkeit im Sinne des Art. 26 DSGVO vor.
Berechtigtes Interesse als Rechtsgrundlage?
Eine Einwilligung als Rechtsgrundlage heranzuziehen, scheitert beim Scraping daran, dass die Betroffenen dem Verantwortlichen nicht bekannt sind. KI-Entwickler können sich daher auf das berechtigte Interesse gemäß Art. 6 Abs. 1 S. 1 lit. f DSGVO stützen, das drei Voraussetzungen braucht:
- ein echtes, konkretes Interesse;
- tatsächliche Erforderlichkeit der Datenverarbeitung; und
- eine Interessenabwägung, die zugunsten des KI-Entwicklers ausfällt.
Wesentlicher Teil der Interessenabwägung ist die Frage nach den „vernünftigen Erwartungen“ der betroffenen Personen. Hierbei sollen folgende Punkte berücksichtigt werden (vgl. Guidelinies 03/2026, Rn. 64):
- die Art der Quellwebsites (soziale Netzwerke, Online-Foren, Plattformen zur Verbreitung von Datensätzen usw.),
die Art der Veröffentlichung und den öffentlich zugänglichen Charakter der Daten (z. B. hat ein Artikel, der auf einem frei zugänglichen Blog veröffentlicht wurde, einen öffentlicheren Charakter als ein Beitrag in einem sozialen Netzwerk, der mit Zugangsbeschränkungen veröffentlicht wurde).
Als Faustregel gilt:
„Wenn die Daten von der betroffenen Person selbst öffentlich gemacht und für jedermann sichtbar gemacht wurden, ist es wahrscheinlicher, dass die betroffenen Personen vernünftigerweise erwarten können, dass ihre personenbezogenen Daten von anderen verarbeitet werden.“ (übersetzt aus dem Englischen)
- die von der gescrapten Website auferlegten Beschränkungen, z. B. durch die Umsetzung technischer Maßnahmen wie eine Zugriffsauthentifizierung, robots.txt- oder ai.txt-Dateien oder die Implementierung von CAPTCHA, die darauf abzielen, eine nur von Menschen ausführbare Handlung zu erzwingen und Robots den Zugriff auf Seiten zu verwehren,
- die Art und die Merkmale der Beziehung zwischen der betroffenen Person und dem Verantwortlichen: Auch wenn zwischen der betroffenen Person und der Stelle, die das Web-Scraping durchführt oder die gescrapten Daten nutzt, häufig keine direkte Beziehung besteht, können sich Menschen bewusst sein, dass die von ihnen online veröffentlichten Daten von Dritten abgerufen, erhoben und weiterverwendet werden können,
- die Merkmale der betroffenen Personen (Minderjähriger, Person des öffentlichen Lebens, Stellung der betroffenen Person usw.).
Zugunsten des Scrapers wirken Schutzmaßnahmen wie: (1) sicherzustellen, dass risikobehaftete Inhalte/Personengruppen und bestimmte Quellen standardmäßig von der Datenerhebung ausgeschlossen sind; (2) die Erhebung auf frei zugängliche Daten zu beschränken; (3) Schutzmaßnahmen zu etablieren, die zu mehr Transparenz beitragen; (4) die Ausübung der Rechte Einzelner zu erleichtern; (5) personenbezogene Daten so bald wie möglich zu löschen oder zu anonymisieren und zu pseudonymisieren.
Was gilt, wenn besonders sensible Daten verarbeitet werden?
Gesundheitsdaten, Daten über die ethnische Herkunft, politische Meinungen oder sexuelle Orientierung im Sinne des Art. 9 DSGVO dürfen grundsätzlich nicht verarbeitet werden. Da beim breiten Scraping jedoch eine zufällige Miterfassung solcher Daten kaum auszuschließen ist, verlangt der EDSA – angelehnt an ein EuGH-Urteil zu Suchmaschinen –, dass KI-Entwickler alles ihnen Zumutbare tun müssen, um solche Datenverarbeitungen zu verhindern. Dies könne durch entsprechende technische und organisatorische Maßnahmen, wie bspw. durch vorherige Filter, durch anschließende Löschung, durch Tests während der Modellentwicklung und durch Überwachung der Ausgaben im laufenden Betrieb sichergestellt werden.
Fazit
Für Unternehmen, die KI-Modelle trainieren oder Trainingsdaten einkaufen, heißt das konkret: Scraping ist DSGVO-konform möglich, jedoch unter Einhaltung strenger Prüfungsmaßstäbe. So sind die Interessenabwägung und umgesetzten Maßnahmen zu dokumentieren, entsprechende Datenschutzhinweise zu veröffentlichen, technische Sperren zu respektieren und Betroffenenrechte zu ermöglichen. Für die betroffenen Personen zeigen die Leitlinien: Der Datenschutz endet nicht, nur weil personenbezogene Daten im Netz öffentlich einsehbar sind.
Da sich die Leitlinien noch im Entwurfsstadium (Konsultation bis 30. Oktober 2026) befinden, kann sich die finale Fassung noch ändern – die Grundrichtung dürfte aber voraussichtlich bleiben.
Keine Kommentare