Die Wikimedia Foundation, die Betreiberin von Wikipedia und verwandten Projekten, hat in einer Untersuchung ermittelt, woher die unerwünschten automatisierten Zugriffe auf ihre Infrastruktur stammen. Wikipedia und seine Schwesterseiten erleben regelmässig massenhafte Zugriffe durch KI-Trainings-Bots, die sich Daten für Sprachmodelle einsammeln. Eine aktuelle Analyse zeigt, dass ein grosser Teil dieser Zugriffe auf das OpenAI-Ökosystem zurückzuführen ist.

Dies ist insofern problematisch, als dass solche Zugriffe in grossem Massstab die Server von Wikimedia belasten. Wikimedia wird durch Spenden finanziert und betreibt seine Services nicht gewinnorientiert. Wenn profitorientierte Unternehmen wie OpenAI kostenlos Daten von Wikipedia abgreifen und diese für ihre kommerziellen KI-Modelle nutzen, entsteht eine Asymmetrie. Wikimedia trägt die Infrastrukturkosten, während Dritte davon profitieren.

Dies hat auch rechtliche Implikationen. Viele Länder verfügen über Urheberrechtsschutz für Texte, und Wikipedia-Inhalte unterliegen einer speziellen Lizenz. Die Frage, ob Unternehmen diese Inhalte ohne explizite Genehmigung für KI-Training scrapen dürfen, ist rechtlich umstritten und Gegenstand mehrerer Verfahren weltweit.

Für Unternehmen, die KI-Technologie einsetzen oder entwickeln, ist dies ein wichtiger Punkt. Die Trainingsgrundlagen für KI-Modelle sollten rechtmässig erworben sein. Dies betrifft nicht nur grosse Tech-Firmen, sondern auch kleinere Unternehmen, die ihre eigenen Modelle trainieren möchten. Ein KMU sollte sicherstellen, dass die Trainingsdaten, die es verwendet, entweder selbst generiert, lizenziert oder in rechtmässiger Weise beschafft wurden. Andernfalls können Urheberrechts- und Haftungsprobleme entstehen.