Eine neue Kategorie von Sicherheitsrisiken bei generativer KI ist ins Visier von Sicherheitsforschern gerückt: OpenAI hat eine Variante der Prompt-Injection entdeckt, die sich selbst replizieren kann. Im Gegensatz zu klassischen Prompt-Injections, bei denen ein Nutzer versucht, ein KI-Modell durch geschickt formulierte Eingaben zu manipulieren, zeigt diese neue Form bemerkenswerte Eigenschaften.
Die selbstreplizierenden Prompt-Injections verhalten sich ähnlich wie Computerwürmer: Sie können sich in verschiedenen Teilen eines Systems ausbreiten und dabei ihre Anweisungen weitergeben, ohne dass ein Benutzer aktiv eingreifen muss. OpenAI entdeckte das Problem während des Trainings und Tests mit Prompt-Injections und warnte davor, dass diese Technik ernsthafte Sicherheitsbedenken birgt.
Das Risiko besteht vor allem darin, dass KI-Agenten, die in Zukunft eigenständig Aufgaben im Unternehmen ausführen sollen, durch solche Injections manipuliert werden könnten. Ein Agent könnte dann nicht nur seine ursprüngliche Aufgabe verfälschen, sondern auch andere Systeme oder Agenten infizieren. Dies könnte zu unkontrolliertem Verhalten oder zu unbefugten Aktionen führen.
Für KMU mit IT-Infrastrukturen, die zunehmend KI-basierte Werkzeuge einsetzen, ist dies ein wichtiges Warnzeichen. Es unterstreicht die Notwendigkeit, KI-Systeme nicht ohne Überwachung und Kontrollmechanismen einzuführen. Unternehmen sollten abwägen, welche Aufgaben sie KI-Agenten übertragen und welche Schutzmassnahmen nötig sind. Sicherheitsaudits und Testphasen sollten vor der produktiven Nutzung durchgeführt werden, um solche Risiken zu minimieren.
