KI-E-Mail-Zusammenfasser: Prompt-Injektionen manipulieren Antworten ohne Tarntext
Veröffentlicht am: 29.09.2026 um 23:53 Uhr | Redaktion boerse-global.de
OpenAI hat neue Forschungsergebnisse veröffentlicht, die Sicherheitsrisiken beim Einsatz von Künstlicher Intelligenz zur Verarbeitung von elektronischer Post aufzeigen.
Die Untersuchung demonstriert, dass indirekte Prompt-Injektionen KI-basierte E-Mail-Zusammenfasser manipulieren können, ohne dass Angreifer dazu auf versteckten Text zurückgreifen müssen. Der Bericht beschreibt dabei Angriffsanweisungen, die sich wie ein klassischer Computerwurm autonom zwischen vernetzten KI-Systemen verbreiten können.
Wurmartige Weitergabe über mehrere Stationen
Das zugrundeliegende Prinzip beruht darauf, dass ein KI-Agent die schädliche Angriffsanweisung aus einer empfangenen Eingabe ausliest und in seine eigene Antwort einfügt.
Die wachsende Vernetzung von KI-Systemen in Unternehmen schafft neue Einfallstore für Cyberkriminelle, die herkömmliche Sicherheitsmaßnahmen umgehen. Dieser kostenlose Report klärt darüber auf, welche rechtlichen Pflichten und technologischen Bedrohungen im Kontext moderner KI-Anwendungen jetzt für Unternehmer relevant sind. Gratis-E-Book zu aktuellen Cyber-Security-Trends anfordern
Auf diese Weise wird der Schadcode an nachgelagerte Agenten weitergereicht, die diese Ausgabe wiederum verarbeiten und die Anweisungen ebenfalls übernehmen. In einem E-Mail-Test kopierte ein Agent versteckte Anweisungen in seine Antwort und konnte sie so an den nächsten Agenten weitergeben.
Neben dem E-Mail-Verkehr überprüfte OpenAI weitere Übertragungswege: Demonstriert wurden Infektionsketten über das Dateisystem, über Codekommentare sowie über mehrstufige Slack-Nachrichten. In einer durchgeführten Evaluation unter Verwendung des Modells GPT-5.5 führte die Manipulation dazu, dass eine interne Belohnungswährung an einen Kollegen gesendet und eine infizierte Nachricht erneut veröffentlicht wurde.
Wer KI-Systeme im Betrieb einsetzt oder entwickelt, muss neben technischen Risiken auch die strengen Anforderungen des EU AI Acts berücksichtigen. Ein praxisnaher Leitfaden hilft dabei, Risikoklassen richtig einzustufen und die notwendige Dokumentation rechtssicher zu erstellen. Kostenlosen Umsetzungsleitfaden zur KI-Verordnung herunterladen
Das Unternehmen betonte, dass in dem Bericht keine konkreten Produktionsvorfälle genannt werden. Die selbstreplizierende Prompt-Injektion sei kontrolliert demonstriert worden. Außerhalb simulierter Tool-Aufrufe während der Trainings- und Evaluationsphasen habe es keine Auswirkungen gegeben; in aktiven Produktionssystemen wurde das Phänomen laut OpenAI nicht beobachtet.
Abwehrmaßnahmen und Grenzen technischer Kontrollen
Um derartige Ausbreitungsmechanismen einzudämmen, trainiert OpenAI das Sicherheitsmodell GPT-Red gezielt auf Selbstreplikation. Das Unternehmen beabsichtigt, entsprechende Replikationsmuster künftig fest in die GPT-Red-Trainings einzubeziehen, um Modelle gegen solche Manipulationen robuster zu machen.
Zusätzlich formulierte OpenAI empfohlene Kontrollmechanismen für den Betrieb agentenbasierter Architekturen. Dazu zählt die Vorgabe, generierte Ausgaben vor einer Weiterleitung an nachfolgende Systeme zu bereinigen. Zudem sollten gespeicherte Modellausgaben grundsätzlich als nicht vertrauenswürdig behandelt werden.
Um Kettenreaktionen zu verhindern, rät OpenAI dazu, die Länge automatisierter Modellketten technisch zu begrenzen und Systeme gezielt auf wiederholte Payloads zu überwachen. Zugleich stellte das Unternehmen klar, dass dieses Verfahren keine Immunität gegen Angriffe garantiert.
