KI-E-Mail-Zusammenfasser, Prompt-Injektionen

KI-E-Mail-Zusammenfasser: Prompt-Injektionen manipulieren Antworten ohne Tarntext

Veröffentlicht am: 29.09.2026 um 23:53 Uhr | Redaktion boerse-global.de

OpenAI demonstriert selbstverbreitende Prompt-Angriffe in Tests und empfiehlt Kontrollen; Vorfälle in aktiven Produktionssystemen wurden nicht beobachtet.

OpenAI zeigt, wie Prompt-Injektionen KI-Agenten weiterreichen können
Dunkler Serverraum mit leuchtenden Glasfaserkabeln unter transparenten Bodenplatten. Illustration mit AI erstellt.

OpenAI hat neue Forschungsergebnisse veröffentlicht, die Sicherheitsrisiken beim Einsatz von Künstlicher Intelligenz zur Verarbeitung von elektronischer Post aufzeigen.

Die Untersuchung demonstriert, dass indirekte Prompt-Injektionen KI-basierte E-Mail-Zusammenfasser manipulieren können, ohne dass Angreifer dazu auf versteckten Text zurückgreifen müssen. Der Bericht beschreibt dabei Angriffsanweisungen, die sich wie ein klassischer Computerwurm autonom zwischen vernetzten KI-Systemen verbreiten können.

Wurmartige Weitergabe über mehrere Stationen

Das zugrundeliegende Prinzip beruht darauf, dass ein KI-Agent die schädliche Angriffsanweisung aus einer empfangenen Eingabe ausliest und in seine eigene Antwort einfügt.

Anzeige

Die wachsende Vernetzung von KI-Systemen in Unternehmen schafft neue Einfallstore für Cyberkriminelle, die herkömmliche Sicherheitsmaßnahmen umgehen. Dieser kostenlose Report klärt darüber auf, welche rechtlichen Pflichten und technologischen Bedrohungen im Kontext moderner KI-Anwendungen jetzt für Unternehmer relevant sind. Gratis-E-Book zu aktuellen Cyber-Security-Trends anfordern

Auf diese Weise wird der Schadcode an nachgelagerte Agenten weitergereicht, die diese Ausgabe wiederum verarbeiten und die Anweisungen ebenfalls übernehmen. In einem E-Mail-Test kopierte ein Agent versteckte Anweisungen in seine Antwort und konnte sie so an den nächsten Agenten weitergeben.

Neben dem E-Mail-Verkehr überprüfte OpenAI weitere Übertragungswege: Demonstriert wurden Infektionsketten über das Dateisystem, über Codekommentare sowie über mehrstufige Slack-Nachrichten. In einer durchgeführten Evaluation unter Verwendung des Modells GPT-5.5 führte die Manipulation dazu, dass eine interne Belohnungswährung an einen Kollegen gesendet und eine infizierte Nachricht erneut veröffentlicht wurde.

Anzeige

Wer KI-Systeme im Betrieb einsetzt oder entwickelt, muss neben technischen Risiken auch die strengen Anforderungen des EU AI Acts berücksichtigen. Ein praxisnaher Leitfaden hilft dabei, Risikoklassen richtig einzustufen und die notwendige Dokumentation rechtssicher zu erstellen. Kostenlosen Umsetzungsleitfaden zur KI-Verordnung herunterladen

Das Unternehmen betonte, dass in dem Bericht keine konkreten Produktionsvorfälle genannt werden. Die selbstreplizierende Prompt-Injektion sei kontrolliert demonstriert worden. Außerhalb simulierter Tool-Aufrufe während der Trainings- und Evaluationsphasen habe es keine Auswirkungen gegeben; in aktiven Produktionssystemen wurde das Phänomen laut OpenAI nicht beobachtet.

Abwehrmaßnahmen und Grenzen technischer Kontrollen

Um derartige Ausbreitungsmechanismen einzudämmen, trainiert OpenAI das Sicherheitsmodell GPT-Red gezielt auf Selbstreplikation. Das Unternehmen beabsichtigt, entsprechende Replikationsmuster künftig fest in die GPT-Red-Trainings einzubeziehen, um Modelle gegen solche Manipulationen robuster zu machen.

Zusätzlich formulierte OpenAI empfohlene Kontrollmechanismen für den Betrieb agentenbasierter Architekturen. Dazu zählt die Vorgabe, generierte Ausgaben vor einer Weiterleitung an nachfolgende Systeme zu bereinigen. Zudem sollten gespeicherte Modellausgaben grundsätzlich als nicht vertrauenswürdig behandelt werden.

Um Kettenreaktionen zu verhindern, rät OpenAI dazu, die Länge automatisierter Modellketten technisch zu begrenzen und Systeme gezielt auf wiederholte Payloads zu überwachen. Zugleich stellte das Unternehmen klar, dass dieses Verfahren keine Immunität gegen Angriffe garantiert.

Disclaimer...

de | wissenschaft | 70201119 |