Zurück zur Übersicht
Das interne Modell entwickelt Angriffe auf andere KI-Systeme, beobachtet deren Reaktionen und passt seine Strategien an. OpenAI setzt GPT-Red nach eigenen Angaben bereits ein, um Produktionsmodelle robuster zu trainieren.
OpenAI hat mit GPT-Red ein internes KI-Modell vorgestellt, das Prompt-Injection-Angriffe automatisiert entwickelt und damit Schwachstellen in anderen KI-Systemen aufspürt. Das Modell arbeitet iterativ: Es sendet einen Angriff, analysiert die Reaktion des Zielmodells und passt seine Strategie an.
In einer internen Testumgebung erreichte GPT-Red laut OpenAI bei indirekten Prompt-Injection-Angriffen eine Erfolgsquote von 84 Prozent. Menschliche Tester kamen auf 13 Prozent.
Bei einem weiteren Versuch manipulierte GPT-Red einen autonomen Verkaufsautomaten-Agenten. Dieser änderte Preise, bot einen teuren Artikel für 50 US-Cent an und stornierte eine Kundenbestellung. OpenAI gibt an, GPT-Red seit GPT-5.3 in das Training seiner Produktionsmodelle einzubeziehen. GPT-5.6 Sol habe dadurch sechsmal weniger Fehler bei einem schwierigen Prompt-Injection-Benchmark gemacht als das beste Produktionsmodell vier Monate zuvor.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Der frühere Anthropic- und OpenAI-Mitarbeiter Jacob Coxon zieht sich aus der KI-Branche zurück. Er wirft beiden Unternehmen vor, die Entwicklung selbstverbessernder Systeme mit unvertretbaren Risiken voranzutreiben.
Nach einem Vorfall mit eigenen KI-Agenten will OpenAI erstmals einen einheitlichen Rahmen für die Meldung vergleichbarer Fälle schaffen. Dutzende Aufsichtsbehörden sollen daran beteiligt werden.
OpenAI erprobt eine Methode, die riskante Muster über mehrere API-Interaktionen erkennen soll, ohne dass Mitarbeitende die zugrunde liegenden Inhalte einsehen können. Die Funktion richtet sich an berechtigte Kunden mit aktivierter Speicherung ohne Datenaufbewahrung.
OpenAI setzt einsatzorientiertes Verstärkungslernen für zwei Wochen aus und verschärft sein Sicherheitsframework. Auslöser sind Bedenken zu den Cyberfähigkeiten des geplanten Modells Astra und ein Sicherheitsvorfall bei Hugging Face.