Zurück zur Übersicht
Ein Themenbrief des unabhängigen internationalen Wissenschaftspanels zu KI beschreibt einen Vorfall bei OpenAI und Hugging Face als deutliches Warnsignal. Die beteiligten Agenten sollen Sicherheitsbeschränkungen umgangen, Bewertungen manipuliert und Teile von Systemen kompromittiert haben.
Zwischen Mai und Juli umgingen KI-Agenten laut dem Bericht in Cybersecurity-Trainings und Evaluierungen von OpenAI Netzwerkbeschränkungen. Sie kommunizierten über getrennte Testläufe hinweg, manipulierten eine Bewertung und kompromittierten Teile der Systeme von OpenAI und Hugging Face. Menschen hatten diese einzelnen Schritte demnach nicht angewiesen.
Der Bericht nennt keine konkrete Wahrscheinlichkeit für einen schwerwiegenden Kontrollverlust. Er warnt jedoch, dass leistungsfähigere Agenten leichter Schlupflöcher finden, Sicherheitsmaßnahmen umgehen und ihre Aktivitäten verschleiern könnten.
Dass der Vorfall eingedämmt werden konnte, ist deshalb kein Entwarnungssignal. Es zeigt zunächst nur, dass die Kontrolle unter den damaligen Bedingungen funktioniert hat. Ob das auch für deutlich leistungsfähigere Agenten gilt, bleibt offen. Genau diese Lücke macht autonome Systeme sicherheitspolitisch relevant.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
OpenAI setzt einsatzorientiertes Verstärkungslernen für zwei Wochen aus und verschärft sein Sicherheitsframework. Auslöser sind Bedenken zu den Cyberfähigkeiten des geplanten Modells Astra und ein Sicherheitsvorfall bei Hugging Face.
Nach einem Sicherheitsvorfall bei einer OpenAI-Modellprüfung verlangt Clem Delangue mehr Transparenz und Rechenleistung für die Entwicklung von Abwehrsystemen. Der Fall zeigt, dass nicht nur Modelle selbst, sondern auch ihre Testumgebungen zum Angriffsziel werden können.
OpenAI-Modelle nutzten in einem internen Sicherheitstest eine Schwachstelle und griffen auf Testlösungen in einer Produktionsdatenbank von Hugging Face zu. Der Vorfall zeigt, dass KI-Modelle bei mehrstufigen Cyberangriffen bereits mehrere Angriffstechniken verbinden können.
Der frühere Anthropic- und OpenAI-Mitarbeiter Jacob Coxon zieht sich aus der KI-Branche zurück. Er wirft beiden Unternehmen vor, die Entwicklung selbstverbessernder Systeme mit unvertretbaren Risiken voranzutreiben.