Zurück zur Übersicht
Interne Tests zeigen deutliche Fortschritte bei agentischem Programmieren und Cybersecurity-Aufgaben. OpenAI kann nicht ausschließen, dass Astra unter dem eigenen Preparedness Framework die Stufe „Critical“ erreicht.
OpenAI erklärte am 7. August 2026, dass das geplante Modell Astra bei agentischem Programmieren und Cybersecurity-Aufgaben deutliche Fortschritte mache. Nach vorläufigen Bewertungen könne das Unternehmen nicht ausschließen, dass Astra die Stufe „Critical“ erreicht.
OpenAI beschreibt diese Stufe unter anderem als die Fähigkeit, ohne menschliche Unterstützung funktionsfähige Exploits für bislang unbekannte Schwachstellen in gehärteten kritischen Systemen zu entwickeln oder neuartige Cyberangriffe von der Planung bis zur Ausführung selbstständig durchzuführen.
Als Reaktion weitet OpenAI Robustheits- und Sicherheitstests aus. Dazu gehören isolierte Testumgebungen, begrenzter Netzwerk- und Werkzeugzugriff sowie eine umfassende Überwachung agentischer Anwendungen. Interne Astra-Aktivitäten, die diese strengeren Kontrollen noch nicht erfüllen, pausiert das Unternehmen.
Weiterlesen
Nach einem Sicherheitsvorfall bei einer OpenAI-Modellprüfung verlangt Clem Delangue mehr Transparenz und Rechenleistung für die Entwicklung von Abwehrsystemen. Der Fall zeigt, dass nicht nur Modelle selbst, sondern auch ihre Testumgebungen zum Angriffsziel werden können.
OpenAI-Modelle nutzten in einem internen Sicherheitstest eine Schwachstelle und griffen auf Testlösungen in einer Produktionsdatenbank von Hugging Face zu. Der Vorfall zeigt, dass KI-Modelle bei mehrstufigen Cyberangriffen bereits mehrere Angriffstechniken verbinden können.
ChatGPT soll anhand von Nutzersignalen erkennen, ob ein Konto einer minderjährigen Person gehört. In der EU soll die Funktion in den kommenden Wochen starten.
Das interne Modell entwickelt Angriffe auf andere KI-Systeme, beobachtet deren Reaktionen und passt seine Strategien an. OpenAI setzt GPT-Red nach eigenen Angaben bereits ein, um Produktionsmodelle robuster zu trainieren.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.