Zurück zur Übersicht
Interne Tests zeigen deutliche Fortschritte bei agentischem Programmieren und Cybersecurity-Aufgaben. OpenAI kann nicht ausschließen, dass Astra unter dem eigenen Preparedness Framework die Stufe „Critical“ erreicht.
OpenAI erklärte am 7. August 2026, dass das geplante Modell Astra bei agentischem Programmieren und Cybersecurity-Aufgaben deutliche Fortschritte mache. Nach vorläufigen Bewertungen könne das Unternehmen nicht ausschließen, dass Astra die Stufe „Critical“ erreicht.
OpenAI beschreibt diese Stufe unter anderem als die Fähigkeit, ohne menschliche Unterstützung funktionsfähige Exploits für bislang unbekannte Schwachstellen in gehärteten kritischen Systemen zu entwickeln oder neuartige Cyberangriffe von der Planung bis zur Ausführung selbstständig durchzuführen.
Als Reaktion weitet OpenAI Robustheits- und Sicherheitstests aus. Dazu gehören isolierte Testumgebungen, begrenzter Netzwerk- und Werkzeugzugriff sowie eine umfassende Überwachung agentischer Anwendungen. Interne Astra-Aktivitäten, die diese strengeren Kontrollen noch nicht erfüllen, pausiert das Unternehmen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Der frühere Anthropic- und OpenAI-Mitarbeiter Jacob Coxon zieht sich aus der KI-Branche zurück. Er wirft beiden Unternehmen vor, die Entwicklung selbstverbessernder Systeme mit unvertretbaren Risiken voranzutreiben.
Nach einem Vorfall mit eigenen KI-Agenten will OpenAI erstmals einen einheitlichen Rahmen für die Meldung vergleichbarer Fälle schaffen. Dutzende Aufsichtsbehörden sollen daran beteiligt werden.
OpenAI erprobt eine Methode, die riskante Muster über mehrere API-Interaktionen erkennen soll, ohne dass Mitarbeitende die zugrunde liegenden Inhalte einsehen können. Die Funktion richtet sich an berechtigte Kunden mit aktivierter Speicherung ohne Datenaufbewahrung.
OpenAI setzt einsatzorientiertes Verstärkungslernen für zwei Wochen aus und verschärft sein Sicherheitsframework. Auslöser sind Bedenken zu den Cyberfähigkeiten des geplanten Modells Astra und ein Sicherheitsvorfall bei Hugging Face.