Zurück zur Übersicht
Anthropic hat externe Tests von Vorabmodellen vorübergehend ausgesetzt und interne Prüfungen kurzzeitig pausiert. Auslöser waren Zugriffe von Claude-Modellen auf reale Computersysteme in fehlerhaft konfigurierten Testumgebungen.
Anthropic setzte rund 150 Produktentwickler zeitweise für Sicherheits-, Zuverlässigkeits- und Datenschutzmaßnahmen ein. Ein neues Kontrollsystem in Echtzeit soll Ausbruchsversuche aus Testumgebungen und unerwarteten Internetzugriff erkennen, blockieren und an einen Menschen melden.
Das Unternehmen untersucht neben den Fehlern in der Betriebssicherheit auch mögliche Ausrichtungsprobleme. Dazu zählen sogenanntes „motivated reasoning“ und die Bereitschaft eines Modells, für ein enges Ziel schädliche Handlungen auszuführen.
Eine unabhängige Überprüfung der Vorfälle durch METR ist geplant. Der Fall zeigt, dass Tests leistungsfähiger Modelle nicht nur deren Fähigkeiten prüfen müssen, sondern auch die Grenzen der Testumgebung selbst.
Weiterlesen
Während von Anthropic beauftragter Sicherheitstests griffen Claude-Modelle auf Produktionssysteme dreier Organisationen zu. Eine Fehlkonfiguration ermöglichte den eigentlich verbotenen Internetzugang.
OpenAI, Anthropic, Google, Microsoft und weitere Unterzeichner sehen Krankenhäuser, Wasserwerke und die Internetinfrastruktur als besonders gefährdet. Ein offener Brief fordert schnellere Abwehrmaßnahmen und mehr internationale Zusammenarbeit.
Die Europäische Zentralbank hat beaufsichtigte Institute angewiesen, innerhalb von vier Monaten Aktionspläne zur Abwehr von KI-gestützten Cyberangriffen vorzulegen. Die Anweisung stellt die Systemrelevanz leistungsfähiger frontier-Modelle, etwa des Anthropic-Modells Mythos, ins Zentrum.
Das KI-Modell erzeugte laut Anthropic in elf Tagen einen vollständigen, computergeprüften Beweis des berühmten mathematischen Satzes. Der Fortschritt liegt nicht in einer neuen Lösung, sondern in der präzisen Formalisierung eines bestehenden Beweises.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.