Zurück zur Übersicht
Ein am 24. März veröffentlichter Benchmark testet agentische KI in turn-basierten Umgebungen statt mit kurzen Einzelantworten. Laut der Arbeit lösen Menschen alle Aufgaben, während Frontier-Modelle unter 1 Prozent bleiben.
ARC-AGI-3 ist ein neuer Benchmark für agentische KI, der am 24. März veröffentlicht wurde. Im Mittelpunkt stehen offene, mehrstufige Aufgaben in turn-basierten Umgebungen.
Die Arbeit zielt damit auf einen anderen Testtyp als klassische Kurzprompt-Benchmarks. Gemessen werden soll, wie gut Systeme Probleme über mehrere Schritte hinweg ausführen und an veränderte Zustände anpassen.
Nach Angaben der Autoren lösen Menschen 100 Prozent der Aufgaben. Frontier-KI-Systeme bleiben demnach unter 1 Prozent.
Die Veröffentlichung setzt damit einen neuen Referenzpunkt für die Bewertung agentischer Systeme. Der Fokus verschiebt sich von punktueller Demo-Leistung auf robuste mehrstufige Problemlösung unter realistischeren Bedingungen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
Das US-Unternehmen trainierte Periodic Neon mit eigenen Labordaten und nutzt es nach eigenen Angaben zur Analyse von Röntgenbeugungsdaten. Die Ergebnisse stammen bislang aus internen Tests und sind nicht unabhängig bestätigt.
Die neuen Modelle sollen während laufender Gespräche komplexe Aufgaben planen und externe Werkzeuge aufrufen. Damit verschiebt sich der Schwerpunkt von Sprachdialogen hin zur Steuerung mehrstufiger Prozesse.
Das Update bringt systemweite Aktionen, kontextbezogene Suche und neue Funktionen für Bildbearbeitung und visuelle Suche. In der Europäischen Union startet Siri AI auf iPhone, iPad und Apple Watch zunächst nicht.