Zurück zur Übersicht
Ein am 24. März veröffentlichter Benchmark testet agentische KI in turn-basierten Umgebungen statt mit kurzen Einzelantworten. Laut der Arbeit lösen Menschen alle Aufgaben, während Frontier-Modelle unter 1 Prozent bleiben.
ARC-AGI-3 ist ein neuer Benchmark für agentische KI, der am 24. März veröffentlicht wurde. Im Mittelpunkt stehen offene, mehrstufige Aufgaben in turn-basierten Umgebungen.
Die Arbeit zielt damit auf einen anderen Testtyp als klassische Kurzprompt-Benchmarks. Gemessen werden soll, wie gut Systeme Probleme über mehrere Schritte hinweg ausführen und an veränderte Zustände anpassen.
Nach Angaben der Autoren lösen Menschen 100 Prozent der Aufgaben. Frontier-KI-Systeme bleiben demnach unter 1 Prozent.
Die Veröffentlichung setzt damit einen neuen Referenzpunkt für die Bewertung agentischer Systeme. Der Fokus verschiebt sich von punktueller Demo-Leistung auf robuste mehrstufige Problemlösung unter realistischeren Bedingungen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
Microsoft bringt die Modelle von xAI zunächst als Vorschau in seine Copilot Anwendungen. Der Zugang bleibt in der Europäischen Union, der EFTA und im Vereinigten Königreich vorerst ausgeschlossen.
US-Präsident Donald Trump setzt im Wettbewerb mit China auf eine schnelle Entwicklung künstlicher Intelligenz. Zugleich hält er begrenzte Leitplanken für möglich, nennt Warnungen vor künftigen Risiken aber übertrieben.
OpenAI-Chef Sam Altman schließt einen Börsengang des Unternehmens im Jahr 2026 aus. Als Grund nennt er unter anderem offene Fragen zur Sicherheit und Ausrichtung leistungsfähiger KI-Systeme.