Zurück zur Übersicht
OpenAI legt ein Leitfaden für unabhängige Evaluierungen von Frontier-Modellen vor. Im Zentrum stehen valide Testumgebungen, sogenannte Harnesses, und Prüfungen, die bei agentischen Systemen nicht das Setup statt die Modellleistung messen.
OpenAI hat ein Playbook für vertrauenswürdige Drittprüfungen von Frontier-Modellen veröffentlicht. Der Leitfaden soll unabhängige Evaluierungen systematischer machen und legt den Schwerpunkt auf belastbare Testumgebungen.
Im Kern fordert OpenAI valide Harnesses und klare Validitätsprüfungen, vor allem für agentische Systeme. Solche Modelle lassen sich nach Darstellung des Unternehmens nur dann sinnvoll bewerten, wenn die Tests die tatsächlichen Fähigkeiten abbilden.
Damit rückt eine oft unterschätzte Frage nach vorn: Nicht nur die Modelle müssen besser werden, sondern auch die Messmethoden. Wer KI im Ernstfall einsetzen will, braucht Benchmarks, die mehr leisten als glänzende Scorecards.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Microsoft bringt die Modelle von xAI zunächst als Vorschau in seine Copilot Anwendungen. Der Zugang bleibt in der Europäischen Union, der EFTA und im Vereinigten Königreich vorerst ausgeschlossen.
US-Präsident Donald Trump setzt im Wettbewerb mit China auf eine schnelle Entwicklung künstlicher Intelligenz. Zugleich hält er begrenzte Leitplanken für möglich, nennt Warnungen vor künftigen Risiken aber übertrieben.
OpenAI-Chef Sam Altman schließt einen Börsengang des Unternehmens im Jahr 2026 aus. Als Grund nennt er unter anderem offene Fragen zur Sicherheit und Ausrichtung leistungsfähiger KI-Systeme.
Die öffentliche Beta macht den von Codex genutzten Agenten-Harness für Entwickler zugänglich. Die Schnittstelle verwaltet Kontext, Werkzeuge und parallel arbeitende Teilagenten über längere Arbeitsabläufe hinweg.