Zurück zur Übersicht
OpenAI legt ein Leitfaden für unabhängige Evaluierungen von Frontier-Modellen vor. Im Zentrum stehen valide Testumgebungen, sogenannte Harnesses, und Prüfungen, die bei agentischen Systemen nicht das Setup statt die Modellleistung messen.
OpenAI hat ein Playbook für vertrauenswürdige Drittprüfungen von Frontier-Modellen veröffentlicht. Der Leitfaden soll unabhängige Evaluierungen systematischer machen und legt den Schwerpunkt auf belastbare Testumgebungen.
Im Kern fordert OpenAI valide Harnesses und klare Validitätsprüfungen, vor allem für agentische Systeme. Solche Modelle lassen sich nach Darstellung des Unternehmens nur dann sinnvoll bewerten, wenn die Tests die tatsächlichen Fähigkeiten abbilden.
Damit rückt eine oft unterschätzte Frage nach vorn: Nicht nur die Modelle müssen besser werden, sondern auch die Messmethoden. Wer KI im Ernstfall einsetzen will, braucht Benchmarks, die mehr leisten als glänzende Scorecards.
Weiterlesen
Nach Angaben des Unternehmens nutzten mutmaßlich aus Russland gesteuerte Konten ChatGPT, um Beiträge für soziale Netzwerke zu erstellen und eine vermeintliche Expertenorganisation aufzubauen. Die Kampagne zielte unter anderem auf Debatten über die Ukraine, die EU und die deutsche Bundesregierung.
Eine Untersuchung des Pew Research Center deutet darauf hin, dass KI bereits einen erheblichen Teil neu veröffentlichter Webinhalte prägt. Dafür wurden fast 500.000 englischsprachige Webseiten aus dem Common-Crawl-Archiv analysiert.
Amazon Web Services reduziert die Preise für OpenAIs GPT-5.6 Sol auf seiner Plattform Amazon Bedrock. Der Rabatt gilt laut AWS zunächst mindestens bis zum 21. November 2026.
Das neue Strategic-Futures-Team untersucht, wie freie Gesellschaften individuelle Rechte und politische Handlungsfähigkeit angesichts transformativer KI bewahren können. Im Mittelpunkt steht die mögliche Konzentration wirtschaftlicher, politischer und technologischer Macht.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.