Zurück zur Übersicht
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
OpenAI hat seine frühere Empfehlung für den Coding-Benchmark SWE-Bench Pro zurückgenommen. Nach einem internen Audit sind rund 30 Prozent der öffentlichen Aufgaben fehlerhaft und bilden die Leistungsfähigkeit von KI-Modellen deshalb nicht zuverlässig ab.
Zu den festgestellten Problemen zählen versteckte Anforderungen, widersprüchliche Vorgaben, übermäßig strenge Tests und unvollständige Bewertungskriterien. OpenAI prüfte die Aufgaben mit modellbasierten Prüfagenten und ließ sie zusätzlich von fünf erfahrenen Softwareentwicklern bewerten.
Die Kehrtwende kommt wenige Monate nach OpenAIs Empfehlung von SWE-Bench Pro als belastbarere Alternative zu SWE-bench Verified. Für Anbieter und Käufer von Coding-Agenten ist das ein weiterer Beleg dafür, dass Benchmarkzahlen ohne Prüfung der Aufgabenqualität wenig wert sind. Eine schöne Rangliste ersetzt eben keine saubere Messung.
Weiterlesen
Nach Angaben des Unternehmens nutzten mutmaßlich aus Russland gesteuerte Konten ChatGPT, um Beiträge für soziale Netzwerke zu erstellen und eine vermeintliche Expertenorganisation aufzubauen. Die Kampagne zielte unter anderem auf Debatten über die Ukraine, die EU und die deutsche Bundesregierung.
Eine Untersuchung des Pew Research Center deutet darauf hin, dass KI bereits einen erheblichen Teil neu veröffentlichter Webinhalte prägt. Dafür wurden fast 500.000 englischsprachige Webseiten aus dem Common-Crawl-Archiv analysiert.
Amazon Web Services reduziert die Preise für OpenAIs GPT-5.6 Sol auf seiner Plattform Amazon Bedrock. Der Rabatt gilt laut AWS zunächst mindestens bis zum 21. November 2026.
Das neue Strategic-Futures-Team untersucht, wie freie Gesellschaften individuelle Rechte und politische Handlungsfähigkeit angesichts transformativer KI bewahren können. Im Mittelpunkt steht die mögliche Konzentration wirtschaftlicher, politischer und technologischer Macht.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.