Zurück zur Übersicht
LifeSciBench testet KI-Modelle an realistischen Forschungs- und Laboraufgaben. Erste Auswertung zeigt: der beste Modelllauf erreicht nur rund 36 Prozent Task-Passrate, die Reife für autonome Forschung bleibt damit fraglich.
OpenAI hat LifeSciBench veröffentlicht, einen fachlich orientierten Benchmark mit 750 von Expertinnen und Experten verfassten Aufgaben aus mehreren Forschungsworkflows und biologischen Domänen. Die Ankündigung ist Teil der jüngsten Erweiterung der Modellreihe GPT-Rosalind.
Die Auswertung nutzt detaillierte Bewertungsrichtlinien und Hunderttausende Bewertungsdatenpunkte. In der veröffentlichten Auswertung erreichte der bestplatzierte getestete Modelllauf rund 36 Prozent Task-Passrate, viele Aufgaben bleiben damit auch für Spitzenmodelle ungelöst.
Die Verlagerung von einfachen Wissensabfragen zu realitätsnahen, artefaktreichen Forschungsaufgaben erhöht die Aussagekraft von Tests für Pharmafirmen, Forschungslabore und Beschaffer. Die Zahlen legen nahe, dass Modelle zwar Fortschritte zeigen, für eigenständige, unüberwachte Forschungsentscheidungen aber noch nicht verlässlich genug sind.
Weiterlesen
Die Gründer und Teammitglieder von NextSlide sollen künftig an ChatGPT arbeiten. Finanzielle Details der Übernahme wurden nicht veröffentlicht.
In einem Vergleich von zehn KI Assistenten erreichte GPT-5.5 Thinking die höchste Gesamtpunktzahl. Claude Sonnet 4.6 sagte dafür die meisten Gruppenspiele korrekt voraus.
Interne Tests zeigen deutliche Fortschritte bei agentischem Programmieren und Cybersecurity-Aufgaben. OpenAI kann nicht ausschließen, dass Astra unter dem eigenen Preparedness Framework die Stufe „Critical“ erreicht.
Kostenlose und Go Nutzer sollen ab kommender Woche unbegrenzt textbasierte Chats mit GPT 5.6 Luna führen können. Für Dateien, Bilder, Sprache und weitere Werkzeuge gelten weiterhin Grenzen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.