Zurück zur Übersicht
LifeSciBench testet KI-Modelle an realistischen Forschungs- und Laboraufgaben. Erste Auswertung zeigt: der beste Modelllauf erreicht nur rund 36 Prozent Task-Passrate, die Reife für autonome Forschung bleibt damit fraglich.
OpenAI hat LifeSciBench veröffentlicht, einen fachlich orientierten Benchmark mit 750 von Expertinnen und Experten verfassten Aufgaben aus mehreren Forschungsworkflows und biologischen Domänen. Die Ankündigung ist Teil der jüngsten Erweiterung der Modellreihe GPT-Rosalind.
Die Auswertung nutzt detaillierte Bewertungsrichtlinien und Hunderttausende Bewertungsdatenpunkte. In der veröffentlichten Auswertung erreichte der bestplatzierte getestete Modelllauf rund 36 Prozent Task-Passrate, viele Aufgaben bleiben damit auch für Spitzenmodelle ungelöst.
Die Verlagerung von einfachen Wissensabfragen zu realitätsnahen, artefaktreichen Forschungsaufgaben erhöht die Aussagekraft von Tests für Pharmafirmen, Forschungslabore und Beschaffer. Die Zahlen legen nahe, dass Modelle zwar Fortschritte zeigen, für eigenständige, unüberwachte Forschungsentscheidungen aber noch nicht verlässlich genug sind.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen