Zurück zur Übersicht
Das Modell erzielte im simulierten Geschäftsbetrieb deutlich höhere Kontostände als Claude Fable 5.1. In der Mehrspieler-Variante gewann Astra zudem alle drei ausgewerteten Partien.
GPT-6 Astra erreichte laut Andon Labs im Benchmark Vending-Bench 2 nach jeweils sechs Läufen einen durchschnittlichen Kontostand von 15.515 US-Dollar. Claude Fable 5.1 kam auf 5.422 US-Dollar. Selbst Astras schwächster Lauf lag über Fables bestem Ergebnis.
Der Benchmark simuliert ein Jahr Geschäftsbetrieb mit einem Verkaufsautomaten und 500 US-Dollar Startkapital. Die Modelle müssen Lieferanten finden, Preise verhandeln, Waren nachbestellen und Verkaufspreise festlegen. Andon Labs führt Astras Vorsprung vor allem auf stabilere Verhandlungen und weniger Fehlzahlungen zurück.
In 45 Fällen verlor Fable insgesamt 14.331 US-Dollar an bereits geschlossene Lieferanten. Astra verzeichnete trotz 64 Lieferantenschließungen keinen vergleichbaren Verlust.
Auch in der Mehrspieler-Variante Vending-Bench Arena gewann Astra alle drei ausgewerteten Partien gegen Fable 5.1 und GLM-5.3. Astra erzielte dabei durchschnittlich 12.363 US-Dollar und vermied Preisabsprachen. Andon Labs dokumentierte bei Fable hingegen wiederholt Kartellverhalten.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Die neue Version soll Bilder laut OpenAI bis zu 50 Prozent schneller erzeugen und gezielte Änderungen konsistenter umsetzen. Neu sind unter anderem Zeichenfunktionen, Formatvorlagen und Kommentare direkt auf Bildern.
Das chinesische Unternehmen setzt bei seinem neuen Mixture of Experts Modell auf 30 Milliarden aktive Parameter. Spark X2.5 soll vor allem bei Programmieraufgaben und KI Agenten leistungsfähiger sein.
Das neue Modell soll bei Computersteuerung, Softwareentwicklung und wissenschaftlichen Aufgaben deutliche Fortschritte bringen. Wegen seiner als kritisch eingestuften Cyberfähigkeiten startet der Zugang zunächst mit ausgewählten Organisationen.
Das Modell soll mehrstufige Aufgaben in einem Gespräch bearbeiten, Arbeitsabläufe parallel koordinieren und bei unklaren Vorgaben Rückfragen stellen. Für Coding-Aufgaben nennt Meta gegenüber der Vorgängerversion weniger Tool-Aufrufe und einen geringeren Token-Verbrauch.