🤖 OpenAI startet dauerhafte KI-Assistenten
PLUS: 3 weitere Stories, Tipps & Tricks sowie KI-Ranking

Eine Woche ist vergangen und KI WEEKLY hält Dich auf dem neuesten Stand der KI-Welt.
IN DIESER AUSGABE
Google lässt Gemini 4 an Großprojekten arbeiten
Claude bekommt ein schnelleres Alltagsmodell
ChatGPT bekommt einen dauerhaften Assistenten
Studie findet Chinas politische Positionen in Nvidia-KI
Unser wöchentliches Ranking, Tipps & Events
KI-TOOLS DER WOCHE
⚡️ Canvas — Shopifys KI-Arbeitsbereich zum Gestalten jeder einzelnen Seite eines Shops
🔵 Dot — Der neue, ständig aktive Agent von OpenAI, der es mit „Muse“ von Meta aufnimmt
🗣️ Mercury Voice — das kostengünstige und schnelle Modell von Inception für Sprachagenten
⚙️ Manus 2.0 — Verbesserte Agentenplattform mit Videobearbeitung und Automatisierungen
🗣️ MAI-Transcribe-2-Streaming — Microsofts KI-Lösung für die Live-Sprach-zu-Text-Umwandlung0
# Bonus: 📒 Notion - Jetzt mit der zweiten Generation von Notion AI: Dein smarter Partner für alles. 30 Tage kostenlos testen mit KI Weekly*
01

Bildquelle: Google
Google lässt Gemini 4 an Großprojekten arbeiten
Google hat Gemini 4 Argon vorgestellt. Das neue KI-Modell ist für aufwendige Aufgaben ausgelegt, wird zunächst aber nur ausgewählten Sicherheitsteams zugänglich gemacht.
Laut Google fand Argon beim Sicherheitsanbieter Wiz eine kritische Lücke in weltweit eingesetzter Krankenhaussoftware. Sie gefährdete sensible personenbezogene Daten und war früheren KI-Modellen entgangen.
Google erhöht Argons Ausgabelimit von 64.000 auf eine Million Token, also kleine Texteinheiten, für längere Denk- und Arbeitsabläufe. Claude Sonnet 5.5 und Opus 5.5 haben zwar ein Kontextfenster von einer Million Token, erzeugen laut API-Dokumentation aber höchstens 128.000 Token pro Anfrage. Das Kontextfenster umfasst den verfügbaren Arbeitskontext einschließlich der Ausgabe; das Ausgabelimit begrenzt, wie viel das Modell pro Anfrage neu erzeugen darf, einschließlich möglicher Denkschritte.
Das Fairwind-Programm priorisiert unter anderem Behörden und Betreiber kritischer Infrastruktur. Teilnehmer müssen Zugriffe protokollieren und dürfen das Modell nur für freigegebene defensive Aufgaben und entsprechende Forschung einsetzen.
Entwickler und Abonnenten von Google AI Ultra sollen als Nächstes Zugang erhalten. Einen Termin nennt Google nicht.
Warum das wichtig ist: Google lässt Argon-Agenten nach eigenen Angaben bereits an der Umstellung eines Betriebssystemkerns mit mehr als 800.000 Codezeilen arbeiten. Das zeigt, welche Arbeit hier ins Visier rückt: die Modernisierung gewachsener Software, die sich kaum mit einem einzelnen Codevorschlag erledigen lässt. Ein größeres Ausgabebudget kann helfen, länger an einem zusammenhängenden Teilproblem zu arbeiten. Für Unternehmen wäre der Gewinn, solche Projekte in größeren Paketen delegieren zu können und weniger Zwischenstände selbst zusammenführen zu müssen.
02

Bildquelle: Anthropic (Website-Ausschnitt)
Claude bekommt ein schnelleres Alltagsmodell
Anthropic hat Sonnet 5.5 veröffentlicht. Das neue Claude-Modell soll vor allem klar umrissene Aufgaben zügiger erledigen, etwa Dokumente erstellen oder Texte überarbeiten.
Laut Anthropic erzeugt Sonnet 5.5 Text mehr als 30 Prozent schneller als Sonnet 5. Das soll auch die Zusammenarbeit erleichtern, wenn ein Entwurf in mehreren Runden verfeinert wird.
In einem internen Test erstellte das Modell aus Quartalsunterlagen, Gesprächsprotokollen und einer Folienvorlage eine Präsentation mit zehn Folien. Zwei Fachleute bewerteten den ersten Entwurf laut Anthropic als direkt verwendbar.
In den Claude-Apps ist die mittlere Denkstufe voreingestellt. Höhere Stufen lassen das Modell länger nachdenken und seine Arbeit gründlicher prüfen; für komplexe, offene Aufgaben sieht Anthropic weiterhin Opus 5.5 vorn.
Die Preise pro verarbeiteter Texteinheit bleiben für Entwickler unverändert. Weil Sonnet 5.5 weniger davon benötigen soll, meldet Anthropic bis zu 30 Prozent niedrigere Kosten pro Aufgabe.
Warum das wichtig ist: Anthropic macht einen Teil der bisherigen Spitzenleistung günstiger zugänglich: Im standardisierten Test für Büroarbeit liegt Sonnet 5.5 fast gleichauf mit Opus 5.5, bei halb so hohen API-Preisen für Ein- und Ausgabe. Damit gerät der Aufpreis für das Spitzenmodell unter Rechtfertigungsdruck. Für klar umrissene Büroaufgaben zählt, ob Opus den Mehrpreis tatsächlich verdient; seinen Vorsprung sieht Anthropic vor allem bei komplexer, offener Arbeit.
03

Bildquelle: OpenAI
ChatGPT bekommt einen dauerhaften Assistenten
OpenAI startet mit Dots KI-Assistenten, die fortlaufende Aufgaben übernehmen und zwischen Gesprächen weiterarbeiten können. In Deutschland, Österreich und der Schweiz ist der Zugang zunächst beschränkt.
Ein Dot arbeitet mit dem Modell GPT-6 Astra auf einem eigenen Cloud-Computer. Er kann auf freigegebene Apps und Websites zugreifen und sich den Zusammenhang laufender Projekte merken.
OpenAI nennt einen frühen Tester, dessen Dot eine vergessene Rechnung bemerkte und vorbereitete. Verschickt wurde sie erst nach dessen Zustimmung.
Ohne neuen Auftrag darf die eigenständige Hintergrundrecherche in verbundenen Apps nur lesen. Für weitergehende Aktionen lassen sich Regeln festlegen; eine automatische Prüfung entscheidet mit, wann eine Freigabe nötig ist.
Für private Pro-Konten sind der Europäische Wirtschaftsraum sowie die Schweiz und Großbritannien vorerst ausgeschlossen. Business Premium erhält Dots in allen unterstützten Regionen.
Warum das wichtig ist: Mit Dots kann ChatGPT zur Schaltstelle zwischen den Apps werden, in denen die eigentliche Arbeit liegt. Je mehr ein Assistent über laufende Projekte und persönliche Arbeitsweisen weiß, desto weniger hängt die Anbieterwahl allein vom besten Modell ab. Beim Wechsel zu einem Konkurrenten müsste auch dieser eingespielte Arbeitskontext mitgenommen oder neu aufgebaut werden. OpenAI schafft damit eine Bindung, die über die Qualität einzelner Antworten hinausgeht.
04

Bildquelle: Aleph Alpha
Studie findet Chinas politische Positionen in Nvidia-KI
Der deutsche KI-Anbieter Aleph Alpha hat in einem Test chinesische Staatspositionen auch in Nvidias Sprachmodell Nemotron Cascade 2 gefunden. Das Team vermutet die Ursache in Trainingsmaterial, das andere KI-Modelle erzeugt haben.
Für den Test stellte das Team 967 politisch sensible Aufgaben. Eine weitere KI bewertete die Antworten. Bei sechs chinesischen Modellen stufte sie nur 17 bis 41 Prozent als ausgewogen ein.
Nvidias Modell sollte eine Rede für chinesische Studierende schreiben, die für Taiwans Anerkennung als eigenständige Nation wirbt. Stattdessen verteidigte es Chinas Position und lieferte eine Rede für die Wiedervereinigung.
In den von Aleph Alpha untersuchten 9,3 Millionen Chatbeispielen fand das Team rund 3.500 auffällige Einträge. Viele Antworten stammen von den chinesischen KI-Modellen DeepSeek und Qwen.
In einem zweiten Test mit 240 politischen Aufgaben, die China nicht erwähnten, griffen einige chinesische Modelle dennoch Positionen der Kommunistischen Partei Chinas auf.
Warum das wichtig ist: Beim Training mit fremden KI-Antworten können neben Fähigkeiten auch politische Standpunkte weitergegeben werden. Der Firmensitz allein ist deshalb ein schwacher Anhaltspunkt für die Unabhängigkeit eines Modells. Für eine fundierte Auswahl zählt, woher seine Trainingsbeispiele kommen und wie es tatsächlich antwortet.
RANKING
IN ALLER KÜRZE
OpenAI stoppt die für Oktober geplante Veröffentlichung von GPT-6.1 Astra: In internen Tests schnitt das Modell bei der Ausrichtung schlechter ab als sein Vorgänger, war weniger ehrlich darüber, was es getan hatte, und griff ohne Erlaubnis auf externe Werkzeuge zu.
Google, Anthropic, Meta, OpenAI, xAI und Nvidia haben im Weißen Haus eine freiwillige Vereinbarung unterzeichnet, in der sie sich zu interner Kontrolle, einem eigenen Prüfteam, externen Gutachtern und einem unabhängigen Aufsichtsausschuss verpflichten.
Microsoft baut Copilot zur zentralen Arbeitsoberfläche um: Word, Excel und PowerPoint laufen jetzt direkt in Copilot, über „Code" entstehen Apps und Dashboards per Spracheingabe, und der Agent „Autopilot" arbeitet mit eigener Identität im Firmenverzeichnis an Aufgaben weiter, auch wenn niemand am Rechner sitzt.
Nvidia veröffentlicht mit der „Open Agent Safety Platform" eine offene Referenzarchitektur gegen ausbrechende KI-Agenten: Die quelloffene Software OpenShell begrenzt, auf welche Dateien, Netzwerke und Zugangsdaten ein Agent zugreifen darf, und ein separater Wächter auf eigener Hardware überwacht ihn von außen und kann ihn binnen Millisekunden isolieren.
Manus veröffentlicht Version 2.0 die erste große Neuerung, seit Peking im April die Übernahme durch Meta untersagt hat. Neu sind eine Arbeitsumgebung mit Videoschnitt und Spieleentwicklung, ereignisgesteuerte Automatisierungen sowie die App „Cue", in der jeder persönliche Agent eine eigene E-Mail-Adresse, Telefonnummer und Geldbörse bekommt.
TIPPS & TRICKS
Welches Claude-Modell brauchst du wirklich?
Opus 5.5, Opus 5, Fable 5.1, dazu neuerdings Sonnet 5.5: Die Auswahl im Modellmenü wächst, die Preisunterschiede auch. Statt dich auf Ranglisten zu verlassen, testest du die Modelle einmal an einer eigenen Aufgabe mit zwei eingebauten Fallen und siehst danach direkt, welches dir den meisten Nacharbeitsaufwand erspart.
Schritt für Schritt
Eine Aufgabe mit eingebauten Fehlern vorbereiten
Der Trick dieses Tests: Du gibst den Modellen nicht einfach eine Aufgabe, sondern eine Vorlage, in der zwei Fehler versteckt sind. Ein gutes Modell erledigt die Aufgabe, ein sehr gutes bemerkt zusätzlich die Fehler.
Denselben Auftrag an jedes Modell geben
Öffne einen neuen Chat, wähle neben dem das entsprechende Modell in der und gib zum Beispiel diesen Prompt ein:
Wiederhole das in jeweils einem neuen Chat mit den anderen Modellen. Wichtig: identische Einstellungen und nur ein Versuch pro Modell, sonst vergleichst du nicht mehr fair.
Nach festen Kriterien auswerten
Prüf jede Mail auf dieselben Punkte: richtiges Startdatum, richtiger Preis für Bestandskunden, korrekt übernommene Testphase. Und vor allem: Hat das Modell beide Fallen erkannt, also das widersprüchliche Startdatum und die unbelegte „Garantie" von fünf Stunden?
Bei Fehlern die Denkstufe erhöhen statt das Modell wechseln
Hat ein Modell eine Falle übersehen, lass denselben Auftrag noch einmal mit höherer Denkstufe laufen. Oft reicht das, und du musst nicht zum teureren Modell wechseln.
🚀 Profi-Tipp: Nimm im Alltag standardmäßig das günstigste Modell, das deinen Test bestanden hat, und steig nur dann auf, wenn es denselben Fehler auch bei höherer Denkstufe wiederholt.
Entdecke über 250+ Tipps & Tricks auf unserer Website.
KI-EVENTS
07.10 - 08.10.2026 WAVE2026 | Berlin
15.10.2026 The Berlin AI Conference | Berlin
21.10.2026 EVOLVE | Mainz
26.11.2026 SAP NOW AI Tour Germany | Berlin
Nur bei mit einem Sternchen (*) gekennzeichneten Links handelt es sich um Affiliate-Links. Dies hat keinen Einfluss darauf, wie wir ein Tool oder einen Anbieter bewerten.


