Zurück zur Übersicht
Das offene, multimodale Modell soll laut Google auf Laptops mit 16 GB RAM oder VRAM laufen und unterstützt auch Audioverarbeitung. Damit rückt lokale KI-Ausführung für bestimmte Workflows stärker in den Fokus.
Google hat am 3. Juni Gemma 4 12B vorgestellt. Das Modell ist unter Apache 2.0 veröffentlicht, verarbeitet multimodale Eingaben und beherrscht native Audioverarbeitung.
Nach Angaben von Google kann Gemma 4 12B lokal auf Geräten mit 16 GB RAM oder VRAM laufen. Die Gemma-Familie kommt laut dem Unternehmen inzwischen auf 150 Millionen Downloads.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.
Weiterlesen
Die neuen Modelle sollen während laufender Gespräche komplexe Aufgaben planen und externe Werkzeuge aufrufen. Damit verschiebt sich der Schwerpunkt von Sprachdialogen hin zur Steuerung mehrstufiger Prozesse.
Das neue Flash-Modell soll Softwareentwicklung, agentische Aufgaben und mehrstufiges Schlussfolgern zu niedrigeren Kosten unterstützen. Die Cyber-Version sucht Schwachstellen und erstellt automatisiert Patches, bleibt zunächst aber ausgewählten Sicherheitspartnern vorbehalten.
Gemini 3.5 Transcribe soll Sprache nicht nur verschriftlichen, sondern auch Versprecher, Korrekturen und Füllwörter erkennen und in formatierten Text überführen. Google stellt das Modell als Public Preview über die Gemini API und die Gemini Enterprise Agent Platform bereit.
Google will drei stabile Imagen 4 Endpunkte in der Gemini API frühestens am 17. August 2026 abschalten. Entwickler sollen ihre Anwendungen auf Gemini 3.1 Flash Image umstellen.