Google Gemini 4 ist nun live gegangen, mit drei aufeinanderfolgenden Releases über Nacht.
Ein Dreifachschlag auf einmal, Google hat diesmal wirklich alle Masken fallen lassen.
Heute hat Google DeepMind nacheinander starke Neuheiten vorgestellt und drei Trumpfkarten auf einmal ausgespielt:
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash Cyber
Ein stärkeres Hauptmodell, ein schnelleres Leichtgewicht und ein auf Schwachstellenbehebung spezialisierter Sicherheitsspezialist.
Die drei Gemini-Modelle verfolgen dasselbe Ziel: KI-Agenten, die in Produktivumgebungen laufen, schneller, intelligenter und kostengünstiger zu machen.
Am selben Tag der Veröffentlichung hat Google zudem eine noch größere Bombe platzen lassen —
Google DeepMind hat „das aggressivste Vortraining in seiner Geschichte gestartet“, das auf das nächste Modell Gemini 4 abzielt.
Einerseits die drei aufeinander folgenden Gemini-Veröffentlichungen, andererseits der Start der Entwicklung von Gemini 4.
Das von Google übermittelte Signal ist unmissverständlich: Das große Spiel um die KI hat gerade erst richtig begonnen.
Google schlägt spät in der Nacht mit starken Neuheiten zu
Drei Gemini-Modelle werden gleichzeitig vorgestellt
Wir werden die drei Gemini-Modelle im Folgenden einzeln durchgehen.
Gemini 3.6 Flash: 65 % weniger Token-Verbrauch
Schauen wir uns zuerst den eigentlichen Star dieser Veranstaltung an — Gemini 3.6 Flash.
Sein wichtigstes Highlight ist der extrem niedrige Token-Verbrauch.
Laut Berechnungen des Artificial Analysis Index verbraucht es 17 % weniger Ausgabetoken als das vorherige 3.5 Flash-Modell.
Auf Codierungs-Benchmarks wie DeepSWE kann der Verbrauch sogar um bis zu 65 % gesenkt werden.
Nicht nur gibt es weniger überflüssige Ausgaben, sondern es benötigt auch weniger Inferenzschritte und Tool-Aufrufe, um eine mehrstufige Aufgabe abzuschließen, und macht weniger Umwege, was es sowohl schneller als auch sparsamer macht.
Darüber hinaus ist Gemini 3.6 Flash bei geringerem Token-Verbrauch auch noch günstiger:
1,5 USD für Eingabetoken und 7,5 USD für Ausgabetoken pro Million Token, also günstiger als 3.5 Flash.
Sparsamer, günstiger und zudem leistungsstärker — das ist ehrliche Absicht. 3.6 Flash hat in mehreren wichtigen Tests das Vorgängermodell deutlich übertroffen —
- DeepSWE: Programmiertest von 37 % ➔ 49 %
- MLE Bench: Test für maschinelles Lernen Forschung von 49,7 % ➔ 63,9 %
- OSWorld-Verified: Test, bei dem das Modell direkt den Computer bedient, von 78,4 % ➔ 83 %
- GDPVal-AA v2: Bei wissensbasierten Arbeitsaufgaben wurden 1421 Aufgaben abgeschlossen, über 70 Punkte mehr als das Vorgängermodell
In der folgenden Demo zeigt 3.6 Flash seine hervorragenden Fähigkeiten bei der Orchestrierung mehrerer Agenten: Es meistert nicht nur komplexe Code-Migrationsaufgaben problemlos, sondern übertrifft 3.5 Flash auch in Bezug auf Antwortgeschwindigkeit und Code-Qualität deutlich.
Mit Gemini Canvas hat 3.6 Flash den 3D-Arbeitsablauf integriert und erstellt im Handumdrehen ein professionelles Werkzeug für die Extraktion von fotografiequalitativen Texturen.
Es kann sich zudem in einen „KI-Interaktionsdesigner“ verwandeln und problemlos ein immersives Themenstudio erstellen.
3.5 Flash-Lite: Schlägt sein größeres Brudermodell
Das zweite Modell, Gemini 3.5 Flash-Lite, verfolgt einen anderen Ansatz: Es ist auf hohe Geschwindigkeit und niedrige Kosten ausgelegt.
Die Ausgabegeschwindigkeit von 3.5 Flash-Lite erreicht 350 Token pro Sekunde, was das schnellste Modell der gesamten 3.5-Serie ist.
Der Preis ist extrem niedrig: 0,3 USD pro Million Eingabetoken und 2,5 USD pro Million Ausgabetoken.
Schnell und günstig — es ist von Grund auf für häufige, massenhafte Szenarien wie die Verarbeitung großer Dokumentenmengen und die Agentensuche konzipiert.
Das Beeindruckendste ist, dass es sogar sein eigenes größeres „Brudermodell“ übertroffen hat.
In mehreren Programmier- und Agententests hat dieses kleine Leichtmodell das größere Gemini 3 Flash überboten —
- SWE-Bench Pro: 54,2 % gegenüber 49,6 %
- OSWorld-Verified: 74,0 % gegenüber 65,1 %
3.6 Flash fungiert als „Gehirn“, das Aufgaben zerlegt, während Flash-Lite als „Ausführende“ Massenaufgaben erledigt.
Einer denkt nach, viele führen aus — so lässt sich der Druck hoher Parallelverarbeitung problemlos bewältigen.
In der offiziellen Demo erzeugen beide zusammen 25 hochverfügbare Webdesign-Lösungen auf einmal, so schnell, dass es fast so aussieht, als würden die Lösungen direkt nach dem Denken ausgegeben.
Flash-Lite ist bereits in der Gemini-App verfügbar und wird nach und nach auch in die Google-Suche integriert.
Flash Cyber: Kann Schwachstellen beheben, ist aber nicht für jedermann verfügbar
Gemini 3.5 Flash Cyber ist ein auf Cybersicherheit spezialisiertes Hochleistungsmodell.
Seine einzige Aufgabe ist es, Schwachstellen zu finden und zu beheben.
Derzeit besteht eine unangenehme Realität: Die Geschwindigkeit, mit der KI Schwachstellen findet, ist bereits höher als die Geschwindigkeit, mit der vorhandene Systeme sie beheben können.
Google hat dieses Modell in den Code-Sicherheitsagenten CodeMender integriert. Durch die Zusammenarbeit mehrerer Cyber-Agenten wurde auf dem Sicherheits-Benchmark CyberGym der neue SOTA-Wert erreicht, und die Kosten sind niedriger als bei größeren Modellen —
Ein leichteres Modell erledigt die Aufgaben, die höchste Genauigkeit erfordern.
Allerdings ist dieses Modell für normale Nutzer vorerst nicht zugänglich.
Die Entwicklung von Gemini 4 hat begonnen
Das aggressivste Vortraining aller Zeiten
Obwohl Gemini 3.5 Pro noch nicht veröffentlicht wurde, hat die Trainingsphase von Gemini 4 bereits begonnen.
Diese drei aufeinander folgenden Veröffentlichungen sind nur die Vorspeise, die offizielle Ankündigung zum Höhepunkt ist das eigentliche Highlight.
Google hat bestätigt, dass intern das aggressivste Vortraining in der Unternehmensgeschichte gestartet wurde, das direkt auf das nächste Modell Gemini 4 abzielt.
Experten zufolge könnte Gemini 4 nach dem üblichen 6-monatigen Trainingsrhythmus von Google bereits Ende dieses Jahres vorgestellt werden.
Für uns, die wir mit echtem Geld Token kaufen und Agenten aufbauen, hat diese heutige Veröffentlichung nur ein einziges wichtiges Wort: Senkung.
Die Preise sinken, der Token-Verbrauch sinkt, die Kosten für den Lauf eines Agenten sinken.
Das noch nicht erschienene Flaggschiff-Modell und das gerade gestartete Gemini 4 sind noch „Zukunftsware“.
Was man sofort nutzen kann und zudem günstig ist, ist das, was man heute schon nutzen kann. Selbst das stärkste Flaggschiff-Modell muss erst in die Praxis umgesetzt werden.
Quellen:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/?utm_source=tw&utm_medium=social&utm_campaign=og
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Neue Intelligenz“, Autor: Redaktion: Taozi, veröffentlicht mit Genehmigung von 36kr.