Neue Modelle treten in den Hintergrund, Googles Gemini 4 steht vor der Tür, und das größte KI-Modelltraining-Projekt in der gesamten Unternehmensgeschichte ist offiziell angelaufen.
Nachrichten von Zhidong vom 22. Juli: Heute in den frühen Morgenstunden hat Google drei Modelle veröffentlicht: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber. Der Schwerpunkt liegt auf der Verbesserung der Token-Effizienz, der Antwortgeschwindigkeit und der Betriebszuverlässigkeit, die für den Agent-Arbeitsablauf erforderlich sind.
▲ Google veröffentlicht Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber (Quelle: X)
Dabei ist Gemini 3.6 Flash auf Programmierung, Wissensarbeit und multimodale Aufgaben ausgerichtet. Im Intelligence Index der Drittprüfstelle Artificial Analysis verbraucht es 17 % weniger Aufgaben-Token als 3.5 Flash, und der Verbrauch von Ausgabe-Token im DeepSWE-Test wird um bis zu etwa 65 % reduziert.
Gemini 3.5 Flash-Lite zeichnet sich vor allem durch niedrige Latenz und hohen Durchsatz aus. Die Generierungsgeschwindigkeit erreicht 350 Ausgabe-Token pro Sekunde, und im Agent-Arbeitsablauf ist es im Vergleich zum Vorgänger-Flash-Lite-Modell ebenfalls erheblich verbessert.
Gemini 3.5 Flash Cyber ist speziell für die Erkennung und Behebung von Cybersicherheitslücken konzipiert. In Kombination mit dem Codesicherheits-Agent CodeMender erreicht seine Leistung das Wettbewerbsniveau modernster Modelle und ist mit Mythos 5 und GPT-5.6 Sol vergleichbar, steht aber vorläufig nicht für normale Entwickler zur Verfügung.
Derzeit erzielt Gemini 3.6 Flash auf der Rangliste von Artificial Analysis hervorragende Ergebnisse bei der Geschwindigkeitsbewertung, aber die Vorteile in Bezug auf Intelligenz und Kosten sind relativ nicht offensichtlich: Das Modell hat einen Intelligence-Wert von nur 50, liegt hinter Claude Fable 5, GPT-5.6 Sol, Kimi K3, Grok 4.5, GLM-5.2, und selbst Muse Spark 1.1 von Meta steht vor ihm. Die Kosten pro Aufgabe betragen 0,50 US-Dollar (ca. 3,39 Yuan) und sind damit teurer als Modelle wie DeepSeek, MiniMax, GLM, Muse Spark und Grok.
▲ Vergleich von Gemini 3.6 Flash mit anderen Modellen in Bezug auf Leistung, Geschwindigkeit und Kosten (Quelle: Artificial Analysis)
Als eines der einst „drei führenden“ großen Modelle ist der herausragendste Vorteil von Google bei dieser Aktualisierung nach wie vor die Geschwindigkeit. Derzeit belegen Gemini 3.5 Flash-Lite und Gemini 3.6 Flash die ersten zwei Plätze auf der Rangliste in Bezug auf die Ausgabegeschwindigkeit.
▲ Gemini 3.5 Flash-Lite und Gemini 3.6 Flash belegen die ersten zwei Plätze auf der Rangliste der Modell-Ausgabegeschwindigkeit (Quelle: Artificial Analysis)
Für Nutzer, die zwei Monate gewartet haben, ist diese Veröffentlichung ein wenig enttäuschend. Im Mai dieses Jahres kündigte Google-CEO Sundar Pichai auf der I/O-Konferenz an, dass Gemini 3.5 Pro im Juni veröffentlicht wird. Jetzt ist Mitte Juli, aber die Nutzer haben 3.5 Pro immer noch nicht erhalten.
Zu diesem verspäteten Gemini 3.5 Pro erklärte Google, dass das Modell derzeit mit Partnern getestet wird und so schnell wie möglich veröffentlicht wird, sobald es bereit ist. Gleichzeitig hat Google Gemini 4 im Voraus angekündigt und erklärt, dass die bisher größte Vortrainingsaufgabe des Unternehmens gestartet wurde. Google, das uns zwei Monate lang warten ließ, hat zwei neue Versprechungen gemacht, was auch „den Erwartungen entspricht“.
01. 3.6 Flash: Die Ausgabe-Token werden um bis zu 65 % reduziert, deutliche Verbesserungen bei Programmierung und Wissensarbeit
Gemini 3.6 Flash wurde auf der Grundlage des Feedbacks von Entwicklern und Unternehmenskunden zu 3.5 Flash verbessert. Bei der Verarbeitung mehrstufiger Arbeitsabläufe benötigt das neue Modell weniger Inferenzschritte und Tool-Aufrufe und reduziert gleichzeitig die Ausgabe-Redundanz.
Der Eingabepreis von 3.6 Flash beträgt 1,5 US-Dollar pro 1 Million Token (ca. 10,2 Yuan), der Ausgabepreis 7,5 US-Dollar pro 1 Million Token (ca. 51 Yuan). Der Ausgabepreis ist niedriger als bei 3.5 Flash, während der Eingabepreis unverändert bleibt.
3.6 Flash senkt die Betriebskosten jeder Agent-Aufgabe erheblich. Im DeepSWE v1.1-Test verbrauchte 3.5 Flash durchschnittlich etwa 276.000 Ausgabe-Token pro Aufgabe, während 3.6 Flash auf etwa 97.000 sinkt, was einem Rückgang von fast 65 % entspricht. Im Artificial Analysis Intelligence Index betrug der durchschnittliche Ausgabe-Token-Verbrauch der beiden Modelle etwa 28.000 bzw. 23.000, und der Token-Verbrauch von Gemini 3.6 Flash wurde um etwa 17 % reduziert.
▲ Vergleich der Ausgabe-Token von Aufgaben zwischen Gemini 3.6 Flash und Gemini 3.5 Flash (Quelle: Google)
In dem Softwareentwicklungs-Agent-Bewertungstest DeepSWE v1.1 erzielte 3.6 Flash eine Punktzahl von 49 %, was über 37 % von 3.5 Flash und 12 % von 3.1 Pro liegt. Im maschinellen Lern-Engineering-Test MLE-Bench erzielte 3.6 Flash eine Punktzahl von 63,9 %, was 49,7 % von 3.5 Flash und 42,6 % von 3.1 Pro übertrifft.
Im Wissensarbeitstest GDPval-AA v2 betrugen die Punktzahlen von 3.6 Flash, 3.5 Flash und 3.1 Pro 1421, 1349 bzw. 965. In OSWorld-Verified, das die Computer-Nutzungsfähigkeit testet, betrugen die Punktzahlen der drei Modelle 83,0 %, 78,4 % bzw. 76,2 %. Computer Use ist jetzt ein integriertes Client-Tool in der Gemini API und Gemini Enterprise.
▲ Vergleich anderer Fähigkeiten von 3.1 Pro, 3.5 Flash und 3.6 Flash (Quelle: Google)
Gleichzeitig hat Google auch Anwendungsfälle des Modells vorgestellt. Gemini 3.6 Flash kann Finanzdaten und Protokolle von Telefonkonferenzen effizienter und genauer analysieren, Code-Migrationen durch Multi-Agent-Kooperation durchführen, Fototext-Extraktionstools für 3D-Arbeitsabläufe entwickeln und in Kombination mit dem Offline-Editor tldraw interaktive Themenentwurfstools erstellen.
In dem Vergleichstest für Code-Migration-Aufgaben betrug die Planungsdauer von Gemini 3.6 Flash 20 Sekunden, was unter 24 Sekunden von 3.5 Flash liegt. Die Zeit für die Ausführung der Migration wurde von 2 Minuten und 8 Sekunden auf 1 Minute und 20 Sekunden verkürzt, was einer Gesamtdauerreduzierung von etwa 34 % entspricht. Nach den im Fall gezeigten Informationen generiert 3.6 Flash detailliertere und strukturiertere Code-Prüfungs- und Verifikationsdokumente, die mehrere gezielte Verifikationsaufgaben wie Datenmodelle, API-Schnittstellen, Geschäftslogik und UI-Komponenten abdecken.
▲ Vergleich der Dauer von Gemini 3.5 Flash und Gemini 3.6 Flash bei Code-Migration-Aufgaben (Quelle: Google)
Mehrere frühe Kunden haben auch Feedback gegeben. Das Designsoftwareunternehmen Figma ist der Ansicht, dass 3.6 Flash ein gutes Gleichgewicht zwischen Qualität, Geschwindigkeit und Kosten erreicht und die Prototyperkundung und Iteration beschleunigen kann. Das juristische KI-Unternehmen Harvey gab an, dass das Modell bei Dokumentenerstellungs- und Prüfaufgaben durchschnittlich 12 % schneller ist. Das Entwicklungstoolunternehmen JetBrains erklärte, dass seine Programmierleistung bei niedrigem Inferenzniveau um 10 % bis 20 % gegenüber dem Vorgänger-Flash verbessert wurde.
In Bezug auf die Sicherheit hat 3.6 Flash den modernsten Sicherheitsschutz vor chemischen, biologischen, radioaktiven und nuklearen Risiken sowie vor Missbrauch durch Cyberangriffe verstärkt. Google erklärte, dass diese Maßnahmen die Fähigkeit des Modells verbessern, Jailbreak-Angriffen zu widerstehen, und gleichzeitig falsche Ablehnungen für normale Anwendungen so weit wie möglich reduzieren.
02. 3.5 Flash-Lite: 350 Token pro Sekunde ausgeben, einige Tests übertreffen 3 Flash
Gemini 3.5 Flash-Lite ist das schnellste und günstigste Modell in der Gemini 3.5-Serie. Es richtet sich hauptsächlich an Aufgaben wie Agent-Suche und Dokumentenverarbeitung, die niedrige Latenz und hohen Durchsatz erfordern.
Nach Daten von Artificial Analysis kann das Modell 350 Ausgabe-Token pro Sekunde generieren. Seine Eingabe- und Ausgabepreise betragen 0,3 US-Dollar pro 1 Million Token (ca. 2 Yuan) bzw. 2,5 US-Dollar pro 1 Million Token (ca. 17 Yuan).
Entwickler können das Denkniveau des Modells entsprechend der Arbeitslast anpassen: Wählen Sie die Stufe minimal oder low bei groß angelegten, kostengünstigen Aufgaben und aktivieren Sie eine höhere Stufe bei der Verarbeitung mehrstufiger Sub-Agent-Aufgaben. 3.5 Flash-Lite verfügt ebenfalls über das integrierte Computer Use-Tool.
Im Vergleich zu 3.1 Flash-Lite stieg die Punktzahl von 3.5 Flash-Lite im Agent-Terminal-Programmierungstest Terminal-Bench 2.1 von 31 % auf 54 %. Im Langkontext-Test GDM-MRCR v2 stieg die Punktzahl von 60,1 % auf 72,2 %. Im Wissensarbeitstest GDPval-AA v2 stieg die Punktzahl von 642 auf 1140.
▲ Vergleich zwischen Gemini 3.1 Flash-Lite und Gemini 3.5 Flash-Lite (Quelle: Google)
3.5 Flash-Lite übertrifft in einigen Tests auch das höher positionierte 3 Flash. In SWE-Bench Pro erzielten die Modelle Gemini 3.5 Flash-Lite und Gemini 3 Flash Punktzahlen von 54,2 % bzw. 49,6 %. In OSWorld-Verified betrugen ihre Punktzahlen 74,0 % bzw. 65,1 %.
▲ Vergleich zwischen Gemini 3 Flash und Gemini 3.5 Flash-Lite (Quelle: Google)
Das US-amerikanische Fintech-Unternehmen Ramp ist der Ansicht, dass Gemini 3.5 Flash-Lite bei der Belegextraktionsaufgabe ein gutes Gleichgewicht zwischen Genauigkeit, Latenz und Kosten erreicht.