StartseiteArtikel

Google hat nacheinander drei "Lite, Flash"-Modelle veröffentlicht, aber das leistungsstärkste Pro fehlt erneut.

36氪的朋友们2026-07-22 07:58
3.5 Pro befindet sich noch im Test, Gemini 4 ist bereits auf dem Weg.

Am 21. Juli Ortszeit in den USA hat das Google DeepMind-Team gleich drei neue Gemini-Modelle veröffentlicht: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und Gemini 3.5 Flash Cyber.

Dabei zeigt das Hauptmodell Gemini 3.6 Flash stärkere Leistungen bei Codierungs- und multimodalen Aufgaben, aber noch wichtiger ist, dass es 17 % bis 65 % weniger Ausgabe-Token für die gleiche Arbeit verbraucht als das Vorgängermodell.

Gemini 3.5 Flash-Lite konzentriert sich auf extreme Geschwindigkeit und Kosten-Leistungs-Verhältnis und kann 350 Ausgabe-Token pro Sekunde generieren.

Gemini 3.5 Flash Cyber hingegen ist ein spezialisiertes Modell, das für die Erkennung und Behebung von Cybersicherheitslücken feinabgestimmt wurde und derzeit nur für Regierungen und ausgewählte Partner zugänglich ist.

Gleichzeitig ist das von der Öffentlichkeit lang erwartete Flaggschiff-Modell Gemini 3.5 Pro immer noch nicht erschienen. Google gab an, dass es derzeit mit Partnern getestet wird, und enthüllte erstmals, dass die umfangreichere Vortrainingsphase von Gemini 4 bereits gestartet wurde.

01 Abschied von "geschwätzigem" KI

Bei den Anwendungskosten von großen Sprachmodellen hängt die Anzahl der Ausgabe-Token direkt mit den Kosten und der Latenz zusammen. Eines der Designziele von Gemini 3.6 Flash ist es, diese unnötigen Verbräuche zu reduzieren und gleichzeitig die Qualität der Aufgabenerfüllung zu erhalten oder zu verbessern.

Praktische Messungen der dritten Partei-Benchmark-Institution Artificial Analysis Index zeigen, dass der Token-Verbrauch des Modells um 17 % niedriger ist als beim Vorgängermodell. Bei komplexen Ingenieuraufgaben, die mehrstufiges Schließen und Tool-Aufrufe erfordern, ist die Einsparungswirkung noch deutlicher.

Zum Beispiel hat sich im DeepSWE-Benchmark von Datacurve der Token-Verbrauch um 65 % reduziert, was bedeutet, dass Gemini 3.6 Flash bei der Erledigung von Aufgaben weniger redundante Code-Bearbeitungen und Schleifenoperationen ausgeführt hat.

Diese Effizienzsteigerung führt auch zu einem direkten Preisrückgang.

Gemini 3.6 Flash ist mit 1,50 US-Dollar pro Million Eingabe-Token und 7,50 US-Dollar pro Million Ausgabe-Token preislich festgelegt. Im Vergleich zum Preis von 9 US-Dollar pro Million Ausgabe-Token bei 3.5 Flash sind die Gesamtkosten für einzelne Agentenaufgaben gesunken.

Leistungsmäßig hat Gemini 3.6 Flash in mehreren Benchmarks quantifizierbare Verbesserungen erzielt.

Im DeepSWE-Test erreichte es einen Wert von 49 %, höher als die 37 % von 3.5 Flash. Im MLE-Bench-Maschinelles Lernen-Ingenieur-Benchmark stieg der Wert von 49,7 % auf 63,9 %.

Die Fähigkeit zur Computernutzung erreichte im OSWorld-Verified-Test einen Wert von 83 %, vorher lag er bei 78,4 %. Diese Funktion ist jetzt ein integriertes Client-Tool für die Gemini-API und Gemini Enterprise.

Im Bereich der Wissensarbeit stieg der Wert im GDPval-AA v2-Benchmark von 1349 auf 1421.

Mehrere Kunden haben bereits Feedback gegeben.

Figma, Harvey, Hebbia und JetBrains haben alle angegeben, dass Gemini 3.6 Flash bei der Verarbeitung komplexer Workflows und wissensbasierter Aufgaben ein Gleichgewicht zwischen Token-Effizienz, Genauigkeit und Geschwindigkeit erreicht.

Google hat die Leistung von Gemini 3.6 Flash in mehreren praktischen Szenarien gezeigt.

Im Finanzbereich kann das Modell mit Managed Agents auf AI Studio Finanzdaten und -aufzeichnungen effizienter und genauer analysieren und auswerten als Gemini 3.5 Flash.

Bei Code-Migrationsaufgaben führt Gemini 3.6 Flash Operationen mit Multi-Agent-Orchestrierung auf der Antigravity-Plattform aus und hat eine niedrigere Latenz und höhere Qualität als das Vorgängermodell.

Im Bereich der kreativen Tools hat Gemini 3.6 Flash mit seiner visuellen Verständnisfähigkeit ein interaktives Themenstudio mit den Open-Source-Zeichenwerkzeugen Antigravity und tldraw aufgebaut.

Darüber hinaus hat das Modell mit der Canvas-Funktion in der Gemini-App Entwicklern geholfen, einen fotografischen Textur-Extraktor für 3D-Workflows zu erstellen.

02 Neue Spitzenwerte bei der Geschwindigkeit erreichen

Gemini 3.6 Flash strebt ein Effizienzgleichgewicht an, während Gemini 3.5 Flash-Lite die Geschwindigkeitsgrenze anstrebt.

Google definiert es als das "schnellste und kostengünstigste" Modell in der 3.5-Serie. Laut praktischen Messungen von Artificial Analysis erreicht seine Generierungsgeschwindigkeit 350 Ausgabe-Token pro Sekunde, was etwa das Doppelte der Geschwindigkeit des Vorgängermodells 3.1 Flash-Lite ist.

Die Preisgestaltung ist auch sehr wettbewerbsfähig: 0,30 US-Dollar pro Million Eingabe-Token und 2,50 US-Dollar pro Million Ausgabe-Token. Diese niedrigen Kosten und hohe Geschwindigkeit zielen auf Geschäftsszenarien mit hohem Durchsatz ab, wie z. B. Agentensuche und groß angelegte Dokumentenverarbeitung.

Obwohl der Name Lite enthält, erreichte Gemini 3.5 Flash-Lite im SWE-Bench Pro-Test einen Wert von 54,2 %, der über dem 49,6 % des Standard-Gemini 3 Flash liegt. Im OSWorld-Verified-Test übertraf es mit einem Wert von 74 % die 65,1 % von Gemini 3 Flash.

Entwickler können auch die "Denkebene" des Modells je nach Arbeitslast anpassen: Bei einfachen Aufgaben mit hohem Volumen kann die niedrigste Denkstufe eingestellt werden, um niedrige Latenz und niedrige Kosten zu erreichen; bei komplexen Sub-Agenten-Aufgaben kann die Denkebene erhöht werden, um die Qualität zu gewährleisten.

Google hat Demonstrationsfälle von Gemini 3.5 Flash-Lite in vier Szenarien vorgestellt.

Das erste ist das Extrahieren und Integrieren von Produktmerkmalen aus massiven E-Commerce-Datensätzen.

Das zweite ist, dass es als Hauptagent mit Gemini 3.5 Flash-Lite zusammenarbeitet, um sofort 25 einzigartige, sofort erkundbare Webdesign-Konzepte zu generieren.

Das dritte ist die groß angelegte Übersetzung und Zusammenfassung von Belegen mit multimodalen Verständnisfähigkeiten.

Das vierte ist das Erstellen von Spielen durch sofortiges Generieren und Iterieren mehrerer Optionen.

Die frühen Kunden Ashler, Paloalto und Ramp haben alle die einzigartige Kombination des Modells in Bezug auf Geschwindigkeit, Intelligenz und Kosteneffizienz hervorgehoben und glauben, dass es für die Erweiterung von Agenten-Workflows und Datenverarbeitungsaufgaben geeignet ist.

03 Spezialmodell für "White-Hat-Hacker"

Das dritte von Google veröffentlichte Modell, Gemini 3.5 Flash Cyber, ist speziell dafür gedacht, Cybersicherheitslücken zu finden und zu beheben.

Dieses Modell wurde auf Basis von Gemini 3.5 Flash feinabgestimmt. Google hofft, dass es mit niedrigeren Token-Kosten Code-Sicherheitsaufgaben erledigen kann, die normalerweise großen Modellen überlassen werden. Im Benchmark namens CyberGym hat seine Leistung bereits das Spitzenniveau erreicht.

Aber angesichts der zweischneidigen Natur von Cybersicherheitsangriffen und -verteidigung hat Google eine vorsichtige Bereitstellungsstrategie für dieses Modell verfolgt. Es wird nicht für alle Entwickler geöffnet, sondern direkt in Googles Code-Sicherheitsagent CodeMender integriert. Als Pilotprojekt mit begrenztem Zugriff wird es exklusiv nur für Regierungen und vertrauenswürdige Partner bereitgestellt.

Tulsi Doshi, Senior Director of Product Management im Google Gemini-Team, sagte, dass dies dazu dient, dass Verteidiger an vorderster Front kritische Lücken entdecken und beheben können, bevor sie weit verbreitet ausgenutzt werden, und das Risiko des Missbrauchs zu verringern.

Google enthüllte, dass das Modell in internen Tests 55 Probleme im Open-Source-Code-Repository V8 JavaScript Engine gefunden hat, von denen 10 Lücken von anderen Modellen nicht entdeckt wurden.

Aus der Anordnung der drei neuen Modelle geht hervor, dass die aktuelle Strateg