StartseiteArtikel

Von allen Vorteilen des US-amerikanischen Doubao ist nur noch die Schnelligkeit übrig...

硬核看板2026-09-07 20:28
Spitzen-Flash-Modell, leider ist es trotzdem immer noch ein Flash-Modell.

Monatlich aktualisierte Versionen – ich frage euch: Wer sonst macht das schon?

Im Juli Gemini 3.6 Flash, im August Gemini 3.7 Flash, im September Gemini 3.8 Flash. Diese Aktualisierungsfrequenz sucht wirklich ihresgleichen ……

Die Verbesserungen bei 3.6 und 3.7 Flash waren eher marginal. Ursprünglich hatte ich das Vertrauen in Gemini vollständig verloren, und als ich die Nachricht von der Veröffentlichung von 3.8 Flash sah, lag meine Erwartungshaltung nahezu bei null. Trotzdem habe ich 3.8 Flash ausprobiert – und es überraschte mich: Obwohl es sich um ein Flash-Modell handelt, ist der Fortschritt bei seinen Fähigkeiten dieses Mal ziemlich deutlich.

01. Der Stückpreis der Tokens ist nicht gestiegen – warum sind die Arbeitskosten trotzdem höher?

Der Stückpreis der Tokens von 3.8 Flash ist nach wie vor unverändert gegenüber früheren Versionen. Über drei aufeinanderfolgende Aktualisierungen – 3.6, 3.7 und 3.8 – wurde der Preis überhaupt nicht angehoben.

Unser Preis für das amerikanische "Sojabohnen-Paket" ist niedriger als der von Doubao Seed2.1 Pro und nähert sich sogar dem Spitzenpreis von DeepSeek V4 Pro.

Trotzdem ist der Gesamtpreis gestiegen.

Denn das größte Merkmal von 3.8 Flash ist diesmal die Erhöhung der Anzahl der Arbeitsdurchläufe. Laut offiziellen Angaben kam es bei früheren Flash-Modellen häufig vor, dass Aufgaben unvollständig und übereilt abgeschlossen wurden – dieses Problem wurde mit dem neuen Modell behoben. Die Lösung von Gemini 3.8 Flash besteht darin, dass das Modell länger nachdenkt, mehr ausgibt und Aufgaben über mehrere Runden hinweg bearbeitet.

Das führt zu einem Problem. Im Vergleich zu früheren Gemini-Generationen ist der Stückpreis der Tokens zwar unverändert, aber bei gleicher Aufgabe sind die Gesamtkosten gestiegen, da die Aufgaben im Allgemeinen über mehr Durchläufe abgeschlossen werden müssen. Bei der hohen Inferenzstufe von 3.8 Flash ist die Anzahl der ausgegebenen Tokens pro Aufgabe um 33 % höher als bei 3.7 Flash. Zusammen mit der erhöhten Anzahl von Durchläufen bei Agent-Aufgaben sind die durchschnittlichen Kosten pro Aufgabe von 0,40 USD auf 0,58 USD gestiegen.

Interessanterweise ist Googles Einstellung zur Anzahl der Schritte keineswegs unveränderlich.

Bei der Veröffentlichung von 3.6 Flash betonte die offizielle Seite noch, Umwege zu vermeiden: Aufgaben mit weniger Inferenzschritten und weniger Tool-Aufrufen zu erledigen. Bei 3.8 Flash beginnt die offizielle Seite nun damit, mehr Denkschritte zu empfehlen.

Aber mal ehrlich: Ist es wirklich sinnvoll, 3.8 Flash so viel mehr reden zu lassen?

Mit dem gleichen Prompt habe ich sowohl Gemini 3.7 Flash als auch Gemini 3.8 Flash gebeten, mir das Funktionsprinzip der Klangerzeugung von E-Bässen zu erklären. Beide sollten mir erklären, wie man die Saiten anspielt: 3.7 sagte ganz klar: „Zupfe die vierte Saite kräftig an“ – während 3.8 stattdessen sagte: „Zupfe die dickste vierte Saite heftig mit den Fingern der rechten Hand“ ……

????

Hallo? Wofür habe ich mein Geld denn ausgegeben?

02. Das amerikanische "Sojabohnen-Paket" schafft Aufgaben endlich vollständig ab

Wenn es schon nicht einmal einfache Sätze klar formulieren kann – wo liegt dann eigentlich der Fortschritt bei dieser Methode mit mehr Durchläufen?

Es stellt sich heraus, dass es vor allem für praktische Arbeitsaufgaben optimiert wurde. Der Kern dieser Iteration ist die Verbesserung der Agent-Fähigkeiten.

Im Agent-Fähigkeitsranking von Arena ist es von Platz 32 bei der vorherigen Generation Gemini 3.7 Flash auf Platz 14 aufgestiegen.

Nach dem Ausprobieren ist die Verbesserung wirklich sehr deutlich. Seine Fähigkeiten übertreffen bereits die meisten leichtgewichtigen Modelle der „Flash“-Klasse.

Ich habe 3.8 Flash gebeten, eine interaktive Simulation eines Vierzylindermotors zu erstellen – das hat nur 1 Minute gedauert, und das Ergebnis enthält alle erforderlichen Elemente.

Zum Vergleich: Bei gleichem Prompt hat 3.7 Flash überhaupt nichts gezeichnet, obwohl ich in dem Prompt ausdrücklich angegeben habe, dass „Überprüfungen durchgeführt werden müssen“. Anscheinend hat 3.7 diesen Teil einfach ignoriert, um die Aufgabe schnell abzuschließen ……

Erst als ich GPT zur Überprüfung heranzog, stellte sich heraus: Nicht nur war das Laden der Abhängigkeiten zu Beginn fehlerhaft, sondern auch der gesamte spätere Rotationsprozess und die Zündreihenfolge waren falsch. Tatsächlich zeigte sich beim erneuten Testen von 3.7 Flash wieder dieses typische Verhalten des amerikanischen „Sojabohnen-Pakets“: Es schreibt ernsthaft völlig falschen Code.

Das gleiche Problem, das bei Gemini 3.7 Flash auftritt, gibt es auch bei den Flash-Modellen anderer Anbieter.

GPT-5.6 luna und GLM-5.3 flash konnten beide keinen normal gerenderten Motorkolben laden, und auch der spätere Rotations- und Zündprozess fehlte vollständig. Darüber hinaus haben beide Modelle 20 bzw. 35 Minuten für die Aufgabe gebraucht – und das Ergebnis war trotzdem überhaupt nicht lauffähig.

Trotzdem ist DeepSeek V4 Flash erfolgreich gelaufen – aber es läuft nur gerade so: Der Zylinder wurde nicht klar gezeichnet, und der Effekt des Viertakt-Zündvorgangs wurde überhaupt nicht dargestellt.

03. Wenn die Qualität nicht ausreicht, macht Geschwindigkeit den Unterschied

Wenn man von dem größten Vorteil von Gemini im Vergleich zu anderen Modellen auf dem Markt spricht, ist es zweifellos die Geschwindigkeit.

Die Geschwindigkeit der Gemini-Serie ist derzeit wirklich extrem hoch. Bei 3.8 Flash im hohen Inferenzmodell erreicht die Ausgabe von Tokens pro Sekunde mehr als 300 ……

Unter allen Inferenzmodellen auf dem Markt belegen die Modelle mit den höchsten Geschwindigkeiten die vorderen Plätze – und alle sind Gemini-Modelle.

Das hängt mit der Positionierung zusammen, die Google für die Flash-Modellreihe festgelegt hat.

Laut der offiziellen Produktpositionierung liegt sein Haupteinsatzgebiet bei Agenten, und es ist als „Worker-Agent“ positioniert, der Tools aufruft, kontinuierlich läuft und Aufgaben umsetzt – nicht als „Central Agent“, der tief nachdenkt, Abläufe festlegt und die Gesamtkoordination übernimmt. Deshalb strebt es nach hoher Geschwindigkeit und geringem Token-Verbrauch. Tatsächlich entspricht die Leistung von 3.8 Flash genau der Produktpositionierung, die Google für die Flash-Reihe vorgesehen hat.

Ich habe erneut meinen Pac-Man-Test durchgeführt.

Ich habe festgestellt, dass die Geschwindigkeit von Gemini 3.8 Flash wirklich beeindruckend ist. Das gesamte Spiel ist voll funktionsfähig und wurde in nur 29 Sekunden erstellt. Das ist unglaublich schnell ……

Mit dem gleichen Prompt habe ich GPT-5.6 Sol xhigh getestet, das bei Artificial Analysis ebenfalls 59 Punkte in der Dimension „Intelligenz“ erhalten hat. Es ist deutlich langsamer: Es hat 1 Minute und 35 Sekunden gebraucht, und das Ergebnis ist wirklich nicht überzeugend – was soll diese niedrige Bildrate ……

,

Warum kann 3.8 Flash als leichtgewichtiges Modell