Das neue Gemini 4-Modell von Google ist massiv durchgesickert, und die Bewertungen aus dem internen Test lauten: Ist das nicht Opus 5.5?
Google hält sich zurück – und das, um etwas Großes zu präsentieren!
Während die vollständige Freigabe von Gemini 4 Argon noch aussteht, wird intern bereits heimlich eine noch leistungsfähigere Version namens Carbon getestet –
Laut internen Mitarbeitern soll die Leistung bei der Codeerstellung bereits direkt mit dem benachbarten Opus 5.5 mithalten können ~ (Wirklich?)
Und was die Lecks angeht: Es gibt gleich mehrere, denn Carbon ist nur eines der Modelle, die diesmal durchgesickert sind.
Neben dem bereits offiziell angekündigten Argon gibt es bei Google intern mehrere weitere Entwicklungs-Codenamen wie Barium und Carbon.
Argon, Barium, Carbon …
Bevor Gemini 4 vollständig veröffentlicht ist, hat man schon das gesamte Periodensystem der chemischen Elemente durchgeblättert. (😏)
Noch spannender ist, dass auch Gemini 4 Flash von aufmerksamen Nutzern aufgespürt wurde!
Ein Community-Nutzer hat einen mutmaßlichen Modellbezeichner aus dem Google SDK veröffentlicht: gemini-4-flash-preview, ungefähr so:
Mit dem Flaggschiff-Modell, der leistungsfähigeren internen Testversion und den Hinweisen zur Flash-Serie ist diesmal quasi die gesamte Gemini 4-Familie zusammengetragen worden.
Man veröffentlicht gleichzeitig, iteriert und testet intern schon die nächste Version.
Wer hat eigentlich behauptet, dass spät aufstehende Vögel keine Würmer fangen!!
Neue interne Version von Gemini 4 aufgedeckt: Mitarbeiter behaupten, ihre Code-Leistung kann mit Opus 5.5 mithalten
Wie Business Insider berichtet, gibt es derzeit mindestens drei interne Codenamen in der Gemini 4-Serie.
- Argon: Das von Google bereits offiziell vorgestellte Flaggschiff-Modell von Gemini 4.
- Barium: Die vorherige Serie von internen Testversionen, aus der Barium-B schließlich zur öffentlichen Version Argon ausgewählt wurde.
- Carbon: Die neueste Version, die gerade in die interne Programmierungstestphase eingetreten ist und positive Bewertungen von Mitarbeitern erhält.
Schauen wir uns zuerst das neue Modell an, das diesmal massiv durchgesickert ist – Carbon.
Laut internen Google-Dokumenten, Mitarbeiter-Chatprotokollen und zugehörigen Screenshots, die Business Insider erhalten hat, testet Google in letzter Zeit intensiv neue Versionen von Gemini 4.
Unter anderem ist Carbon in den letzten Tagen auf Googles interner Programmierplattform Jetski für die Nutzung durch Mitarbeiter verfügbar gemacht worden.
Und noch bevor es offiziell vorgestellt wurde, hat es schon eine Reihe von „guten Bewertungen“ von den eigenen Mitarbeitern erhalten –
Ein Mitarbeiter sagte nach der Nutzung: Bei Programmieraufgaben gibt Carbon ihm das Gefühl, bereits fast so leistungsfähig wie Claude Opus 5.5 zu sein??
Ein anderer Mitarbeiter lobte direkt im internen Chat-Kanal: Carbon is really good!
Ein weiterer Mitarbeiter erwähnte, dass sich ein neues Gemini Pro-Modell mit dem Label „Next“ bei der Nutzung sehr gut anfühlt.
Wichtig zu beachten: Das Label „Next“ wird bei Google intern für Testzwecke bei einigen neuen Modellupdates verwendet.
Aus den diesmal aufgedeckten Zusammenhängen zwischen den Modellen geht auch ein kleines, erwähnenswertes Detail hervor.
Zwischen den internen Entwicklungs-Codenamen von Google und den letztendlich veröffentlichten Produktnamen gibt es keine strenge 1:1-Entsprechung.
Zum Beispiel wurde Barium-B schließlich zu Argon.
Das zeigt auch, dass Google in der internen Testphase möglicherweise mehrere Kandidatenversionen gleichzeitig bewertet, bevor die für die offizielle Veröffentlichung geeignete Version ausgewählt wird.
Es bleibt also spannend, ob Carbon schließlich zu einem Update von Argon wird oder als eigenständiges weiteres Modell in der Gemini 4-Serie veröffentlicht wird.
Dass Google-Mitarbeiter Carbon mit Opus 5.5 vergleichen, hat übrigens auch einen Hintergrund.
Denn in den Informationen, die BI diesmal aufgedeckt hat, findet sich auch eine interne Bewertung der frühen Version von Argon.
Dem Bericht zufolge, hat die frühe Version von Argon zwar insgesamt gute Rückmeldungen von Mitarbeitern erhalten, aber einige Tester sind der Meinung, dass die Erfahrung bei einzelnen Programmieraufgaben immer noch hinter der von Anthropic zurückbleibt.
Denn obwohl Argon bereits bei einigen Software-Engineering-Benchmarks Spitzenwerte erzielt hat, besteht bei Aufgaben wie Terminal-Operationen immer noch eine Lücke zu Claude –
Beispielsweise erreicht Argon in DeepSWE v1.1 77,9 %, was über dem offiziell angegebenen Wert von 74,2 % von Opus 5.5 liegt. Bei Terminal-Bench 4.0 hingegen erzielt Argon nur 57,4 %, während Opus 5.5 auf 66,4 % kommt.
Die unterschiedlichen Aufgabentypen der beiden Tests spiegeln auch die Unterschiede in der praktischen Ingenieurskompetenz modernster Modelle wider.
Da nun interne Rückmeldungen bekannt wurden, dass die Programmiererfahrung von Carbon fast der von Opus 5.5 entspricht, ist es natürlich spannend zu sehen, ob Google diese Schwachstellen bereits mit einer neuen Optimierungsrunde behoben hat.
Man kann sich also auf Carbon freuen – schließlich sind sie alle eng verwandt und jede Generation ist leistungsfähiger als die vorherige.
Auch Flash taucht auf: Google zieht die Zügel für kostenlose Nutzer noch enger an
Neben Carbon sind auch die Nachrichten zu Gemini 4 Flash in letzter Zeit wieder in den Fokus gerückt.
In den letzten zwei Tagen gab es in Communities wie X und Reddit wieder Diskussionen über Gemini 4 Flash.
Ein Entwickler hat einen mutmaßlichen Code-Screenshot aus dem Google SDK veröffentlicht, auf dem ein sehr eindeutiger Modellname zu sehen ist: gemini-4-flash-preview
Betrachtet man das Update-Tempo von Google in den letzten Monaten, wird Flash tatsächlich immer präsenter: Erst im vergangenen Monat hat Google Gemini 3.8 Flash vorgestellt.
Laut offiziellen Angaben stärkt dieses Modell unter Beibehaltung seiner Ausrichtung auf niedrige Latenz und geringe Kosten vor allem die Fähigkeiten im langfristigen Software-Engineering, bei mehrstufigen Schlussfolgerungen und in Agent-Workflows.
Das Flaggschiff-Modell erforscht die Leistungsgrenze, während Flash den Bedarf an groß angelegten täglichen Aufrufen deckt – jeder bekommt das, was er braucht, das ist sehr gut ~
Nebenbei ist auch erwähnenswert, dass Google kürzlich die Abonnementstufen der Gemini-Produkte anpasst ... (Schon wieder!!
Wie The Verge berichtet, werden seit dem 9. Oktober die Zugriffsrechte kostenloser Nutzer auf Modelle wie Flash und Pro weiter eingeschränkt.
Früher konnten kostenlose Nutzer zwischen Flash Lite, Flash und Pro wechseln, jetzt ist in der kostenlosen Stufe nur noch Flash Lite verfügbar.
Um weiterhin das Standard-Flash nutzen zu können, benötigen Nutzer mindestens das monatlich 4,99 US-Dollar teure Google AI Plus.
Bereits zahlende AI Plus-Nutzer sind auch nicht davon verschont geblieben: Google teilt mit, dass diese Stufe nach und nach den Zugriff auf das Pro-Modell verliert, und die betroffenen Nutzer erhalten eine Benachrichtigung per E-Mail.
Für den Zugriff auf Pro und Deep Think benötigt man hingegen das monatlich 19,99 US-Dollar teure Google AI Pro oder das Ultra-Abonnement für 99,99 US-Dollar pro Monat ...
Das ist schmerzhaft – ich helfe euch mal, das Ganze mit einem einzigen Bild schnell zu verstehen –
△
Einerseits verbessert Gemini 4 ständig seine Leistungswerte, andererseits stehen kostenlosen Nutzern immer weniger Modelle zur Verfügung.
Das ist wirklich so: Bevor die neuen Modelle vollständig auf den Tisch kommen, wird zuerst die Speisekarte neu berechnet ...
Wer Interesse hat, kann einfach gespannt bleiben ~
Referenzlinks:
[1]https://x.com/Haleeeemahh/status/2108666276218347970
[2]https://www.theverge.com/ai-artificial-intelligence/1005451/google-gemini-free-flash-lite-only
[3]https://www.businessinsider.com/google-employees-test-new-gemini-4-model-argon-barium-carbon-2026-10
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „QbitAI“, Autor: Mengyao, veröffentlicht mit Genehmigung von 36Kr.