StartseiteArtikel

Google kontert! Gemini 4 Argon erreicht eine Leistung auf Augenhöhe mit Astra, bei lediglich 60 % der Kosten.

智东西2026-10-01 10:08
Die maximale Ausgabegrenze beträgt 1 Million Token.

Nachricht von Zhidx am 1. Oktober: Heute in den frühen Morgenstunden hat Google das neue Flaggschiff-Modell Gemini 4 Argon veröffentlicht, das sich vor allem an wissensintensive Unternehmensaufgaben wie Softwareentwicklung, Recht und Finanzen sowie komplexe, langwierige Aufgaben wie Cybersicherheitsabwehr richtet.

In dem DeepSWE-v1.1-Test zur Messung der langfristigen Softwareentwicklungskompetenz, dem Vals-Index zur Bewertung von wissensintensiven Unternehmensaufgaben in Bereichen wie Finanzen, Programmierung, Recht und Steuern, dem AutomationBench zum Test der unternehmensweiten End-to-End-Automatisierungsfähigkeit und dem LVBench zur Untersuchung der Langvideo-Verständniskapazität liegt Gemini 4 Argon vor Modellen wie GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5; im CWE-bench-v1 zur Bewertung der Schwachstellenbehebungskompetenz belegt Argon mit 68 % der Punkte gemeinsam mit GPT-6 Astra den ersten Platz.

In dem Vergleich von Modellkosten und Punktzahl auf Text Arena erreicht Gemini 4 Argon High mit einer Mischkalkulation von 1525 Punkten und 8 US-Dollar pro Million Token die Kosten-Leistungs-Grenze.

Aktuell erzielt Gemini 4 Argon im Artificial Analysis Intelligence Index 53 Punkte, liegt nur hinter Claude Opus 5.5 und Claude Sonnet 5.5 und belegt den Punktestand gemeinsam mit Claude Fable 5.1 und GPT-6 Astra.

▲ Bewertungsergebnisse von Gemini 4 Argon auf Artificial Analysis (Quelle: Artificial Analysis)

Allerdings beruft sich Bloomberg auf informierte Quellen, dass einige Google-Mitarbeiter der Meinung sind, dass Gemini 4 zwar in branchenüblichen Benchmark-Tests hervorragende Ergebnisse zeigt, in der praktischen Arbeit aber nicht immer das gleiche Niveau erreicht, insbesondere bei einigen Programmieraufgaben noch immer Schwierigkeiten hat – dies steht im Widerspruch zu den von Google am selben Tag veröffentlichten Testergebnissen.

Gemini 4 Argon ist jetzt über das „Fairwind-Programm“ für eine ausgewählte Gruppe von Cybersicherheitsabwehrteams zugänglich. Google plant, zunächst frühe Testrückmeldungen zu sammeln und die Sicherheitsvorkehrungen weiter zu verbessern, bevor es schrittweise für Entwickler, Unternehmen und Verbraucher freigegeben wird. Zu den ersten Nutzern gehören zahlende API-Kunden und Abonnenten von Google AI Ultra.

Der anfängliche Preis der Argon-API beträgt 2 US-Dollar pro Million Eingabe-Token (ca. 13,4 Yuan) und 10 US-Dollar pro Million Ausgabe-Token (ca. 67 Yuan). Der Preis für zwischengespeicherte Eingabe-Token liegt um 95 % unter dem Preis der normalen Eingabe-Token, also bei etwa 0,1 US-Dollar pro Million Token (ca. 0,67 Yuan).

Laut Artificial Analysis betragen die Kosten pro Aufgabe für Gemini 4 Argon bei Anwendung des Rabattpreises 1,99 US-Dollar, was um 40 % niedriger ist als bei GPT-6 Astra (max).

▲ Vergleich der Kosten pro Aufgabe von Gemini 4 Argon mit anderen Modellen (Quelle: Artificial Analysis)

Google-Chef Sundar Pichai sagte, dass es viele Diskussionen über das nächste Generation-Modell in der Öffentlichkeit gibt, weshalb er Gemini 4 Argon so früh wie möglich vorstellen möchte. Die internen Teams von Google verwenden es bereits weit verbreitet für Aufgaben wie Programmierung und Quantencomputing und die Rückmeldungen sind positiv.

▲ Pichai veröffentlicht eine Mitteilung zur offiziellen Vorstellung von Gemini 4 Argon (Quelle: X)

Ein X-Nutzer ist der Meinung, dass Gemini 4 besonders empfindlich auf Prompts reagiert: Inhalt und Stil der Ausgabe werden stärker von Prompts beeinflusst als bei anderen Modellen. Der Standardstil ist nicht optimal, aber eine zusätzliche Prompt-Anweisung reicht oft aus, um ihn zu verbessern. Er zeigte auch das Ergebnis der Nachbildung von Levels aus *Lego Star Wars* mit verschiedenen Prompts.

▲ Bewertungen von Entwicklern zu Gemini 4 Argon (Quelle: X)

Ein anderer Entwickler ist der Meinung, dass Gemini 4 Argon bei der einmaligen Generierung von detailreichen und ästhetisch ansprechenden 3D-Szenen noch nicht das Niveau von Opus 5 erreicht. Bei den Bilddetails wirkt das Ergebnis von Gemini 4 Argon etwas grob.

▲ Entwickler vergleicht die Generierungsergebnisse von Gemini 4 Argon (oben) und Claude Opus 5 (unten) (Quelle: X)

01 .

Ausgabeobergrenze auf 1 Million Token angehoben,

herausragende Ergebnisse bei Programmierfähigkeiten und Unternehmensaufgabentests

Gemini 4 Argon hebt die Obergrenze für ausgegebene Token des Modells von bisher 64.000 Token auf 1 Million Token an und ist damit eines der Modelle mit der höchsten Ausgabekapazität in der Branche. Der größere Ausgabebereich ermöglicht es dem Modell, bei einer einzelnen Aufgabe tief nachzudenken und Hunderttausende oder sogar Millionen von Token zu generieren, um große Codebasen, komplexe Forschungen und mehrstufige Unternehmensprozesse zu bearbeiten.

Im Bereich der Programmierung erzielte Gemini 4 Argon im DeepSWE-v1.1-Test zur Messung der langfristigen Softwareentwicklungskompetenz in der realen Welt ein Ergebnis von 77,9 % und stellte damit einen neuen Rekord für diesen Test auf.

Im Vals-Index, der Aufgaben in Bereichen wie Finanzen, Programmierung, Recht und Steuern abdeckt, belegt Argon den ersten Platz. Argon erzielte auch Spitzenleistungen im Vals Finance Agent v2-Test (mehrstufige Finanzforschung) und im Harvey Legal Agent-Test (Rechtsforschung und -formulierung).

Im AutomationBench von Zapier zur Bewertung der unternehmensweiten End-to-End-Automatisierungsfähigkeit erreichte Argon 51,3 % der Punkte und belegte den ersten Platz, deutlich vor Modellen wie GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5.

Die Multimodal-Fähigkeiten von Argon werden auch für die Analyse von Langvideos und professionellen Diagrammen eingesetzt. Im LVBench zur Bewertung der Langvideo-Verständniskapazität erzielte das Modell 91,7 % der Punkte und erreichte damit das beste Niveau unter den vorhandenen Modellen.

02 .

Integration in die internen Arbeitsabläufe von Google,

Optimierung von Quantenalgorithmen und groß angelegte Code-Migration abgeschlossen

Innerhalb von Google nutzen bereits Tausende von Mitarbeitern Gemini 4 Argon für tägliche Aufgaben wie Debuggen, Algorithmenentwicklung, Forschung und groß angelegte Code-Migration.

Als Beispiel nennt Google, dass Argon Forschern im Bereich Quantencomputing dabei geholfen hat, die Raum-Zeit-Ressourcen von Quantenalgorithmen zu optimieren und ein öffentliches Basis-Ergebnis innerhalb weniger Minuten um 40 % zu verbessern. Darüber hinaus analysierte eine Gruppe von Argon-Agenten die Telemetriedaten der Leistungsanalyse des gesamten Serverclusters von Google und identifizierte und implementierte selbstständig Optimierungslösungen für den Speicher in Rechenzentren. Nach der Implementierung der entsprechenden Lösungen können mehr als 300 TiB Speicher freigegeben werden, wobei die erwartete Gesamteinsparung zwischen 500 TiB und 1 PiB liegt.

Argon-Agenten waren auch an der Migration des internen C/C++-Codes von Google zu Rust beteiligt, die Zehntausende von Zeilen Code der Kernbibliothek und mehr als 800.000 Zeilen des Fuchsia-Zircon-Kernels abdeckt. Angesichts der Bedeutung der entsprechenden Systeme erklärte Google, dass alle groß angelegten Umschreibungen unbedingt automatischen und manuellen Prüfungen, Simulationstests und Code-Reviews unterzogen werden müssen, bevor sie in die Produktivumgebung bereitgestellt werden können.

Am Beispiel des Open-Source-Videodecoders libgav1 schrieb der Argon-Agent durch mehrere Runden der Leistungsanalyse und Experimente etwa 32.000 Zeilen SIMD-Code neu, sodass der Compiler automatisch die Vektorisierung durchführen kann. Die migrierte Rust-Version läuft bei vollständig übereinstimmender Videoausgabe 2,7 Mal schneller als die ursprüngliche Rust-Version und ihre Leistung nähert sich weiter der optimierten C++-Version an.

03 .

Cybersicherheitsfähigkeiten gestärkt,

kann Schwachstellen selbstständig erkennen und beheben

Google hat Gemini 4 Argon zudem speziell für die Cybersicherheitsabwehr trainiert. Argon kann Software-Schwachstellen selbstständig erkennen, validieren und beheben. Für vertrauenswürdige Cybersicherheitsabwehrteams und interne Teams von Google stellt Google eine Version von Argon ohne Cybersicherheitsvorkehrungen zur Verfügung, damit es seine vollständigen Fähigkeiten zur Schwachstellenanalyse und -abwehr entfalten kann.

Das Cybersicherheitsunternehmen Wiz nutzt Argon bereits im Rahmen des „Scan for Good“-Projekts, um hochriskante Expositionen in kritischen öffentlichen Infrastrukturen kostenlos zu erkennen und zu beheben. Google erklärte, dass Argon in einem frühen Test eine schwerwiegende Schwachstelle in medizinischer Software entdeckte, die von Krankenhäusern auf der ganzen Welt verwendet wird. Diese Schwachstelle hätte zur Offenlegung sensibler personenbezogener Daten führen können und wurde von früheren Spitzenmodellen nicht erkannt.

Im CWE-bench-v1 zur Bewertung der Schwachstellenbehebungskompetenz belegt Argon mit 68 % der Punkte den ersten Platz gemeinsam mit Grok 4.7 und GPT-6 Astra.