Liang Wenfeng überraschte Elon Musk, DeepSeek V4 Pro tritt gegen Grok 4.6 an, der erste Test lieferte absolut überwältigende Ergebnisse.
Heute ist dieser Tag absolut verrückt!
Auf der einen Seite hat Liang Wenfeng endlich in der frühen Morgenstunde die offizielle Version von DeepSeek V4 Pro veröffentlicht.
Auf der anderen Seite hat Elon Musk das nächste Flaggschiff Grok 4.6 vorgestellt, das vor allem durch niedrige Kosten und starke Leistung überzeugt.
Die beiden Giganten haben ihre Produkte zur gleichen Zeit veröffentlicht, die Stimmung ist sofort extrem angespannt.
Worauf sie beide abzielen, ist fast dasselbe —
Das Modell soll in der Lage sein, in langen Aufgaben kontinuierlich Werkzeuge aufzurufen, Code zu ändern, Ergebnisse zu überprüfen und am Ende ein wirklich nutzbares fertiges Produkt zu liefern.
DeepSeek V4 Pro ist da
Elon Musks Grok 4.6 tritt an
Das herausragendste Ergebnis der offiziellen Version von DeepSeek V4 Pro ist der absolute erste Platz in zwei Bewertungen, es hat Fable 5 direkt überholt.
Beim Cybersicherheits-Agententest CyberGym erreichte es 83,3 Punkte, übertrifft die 83,1 Punkte von Fable 5 und die 78,3 Punkte von Opus 4.8.
Beim automatisierten Aufgaben-Test AutomationBench erreichte es 31,8 Punkte und drückt sowohl die 29,1 Punkte von Fable 5 als auch die 27,2 Punkte von Opus 4.8 unter sich.
Die direkteste Konkurrenz ereignete sich bei Terminal-Bench 2.1.
DeepSeek erreichte 87,9 Punkte, übertrifft die 85,0 Punkte von Opus 4.8 und liegt nur 0,1 Punkte hinter den 88,0 Punkten von Fable 5.
In mehreren anderen schwierigen Agent-Tests hat DeepSeek Opus 4.8 deutlich übertroffen.
Beim „letzten menschlichen Test“ mit Werkzeugnutzung erreichte es 60,0 Punkte, übertrifft die 57,9 Punkte von Opus 4.8 und nähert sich weiter den 63,0 Punkten von Fable 5.
Sogar im Bereich des Software-Engineering-Agenten, der vorher der schwächste Punkt war, ist die Punktzahl von DeepSWE von 12,8 Punkten in der Vorschauversion auf 62,7 Punkte angestiegen, was fast dem 4,9-fachen des ursprünglichen Werts entspricht.
Diese Punktzahl übertrifft nicht nur die 58,0 Punkte von Opus 4.8, sondern liegt auch nur noch 7,3 Punkte hinter den 70,0 Punkten von Fable 5.
Zur gleichen Zeit hat Elon Musk auch Fable 5 und GPT-5.6 Sol unter Druck gesetzt.
Grok 4.6 hat zuerst GPT-5.6 in der Gesamtleistung eingeholt und dann in Codierungstests kontinuierlich überholt.
Beim allgemeinen Intelligenzindex erreichte es 61 Punkte, nur 1 Punkt hinter den 62 Punkten von Fable 5.
Auf CursorBench erreichte es 69,9 %, übertrifft die 67,2 % von GPT-5.6 und liegt nur 0,6 Prozentpunkte hinter den 70,5 % von Fable 5.
Auf FrontierCode erreichte es 61,3 %, übertrifft ebenfalls die 60,6 % von GPT-5.6 und verfolgt weiter die 63,6 % von Fable 5.
In Wissensarbeiten, die näher an der tatsächlichen Arbeitslieferung im Berufsleben sind, hat Grok 4.6 direkt die Oberhand gewonnen und in allen drei Bewertungen den ersten Platz belegt.
In GDPval-AA v2 erreichte es 1753 Elo, übertrifft 1741 von Fable 5 und auch 1728 von GPT-5.6.
Auf AA-Briefcase erreichte es erneut 1577 Elo, übertrifft 1574 von Fable 5 und 1502 von GPT-5.6.
Bei professionellen Rechtsaufgaben Harvey LAB erreichte es 15,8 %, während Fable 5 nur 11,3 % und GPT-5.6 sogar nur 2,5 % erreichte.
Noch beeindruckender ist, dass DeepSeek V4 Pro und Grok 4.6 nicht nur in der Leistung die Spitzenmodelle von OpenAI und Anthropic erreichen, sondern gemeinsam den Preis für fortschrittliche Intelligenz senken.
Pro Million Ausgabe-Token kostet Grok 4,6 6 US-Dollar, GPT-5.6 Sol 30 US-Dollar, Claude Opus 5 25 US-Dollar und Fable 5 50 US-Dollar.
Und DeepSeek kostet nur 0,87 US-Dollar —
Das ist etwa 1/7 des Preises von Grok 4.6, 1/35 von GPT-5.6 Sol, 1/29 von Claude Opus 5 und 1/57 von Fable 5!
Erster Test im gesamten Netzwerk
DeepSeek gegen Grok
Jetzt liegen die ersten praktischen Testergebnisse vor. DeepSeek V4 Pro und Grok 4.6 sind endlich von den Benchmark-Listen in die echte Aufgabenpraxis eingetreten.
In der ersten Runde haben wir DeepSeek direkt eine hohe Belastung auferlegt.
Mit nur einem einzigen Prompt hat es im Browser von Grund auf eine vollständige interaktive 3D-Erde erstellt.
Grundlegende Interaktionen wie Ziehen, Drehen und Skalieren sind alle nutzbar; globale Datenströme, dynamische Routen und geografische Markierungen sind vollständig auf der Erdoberfläche verteilt.
Bei genauer Betrachtung sind auch atmosphärische Streuung, Wolkenrendering, Tag-Nacht-Licht- und Schatteneffekte sowie die gesamte Benutzeroberfläche vollständig vorhanden.
Als Nächstes haben wir die beiden Modelle direkt auf die gleiche Wettbewerbsplattform gebracht.
Der AI-Blogger „Xiangyang Qiaomu“ hat zuerst drei kleine Aufgaben nacheinander mit DeepSeek V4 Pro ausgeführt, dann die gleichen Prompts für zwei dieser Aufgaben an Grok 4.6 übergeben, um die Endergebnisse direkt zu vergleichen.
Die erste Aufgabe besteht darin, 3 Skills aufzurufen, um eine Website zu entwickeln und bereitzustellen.
DeepSeek hat den gesamten Ablauf reibungslos durchgeführt, bei Seitendesign und Vollständigkeit zeigt es eine sehr stabile Gesamtleistung.
Die zweite Aufgabe besteht darin, 60 Designstile auf einmal nachzubilden und eine ganze Reihe von Bento-Karten zur gemeinsamen Anzeige zu erstellen.
In dieser Runde hat DeepSeek deutliche Unterschiede bei Schriftarten, Farbschemata und Layouts erzeugt, der gesamte visuelle Effekt ist ziemlich gut.
Die letzte Aufgabe besteht darin, von Grund auf ein 3D-Breakout-Spiel zu erstellen.
Das Spiel kann nicht nur direkt gespielt werden, sondern enthält auch dreidimensionale Szenen, Hintergrundmusik und dynamische Soundeffekte, die Betriebsrückmeldungen und Spielbarkeit sind voll gegeben.
Anschließend wurden die gleichen Prompts an Grok 4.6 übergeben.
Bei der 3D-Breakout-Aufgabe liegen die beiden Modelle fast gleichauf.
Das von Grok erzeugte Spiel hat ebenfalls eine gute Qualität, egal ob bei visuellen Effekten, Szenenvollständigkeit oder Spielbarkeit ist es mit DeepSeek V4 Pro vergleichbar.
Bei der Aufgabe mit 60 Bento-Designs hat Grok 4.6 einen Punkt zurückgewonnen.
Einige der von ihm erzeugten Seiten sind in Layout, Farbschema und visueller Hierarchie ausgereifter, das Endergebnis sieht auch besser aus.
Ein noch intensiverer Wettbewerb fand bei Flappy Bird statt.
Der Entwickler Jun Song gab völlig identische Prompts an und ließ DeepSeek V4 Pro und Grok 4.6 jeweils von Grund auf ein Spiel „von Hand erstellen“.
Das Ergebnis ist, dass die beiden Modelle völlig unterschiedliche Wege eingeschlagen haben.
DeepSeek V4 Pro verbrachte mehr als 20.000 Token bei Kosten von nur 0,019 US-Dollar; Grok 4.6 nutzte nur etwa 5000 Token, die Kosten betrugen aber 0,03 US-Dollar.
Aber beim Endergebnis ist DeepSeek in dieser Runde deutlich überlegen.
Das Spiel enthält nicht nur Bergkulissen und geschichtete Wolken, sondern die Rohre haben auch Verläufe und Volumen. Wenn die Figur durch die Rohre fliegt, erscheint sogar eine schwebende Animation mit der Aufschrift „+1“ auf dem Bildschirm.
Von der Szenenhierarchie bis zu den Betriebsrückmeldungen sind fast alle Details perfekt umgesetzt, die Vollständigkeit der End-to-End-Erstellung ist deutlich höher als bei Grok 4.6.
In einem weiteren Frontend-Test, der vom Entwickler Hamza durchgeführt wurde, hat DeepSeek V4 Pro Grok 4.6 erneut übertroffen.
Sowohl bei der Seitendvollständigkeit als auch beim endgültigen visuellen Effekt ist das von V4 Pro gelieferte Ergebnis besser.
Allerdings ist V4 Pro nicht in jedem Fall perfekt.
In einem Vergleichstest mit Pelikanen hat V4 Pro im Vergleich zur Flash-Version eine höhere Gesamtvollständigkeit des Bildes und ein schöneres Ele