StartseiteArtikel

Liang Wenfeng unterwirft sich Elon Musk nicht.

Tech星球2026-08-15 09:37
Drei entscheidende Schlachten zwischen Liang Wenfeng und Elon Musk.

Über Nacht sind Liang Wenfeng und Elon Musk frontal miteinander kollidiert.

In der Nacht zum 12. August wurde DeepSeek V4-Pro zuerst leise in der API-Dokumentation veröffentlicht, danach verschwanden die Banner und Ankündigungen auf der offiziellen Website auf seltsame Weise; erst um 19:19 Uhr am nächsten Tag gab der offizielle WeChat-Account die offizielle Bekanntgabe heraus.

Vom Debüt der Vorschauversion am 24. April bis zur Einführung dieser offiziellen Version vergingen insgesamt 111 Tage. Es war ursprünglich für Mitte Juli geplant, wurde mehrmals verschoben und erschien schließlich Mitte August. Fast zur gleichen Zeit brachte SpaceXAI von Elon Musk Grok 4.6 auf den Markt.

Der Wettbewerb zwischen zwei SOTA-Modellen auf gleicher Bühne ist keine Seltenheit. Insgesamt gesehen hat DeepSeek V4-Pro Vorteile in spezifischen Bereichen wie KI-Sicherheit (Cybergym) und Workflow-Automatisierung (AutomationBench); während Grok 4.6 in Tests wie dem Comprehensive Intelligence Index (Artificial Analysis) und Softwareentwicklung (DeepSWE) bessere Leistungen erbringt und einen deutlichen Vorteil bei der Kosteneffizienz aufweist.

Am Morgen des 13. August, als einige Entwickler die Fähigkeiten von DeepSeek V4-Pro in Frage stellten, warf DeepSeek eine „Tiefseebombe“ aus: Harness. Am Tag davor veröffentlichte Elon Musk ebenfalls den intelligenten Agenten Grok Bot.

Intelligente Agenten sind zum intensivsten Teil dieser Wettbewerbsrunde geworden. Innerhalb einer halben Stunde nach der Veröffentlichung von DeepSeek Harness überschritt die Anzahl der GitHub-Sterne 10.000 und innerhalb von 12 Stunden 50.000. Es baut eine Agent-Ökologie nach dem Konzept „Alles ist ein Plugin“ auf; während Grok Bot den Weg eines allumfassenden Cloud-Assistenten geht und sich auf das 7×24-Stunden-„Begleitlernen“ konzentriert.

Aber der Wettbewerb ist noch lange nicht vorbei. Während die Modelle frontal gegeneinander antreten, hat DeepSeek bereits den Plan für den Aufbau eines eigenen Rechenzentrums gestartet, um die Mängel bei der Rechenleistung auf unterster Ebene auszugleichen. Auf der anderen Seite gab Elon Musk eine kühne Erklärung ab, dass die Rechenkapazität von SpaceXAI innerhalb von fünf Jahren die Summe der Rechenleistung aller anderen Unternehmen übertreffen wird.

Auf der einen Seite steht DeepSeek, das sich auf den Aufbau einer eigenen Rechenleistungsbasis konzentriert und durch Ingenieureffizienz aufholt, auf der anderen Seite xAI, das über Supercomputercluster verfügt und voller Ambitionen ist. Grundmodelle messen sich an der harten Stärke, intelligente Agenten konkurrieren um den Eingang der nächsten Anwendungsgeneration, und die Rechenleistung bestimmt die Obergrenze der langfristigen Entwicklung. Die drei Schlachtfelder Modell, intelligente Agenten und Rechenleistung sind eng miteinander verknüpft, und der dreiründige Wettbewerb zwischen Liang Wenfeng und Elon Musk hat damit begonnen.

Grundmodell: Elon Musks Version ist günstiger und besser

Claude Fable 5, das von Anthropic eingeführt wurde, ist derzeit der allgemein anerkannte Höchststand der Fähigkeiten für komplexe intelligente Agenten in der KI-Branche: Mit seinen herausragenden Fähigkeiten zur Verarbeitung langer Ketten von Aufgaben und zur Rekonstruktion von großem Ingenieurcode belegt es seit langem den ersten Platz in der Wertungsliste der Agent-Spur.

In der Nacht, in der DeepSeek V4-Pro und Grok 4.6 gleichzeitig debütierten, standen die beiden Modelle direkt vor den Augen von Fable 5 und starteten Angriffe aus verschiedenen Richtungen.

Auf der Ebene der Bewertungswerte richten die von der offiziellen Seite veröffentlichten Benchmark-Tests direkt auf die beiden derzeit in der Branche anerkannten Maßstäbe aus. DeepSeek V4-Pro ist in vielen Indikatoren insgesamt mit Fable 5 gleichzusetzen.

Grok 4.6 konzentriert sich hingegen auf langfristige intelligente Agenten, komplexe Programmierung und Wissensarbeit. Die von SpaceXAI veröffentlichten Daten lauten: Es erreichte 1753 Elo in der Bewertung von professionellen Aufgaben in der realen Welt GDPVal-AA v2, was über dem Wert von 1741 Punkten von Claude Fable 5 Max liegt. Der Artificial Analysis Intelligence Index erreichte 61 Punkte.

Nach dem Ausprobieren stellten einige Nutzer fest, dass DeepSeek seinen gewohnten Vorteil bei der Geschwindigkeit behält und Grok 4.6 übertrifft. Bei gleichem Prompt erledigte es die Aufgabe in nur 16 Minuten, was der Hälfte der Zeit von Grok entspricht, und das visuelle Ergebnis übertraf die Erwartungen.

Aber ein anderer Nutzer fand nach dem praktischen Test heraus, dass DeepSeek V4-pro mehr Zeit verbrauchte und mehr Tokens konsumierte, aber die Leistung nicht sehr gut war. Am offensichtlichsten ist, dass die Wasserwellen in der Nähe der Sichtlinie größer sein sollten, aber bei DeepSeek gibt es fast keine Wellen. Außerdem ist die Flugbahn des Segelschiffs, das mit den Wellen fährt, nicht natürlich.

Die Bewertungsergebnisse des Artificial Analysis Intelligence Index zeigen, dass V4-Pro 53 Punkte erreichte, was nur 1 Punkt höher ist als die Flash-Version. Das macht die Nutzer unzufrieden.

Neben der Leistung liegt der größte Unterschied zwischen den beiden in der Preisgestaltung.

Der aktuelle Preis von DeepSeek V4-Pro beträgt 0,43 USD pro Million Tokens für die Eingabe und 0,87 USD pro Million Tokens für die Ausgabe, und der Eingabepreis bei Cache-Treffern beträgt nur 0,0036 USD.

Verglichen mit dem Preis von Fable5 ist die normale Eingabe von DeepSeek V4-Pro 23 Mal günstiger als die von Fable5, und die Ausgabe ist 57 Mal günstiger.

Als Nächstes kommt Grok4.6: Die Eingabe kostet 2 USD pro Million Tokens, was 5 Mal günstiger ist als die von Fable 5; die Ausgabe kostet 6 USD pro Million Tokens, was mehr als 8 Mal günstiger ist als die von Fable 5.

Beim direkten horizontalen Vergleich von DeepSeek V4-Pro und Grok4.6 ist der Preisunterschied ebenfalls sehr groß. Auf der Eingabeseite liegt der Stückpreis von Grok4.6 bei etwa dem 4,7-fachen von DeepSeek V4-Pro; auf der Ausgabeseite erreicht der Preis von Grok4.6 fast das 7-fache von DeepSeek V4-Pro.

Nach der Veröffentlichung der offiziellen Version gestern kündigte DeepSeek jedoch an, dass mit der Einführung der offiziellen Version der gesamten V4-Modellreihe die API-Preise ab dem 17. August angepasst werden. Es wird ein Spitzen-Tarif angewendet, und der Preis in der Freizeit beträgt die Hälfte des Preises in der Spitzenzeit.

Nach der Anpassung, verglichen mit der Spitzenzeit, steigt der Eingabepreis bei Cache-Treffern von DeepSeek-V4 Pro auf das 12-fache, der Eingabepreis ohne Cache-Treffer auf das 3-fache und der Ausgabepreis auf das 4,5-fache. Nach der Preiserhöhung ist der Kostenvorteil von DeepSeek V4-pro in der Spitzenzeit im Vergleich zu Grok 4.6 nicht mehr deutlich.

Aber selbst vor der Preiserhöhung war der Kostenvorteil von DeepSeek V4 Pro nicht mehr sehr deutlich. Die Entwicklungsplattform Composio führte einen Vergleichstest von 30 schwierigen Aufgaben für intelligente Agenten mit den beiden Modellen durch. Die Ergebnisse zeigten, dass Grok DeepSeek in Bezug auf die Bestehensquote, Geschwindigkeit und Kosten überlegen ist.

Der Wettbewerb um intelligente Agenten: völlig unterschiedliche Wege

Gleichzeitig mit der offiziellen Veröffentlichung von DeepSeek V4-Pro öffnete DeepSeek die Entwicklervorschauversion (v0.1) von DeepSeek Harness für globale Entwickler.

Das ist nicht überraschend. In der Ankündigung steht ausdrücklich, dass die offizielle Version V4-Pro die Fähigkeiten von Agenten gezielt verbessert hat, und Harness ist das erste Produkt, das diese Fähigkeit trägt.

DeepSeek Harness ist ein Team für Code-intelligente Agenten, das DeepSeek im Mai dieses Jahres gegründet hat. Sein Kernziel ist die Entwicklung eines Desktop-Produkts für intelligente Agenten-Programmierung, das mit Anthropic Claude Code mithalten kann. Es ist derzeit das am meisten beachtete Team von DeepSeek.

Cui Tianyi, der Leiter des Harness-Teams, sagte auf der Plattform „X“, dass die aktuelle Version 0.1 eine Vorschauversion für Harness-Entwickler ist, die noch sehr unvollkommen ist, und er bittet alle, wertvolle Vorschläge zu machen.

Viele interne Testnutzer sagen, dass Harness bereits mehrere untergeordnete intelligente Agenten und Workflow-Fähigkeiten integriert hat und mehrstufige Aufgaben wie Anforderungsverständnis, Codegenerierung und Debugging-Reparatur selbstständig erledigen kann.

Seine Kernfunktion besteht darin, demselben großen Modell dynamisch unterschiedliche „Werkzeugsets“ und „Arbeitsmodi“ zuzuordnen, um verschiedene Aufgaben zu bewältigen. Die Nutzer wählen zu Beginn der Sitzung unterschiedliche „Agent-Voreinstellungen“ für das Modell entsprechend der Komplexität der Aufgabe, so als würde man demselben Experten unterschiedliche Werkzeuge zur Verfügung stellen, um Aufgaben mit unterschiedlichen Schwierigkeitsgraden zu erledigen. Einige Entwickler kommentierten, dass Harness erstaunlich ist.

Fast zur gleichen Zeit hat SpaceXAI unter Elon Musk ebenfalls Maßnahmen ergriffen. Am 12. August wurde die KI-Software „Grok Bot“ eingeführt, die behauptet, ein Team von rund um die Uhr online verfügbaren intelligenten Assistenten zu sein, die praktische Arbeitsaufgaben erledigen können, die die Nutzer ihnen zuweisen.

SpaceXAI erklärte, dass Grok Bot ursprünglich nur ein internes Prototyp war. Man hatte nicht erwartet, dass es sich im Unternehmen schnell verbreitet, und alle Teams haben Bots erstellt, um Aufgaben wie Verkaufsanrufe, Marketingaktivitäten, tägliche Bürobetrieb und Fehlerbehebung zu erledigen.

Derzeit befindet sich Grok Bot in der Testphase und steht ab sofort Abonnenten von SuperGrok Heavy, Cursor Ultra und Cursor Teams auf Plattformen wie Windows und iOS zur Verfügung.

DeepSeek Harness und Grok Bot gehen zwei völlig unterschiedliche Wege: Ersteres richtet sich an Entwickler mit dem Kernszenario der Programmierung, während Letzteres an normale Menschen gerichtet ist, die die Effizienz durch KI verbessern wollen. Praktische Tests zeigen, dass die Rekonstruktion einer Webseite mit DeepSeek Harness nur 3 Yuan kostet, aber bei langfristigen Aufgaben ist die Antwortgeschwindigkeit relativ langsam und erfordert mehrere Interaktionen. Es eignet sich besser für die Ressourcenoptimierung von langen Texten und mehrstufigen Aufgaben.

Grok Bot antwortet hingegen schnell, aber die Token-Kosten sind höher als bei Harness (Eingabe 2 $ pro Million, Ausgabe 6 $ pro Million), sodass die Gesamtkosten bei Szenarien mit langen Texten höher sein können.

Verglichen mit DeepSeek Harness hat SpaceXAI weit mehr als nur Grok Bot in der Hinterhand. Im Juni dieses Jahres erwarb SpaceX das KI-Programmier-Startup Cursor für 60 Milliarden US-Dollar.

Im Vergleich dazu ist der Rhythmus von DeepSeek zurückhaltender: Es konzentriert sich auf die eigenständige Entwicklung und holt durch Ingenieureffizienz auf. Einerseits nutzt es den Kapitalhebel, um die Zeit zu verkürzen, andererseits tauscht es durch technische Iterationen Raum ein.

Wenn beide Seiten gleichzeitig auf intelligente Agenten abzielen, wird derjenige, der die Modelfähigkeiten zuerst in echte Arbeitsszenarien einbinden kann, den Eingang der nächsten Anwendungsgeneration in der Hand halten.

Wettbewerb um Rechenleistung: Ingenieurkapazität gegen Barreserven

Rechenleistung ist der grundlegende Treiber, der bestimmt, wer weiterlaufen kann, und auch der ultimative Wettbewerb in diesem Duell.

Fast alle Modellunternehmen stoßen auf das Problem unzureichender Rechenleistung. Kimi K3 unter MoonShot hat die Rangliste aufgrund seiner hervorragenden Leistung auf einen Schlag erneuert, aber da die Nutzeranfragen die Schätzung weit überstiegen und die Rechenleistung die Belastungsgrenze des Clusters erreichte, wurde das Abonnement 48 Stunden nach der Veröffentlichung ausgesetzt.

DeepSeek tauchte dieses Jahr häufig in den heißen Suchlisten wegen Dienstunterbrechungen auf, hinter denen die starke Fehlausrichtung zwischen der sprunghaft angestiegenen Nutzerzahl und der Erweiterung der Rechenleistung steht.

Liang Wenfeng hat einmal erklärt, dass DeepSeek derzeit über eine äquivalente Rechenleistung von etwa 20.000 H100-Grafikkarten verfügt, was den USA um 12 bis 18 Monate hinterherhinkt. Die verfügbare Anzahl von in China hergestellten Rechenkarten beträgt nur 16.000, was es schwierig macht, die vollständige Trainingsiteration von Modellen mit riesigen Parametern zu unterstützen.

Die Beschränkung der Rechenleistung lässt DeepSeek bei der Auswahl der technischen Route realistischer werden. Liang Wenfeng wählte die extremste Ingenieuroptimierung, sodass die Trainingskosten von DeepSeek V3 weniger als 5,6 Millionen US-Dollar betrugen.

Aber das kann die Anforderungen der Nutzer nicht erfüllen. DeepSeek hat die Finanzierung der Serie A über 51 Milliarden Yuan abgeschlossen, und eine neue Finanzierungsrunde ist in Arbeit. Liang Wenfeng hat einmal auf einer Investorenversammlung offen gesagt, dass die eingeworbenen Gelder „so schnell wie möglich in GPUs umgewandelt werden sollen“, und wenn der Markt es erlaubt, ist die Anschaffung von Rechenleistung im Wert von 20 Milliarden Yuan im Jahr 2026 akzeptabel.

Im Vergleich dazu ist Elon Musk, der reichste Mensch der Welt, bei der Reservierung von Rechenleistung viel besser aufgestellt. Grok4.5 wurde mit zehntausenden NVIDIA GB300-GPUs trainiert. Der gesamte Rechenumfang des dahinterstehenden Colossus-Supercomputerclusters betrug im Jahr 2024 etwa 200.000 H100-GPUs, was dem 10-fachen der äquivalenten H100-Rechenleistung von DeepSeek (etwa 20.000) entspricht.

Die erste 100.000-GPU-Supercomputercluster von Colossus wurde in nur 122 Tagen vom Start bis zur Inbetriebnahme fertiggestellt, was die „Geldmacht“ und Durchsetzungsfähigkeit von Elon