StartseiteArtikel

Alibaba, ByteDance und DeepSeek setzen voll auf Modelle mit 10 Billionen Parametern: ein unaufhaltsames Geldverbrennungsspiel

Tech星球2026-09-23 20:08
Alibaba, ByteDance und DeepSeek haben das Wettrüsten um große KI-Modelle neu gestartet.

Auf der Yunqi-Konferenz am 22. September hat Alibaba die Linie der „großen Parameter“ für große KI-Modelle wieder auf den Tisch gebracht.

Alibabas CEO Wu Yongming enthüllte vor Ort, dass Alibaba gerade die Vorbereitungen für das Training einer neuen Generation von künstlichen Intelligenzmodellen mit einer Parametergröße zwischen 5 Billionen und 10 Billionen trifft.

Anschließend erwähnte Liu Daheng, Leiter des Projekts Qwen LLM von der Token Foundry der ATH-Gruppe von Alibaba, ebenfalls vor Ort, dass das Scaling-Gesetz der Schlüsselpfad zur Super-Künstlichen Intelligenz (ASI) ist, und die geplante Parametergröße von Qwen4.5 und Qwen5 in Zukunft auf 5 Billionen bis 10 Billionen steigen soll.

Am selben Tag kursierte eine weitere Nachricht in der Branche: Laut einem Bericht von The Information trainiert DeepSeek derzeit ein neues Modell mit etwa 2 Billionen Parametern; Liang Wenfeng, Gründer von DeepSeek, erklärte kürzlich auf einer Investorenkonferenz, dass das Unternehmen im nächsten Schritt plant, das Modell weiter auf 8 Billionen Parameter zu bringen.

Zwei Monate zuvor, im August, berichtete die britische Financial Times unter Berufung auf informierte Personen, dass ByteDance ein großes KI-Modell mit bis zu 10 Billionen Parametern trainiert.

Parameter lassen sich im Volksmund als „Gehirnkapazität“ des großen Modells verstehen, also die Gesamtmenge der Erfahrungsgewichte, die bei der Inferenzberechnung des Modells aufgerufen werden. Was bedeutet 10 Billionen im Vergleich? Verglichen mit DeepSeek-R1, das die Branche im Jahr 2025 in Aufregung versetzte, betrug seine damalige Parameterzahl nur 671 Milliarden, weniger als ein Fünfzehntel von 10 Billionen.

Von Alibaba über DeepSeek bis hin zu ByteDance haben chinesische Unternehmen für große KI-Modelle gemeinsam den Glauben an „je größer die Parameter, desto besser“ wiederbelebt.

Auf der anderen Seite des Größenwettbewerbs gilt: Je größer die Parameter sind, desto höher sind die eingesetzten Ressourcen und Kosten, und die Intelligenz wächst nicht im gleichen Maße. Nachdem das Modell vergrößert wurde, müssen die Daten ebenfalls vergrößert werden, und nicht nur die Quantität, sondern auch die Qualität muss verbessert werden. Wenn alle Parameter stapeln, wird die tatsächliche Trennlinie die Effizienz der Rechenleistung, d. h. wie viel Intelligenz pro Einheit der Rechenleistung zurückgewonnen werden kann.

Alibaba, DeepSeek und ByteDance setzen alles auf 10 Billionen Parameter

Unter den bereits veröffentlichten Modellen ist der Spitzenwert der chinesischen Seite das Kimi K3, das von Moonshot AI im Juli vorgestellt wurde, mit insgesamt 2,8 Billionen Parametern, es ist das weltweit erste Open-Source-Modell im Bereich von 3 Billionen Parametern. Das aktuelle Flaggschiff von Alibaba, Qwen 3.8-Max, hat etwa 2,4 Billionen Parameter, und das aktive V4-Pro von DeepSeek hat 1,6 Billionen Parameter.

Wenn man den Blick auf das Ausland richtet, ist die Parametergröße der Closed-Source-Gruppe noch höher. Branchenschätzungen zufolge hat Mythos 5 von Anthropic etwa 8 Billionen Parameter, Fable 5 etwa 5 Billionen.

Das heißt, der Parameter-Spitzenwert der veröffentlichten chinesischen Modelle liegt noch ein bis zwei Mal unter dem geschätzten Spitzenniveau der ausländischen Anbieter. Wenn man 10 Billionen als Ziel nimmt, müssen alle aktuellen Flaggschiffe im Allgemeinen noch etwa fünfmal vergrößert werden.

Dann stellt sich die Frage: Sind größere Parameter wirklich besser?

Die Logik, die die Ansicht „je größer, desto besser“ stützt, verweist auf das Scaling-Gesetz, das besagt, dass die Fähigkeiten des Modells steigen, wenn Modell, Daten und Rechenleistung gleichzeitig vergrößert werden.

In den letzten Jahren, von mehreren hundert Milliarden bis zu mehreren Billionen Parametern, war jeder Sprung der Parameter mit einem sichtbaren Sprung der Fähigkeiten verbunden. Theoretisch bedeuten größere Parameter tatsächlich eine höhere Leistung.

Und das ist auch der Grund, warum Liu Daheng das Scaling-Gesetz als den Schlüsselpfad für Alibaba zur Erreichung von ASI bezeichnet.

Aber das Scaling-Gesetz ist nicht unbegrenzt wirksam. Es erfordert Voraussetzungen: Wenn die Parameter größer werden, müssen Datenmenge und Rechenleistung im gleichen Verhältnis nachziehen, und es muss sich um „hochwertige Daten“ handeln.

Auf der Ebene von mehreren Billionen Parametern sinkt der Grenzertrag deutlich, wenn man nur Parameter stapelt. Aus praktischer Sicht wird also ein sogenanntes Modell mit 10 Billionen Parametern keine gleichmäßige Steigerung der Fähigkeiten erreichen, wenn es nicht mit der entsprechenden Menge an hochwertigen Textkorpora versorgt werden kann.

Es gibt noch weitere Variablen: Daten, Trainingsmethoden, Architektur und Algorithmen bei der Inferenz.

Zum Beispiel hat Kimi K3 insgesamt 2,8 Billionen Parameter, verwendet aber die MoE-Architektur (Mixture of Experts), bei der 896 Experten jeweils nur 16 aktivieren, die tatsächlich aktivierten Parameter betragen nur etwa 104 Milliarden. Das heißt, nominell sind es 2,8 Billionen, aber bei der tatsächlichen Arbeit werden bei weitem nicht so viele verwendet.

In der praktischen Nutzung bedeuten große Parameter auch nicht gleich „gut zu benutzen“.

Einerseits ist die Inferenz umso langsamer, je größer das Modell ist, und die Wartezeit der Nutzer verlängert sich sichtbar. Andererseits steigen die Inferenzkosten entsprechend, was sich letztendlich auf den Preis auswirkt. Selbst bei Flaggschiff-Modellen mit mehreren hundert Milliarden oder sogar zwei bis drei Billionen Parametern sind die tatsächlichen Nutzungskosten für Nutzer bereits sehr hoch.

Also lassen wir die Frage „ob es gut zu benutzen ist“ beiseite und kehren zum Wettbewerb selbst zurück: Die Parametergrenze bestimmt die Obergrenze der Fähigkeiten, und die Obergrenze bestimmt die Rangfolge.

Das ist genau der Grund, warum Alibaba, ByteDance und DeepSeek trotz des sinkenden Grenzertrags und der hohen Kosten auf 5 Billionen bis 10 Billionen Parameter zusteuern: Der Wettbewerb um große Parameter gilt nicht für das aktuelle Nutzungserlebnis, sondern für die Eintrittskarte für die nächste Generation von Modellen.

Die Rechnung von 10 Billionen: Große KI-Modelle verbrennen Geld – wer kann das aushalten?

Super-Modelle können zwar eine höhere Intelligenz erreichen, aber eine größere Basis bedeutet mehr Ressourcen für Training und Bereitstellung. Dass große KI-Modelle Geld verbrennen, ist bereits ein unausgesprochenes Konsens unter allen großen Unternehmen.

Ausland sind die Kapitalausgaben von Microsoft, Google, Meta und Amazon im Jahr 2026 auf etwa 720 bis 745 Milliarden US-Dollar gestiegen.

Der inländische Markt ist ebenfalls aggressiv: Alibabas Kapitalausgaben im zweiten Quartal 2026 beliefen sich auf 67,7 Milliarden Yuan, ein Anstieg von 75 % gegenüber dem Vorjahr, und der freie Cashflow sank plötzlich von 73,8 Milliarden Yuan positiv auf 46,6 Milliarden Yuan negativ. Die Obergrenze der Kapitalausgaben von ByteDance im Jahr 2026 kann bis zu 70 Milliarden US-Dollar erreichen, etwa das Dreifache des Vorjahres, und im Jahr 2027 könnte sie sogar 100 Milliarden US-Dollar übersteigen.

Wofür wird das Geld ausgegeben? Der direkteste Posten ist die Infrastruktur.

Als OpenAI GPT-4 trainierte, belief sich der Bedarf an Rechenleistung auf mehrere hundert Milliarden Token, Tausende von GPUs mussten in hochvernetzten Clustern wochen- oder sogar monatelang zusammenarbeiten. Damals betrug die Parameterzahl von GPT-4 nur 2 Billionen.

Für das Vortraining eines Modells mit 10 Billionen Parametern sind noch viel mehr GPUs und eine viel längere Laufzeit erforderlich, was bedeutet, dass Zehntausende von Hochleistungs-GPUs mehrere Monate lang ununterbrochen laufen. Stromkosten, Cluster-Betrieb und Chip-Einkauf sind allesamt astronomische Summen.

Allein aus der Perspektive der Investitionen in Rechenzentren kündigte Wu Yongming auf der Yunqi-Konferenz an, dass der Umfang der globalen Rechenzentren, die Alibaba Cloud bis 2032 betreibt, über 20 GW liegen wird. Laut früheren Schätzungen von Goldman Sachs beträgt die aktuell in Betrieb genommene Kapazität von Alibaba etwa 3 bis 4 GW. Das bedeutet, dass in den nächsten sechs Jahren etwa 16 bis 17 GW neu hinzugefügt werden müssen, was den Umfang auf mehr als das Fünffache des aktuellen Niveaus erweitert.

Unter Bezugnahme auf die Informationen, die Jensen Huang von NVIDIA kürzlich in einer Gewinnkonferenz mitgeteilt hat, betragen die Kosten für den Aufbau von 1 GW Rechenleistung etwa 50 bis 60 Milliarden US-Dollar – nach dieser Berechnung könnten die gesamten Bauinvestitionen für die 16 bis 17 GW, die Alibaba in den nächsten sechs Jahren neu hinzufügt, einen Umfang von 800 bis 1000 Milliarden US-Dollar erreichen.

Zweitens sind die Inferenzkosten zu nennen. Das Training des Modells ist nicht das Ende, sondern der Anfang. Je größer die Parameter sind, desto mehr Rechenleistung wird bei jeder Generierung einer Antwort aufgerufen. Wenn das Modell für den täglichen Gebrauch von Millionen von Nutzern bereitgestellt wird, sind die Stromkosten und der Rechenleistungsaufwand auf der Inferenzseite oft dauerhafter und geldverbrennender als das Training.

Es gibt noch eine leicht zu übersehende unsichtbare Rechnung: Daten. Wenn das Modell vergrößert wird, müssen die Trainingsdaten gleichzeitig vergrößert werden, und nicht nur die Quantität, sondern auch die Qualität muss verbessert werden. Der aktuelle Konsens der Branche ist, dass hochwertige, fein gereinigte und annotierte Daten knapper sind als reine Rechenleistung.

Stehen die drei Rechnungen vor uns – können die Spieler das aushalten?

Der Cashflow hat bereits eine Warnung ausgegeben. In den letzten fünf Quartalen war der freie Cashflow von Alibaba in vier Quartalen negativ. Im neuesten Quartal beliefen sich die Kapitalausgaben auf bis zu 67,7 Milliarden Yuan. Die etwa 474,5 Milliarden Yuan an Bargeld und liquiden Investitionen auf dem Konto reichen vorerst als Rücklage aus, und letzten Monat hat Alibaba durch eine Platzierung an der Hongkonger Börse etwa 80 Milliarden Hongkong-Dollar für die KI-Infrastruktur beschafft.

Aber angesichts der Billionen-US-Dollar-schweren Investitionen in die Rechenleistung reicht diese Menge an Kapital bei weitem nicht aus, und eine fortlaufende externe Finanzierung ist fast unvermeidlich.

Die Situation von ByteDance ist ähnlich. Laut einem Bericht von The Information sank der Nettogewinn von ByteDance im ersten Halbjahr dieses Jahres um einen einstelligen Prozentsatz gegenüber dem Vorjahr auf etwa 20 Milliarden US-Dollar. Es ist das chinesische Technologieunternehmen mit den größten KI-Kapitalausgaben: Die KI-bezogenen Investitionen beliefen sich 2025 auf 150 Milliarden Yuan und werden 2026 auf 200 Milliarden Yuan steigen.

Angesichts der Finanzierungslücke hat ByteDance kürzlich einen syndizierten Kredit über etwa 30 Milliarden US-Dollar abgeschlossen, der größte in der Geschichte von Technologieunternehmen. Ein Teil der Mittel soll in die stetig erweiterte KI-Infrastruktur investiert werden.

Ein nicht aufhaltbarer Wettrüsten: Von Flash zu 10 Billionen Parametern

Weniger als einen Monat vor der Yunqi-Konferenz hat Alibaba gerade Qwen3.8-Flash-Next vorgestellt: insgesamt 125 Milliarden Parameter, bei jeder Inferenz werden nur 6 Milliarden aktiviert, die Trainingskosten sind im Vergleich zum Vorgänger um fast 90 % gesunken, und der niedrigste API-Preis beträgt nur ein Drittel von DeepSeek-V4-Flash.

Am selben Tag landete auch GLM-5.3-Flash von Zhipu AI auf der Open-Source-Liste, mit insgesamt 320 Milliarden Parametern und 180 Millionen aktivierten Parametern.

In diesen zwei Wochen sprach die Branche von einer „Kostenrevolution“: Der entscheidende Faktor des Modellwettbewerbs liegt darin, wer sparsamer ist, wer schneller ist und wer die Stückkosten bei häufigen Aufrufen auf das Minimum drücken kann.

Einen Monat später rückte die Yunqi-Konferenz das Wort „groß“ wieder in den Mittelpunkt, und die beiden Spielarten koexistieren nun.

Aus der Sicht des Modells selbst optimieren Modelle wie Flash Szenarien mit „hoher Frequenz, Echtzeit und Kostenempfindlichkeit“, bei denen Nutzer Geschwindigkeit und Niedrigpreis verlangen, also werden die aktivierten Parameter auf ein Minimum gedrückt.

Große Parameter-Modelle hingegen optimieren die schwierigsten, vielfältigsten und am breitesten abzudeckenden Szenarien, die die stärkste Inferenz, die längsten Agenten-Ketten und die breiteste Fähigkeitsabdeckung verlangen.

Was diese beiden Spielarten koexistieren lassen und sogar zwischen ihnen wechseln kann, ist die MoE-Architektur (Mixture of Experts), die das Modell in zahlreiche „Experten“ aufteilt und bei jeder Inferenz nur einen Teil davon aktiviert. Sein zentralster Beitrag besteht darin, die Gesamtparameter und die tatsächlich aufgerufenen Parameter vollständig zu entkoppeln: Die Gesamtparameter können weiter wachsen, um die Obergrenze der Fähigkeiten zu stützen; der einmalige Rechenaufwand wird hingegen begrenzt und steigt nicht im gleichen Maße mit der Gesamtgröße.

Für Hersteller von großen KI-Modellen löst die MoE-Architektur die Kostenstruktur selbst auf: Die Trainingskosten sind kontrollierbar, die Inferenz wird nach aktivierten Parametern abgerechnet – das bedeutet, dass man mit derselben Basis gleichzeitig auf die beiden Linien „klein und schnell“ sowie „groß und stark“ setzen kann.

Sowohl Flash als auch große Parameter beantworten letztendlich dieselbe Frage: Wie man jeden ausgegebenen Euro in mehr Intelligenz umwandeln kann.

Allerdings sind große Parameter noch eine Erwartung, 10 Billionen sind nur eine Zahl auf der Präsentation. Der Spitzenwert der aktuellen chinesischen Flaggschiffe liegt noch bei 2,8 Billionen. Wenn das Modell wirklich in Betrieb geht, hat sich der Spieltisch möglicherweise bereits neu gemischt. Dann sind 10 Billionen nicht mehr das Ziel, sondern die neue Startlinie.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Tech Planet“ (ID: tech618), Autor: Ren Xueyun, Veröffentlicht mit Genehmigung von 36Kr.