Im KI-Sektor mangelt es am meisten an Übernahmeinvestoren.
Kürzlich hat ByteDance ein Syndikatskredit von 296 Milliarden US-Dollar aufgenommen, Alibaba hat eine Platzierung von 80 Milliarden Hongkong-Dollar durchgeführt. Einige Monate zuvor haben Google und Amazon mehr als 80 Milliarden US-Dollar an Kapital aufgenommen, und NVIDIA hat ein „Großprojekt“ im Wert von 5 Billionen US-Dollar vorgestellt. Alle großen Technologiekonzerne weltweit suchen verzweifelt nach Kapital, und es gibt nur eine Richtung, in die das Geld fließt: die KI-Infrastruktur.
Aus einer groß angelegten Perspektive betrachtet ist jede grundlegende Chance in der modernen Industriegeschichte, die das Zeitalter neu gestaltet, im Wesentlichen eine erstklassige Modernisierung der Infrastruktur.
Die stürmische Eisenbahnmanie im 19. Jahrhundert, der Goldrausch im amerikanischen Westen, die Immobilienentwicklung und Urbanisierung im Inland und die heutige globale KI-Infrastrukturwelle – obwohl der Prozess, in dem das Kapital massiv investiert, ständig umstritten sein und von Blasen begleitet werden kann, wird die am Ende verbleibende Infrastruktur die industrielle Entwicklung für die kommenden Jahrzehnte stabil stützen können.
Im Vergleich zu früheren globalen Infrastrukturprojekten hat diese KI-Infrastruktur jedoch einen breiteren Abdeckungsbereich, ein beispielloses Investitionsvolumen, eine unglaublich schnelle industrielle Iteration und natürlich auch größere Kontroversen.
Im Juli erlebte die KI-Infrastruktur eine heftige Schwankung, und die Kapitalmärkte begannen an der Lücke zwischen den massiven Investitionen in die KI-Infrastruktur und den daraus resultierenden Erträgen zu zweifeln. Die extensive Ära des wahllosen Hinzufügens von Grafikkarten und des wilden Erweiterns von Clustern ist noch nicht vorbei, aber der Markt beginnt sich zu fragen: Ob die Billionen von Investitionen in Rechenleistung, die getätigt werden, in Zukunft wirklich Gewinne bringen werden?
Dies ist ein Signal für Veränderungen auf der Kapital- und der Industrieseite. Der Unterschied zum letzten Jahr besteht darin, dass man in diesem Jahr deutlich spüren kann, dass normale Nutzer bereits verschiedene Desktop-Agenten routinemäßig nutzen. KI ist nicht mehr nur ein einfaches Chat-Tool, sondern wird tatsächlich zu einem Agenten, der automatisch läuft und kontinuierlich Aufgaben erledigen kann. Dieses Jahr ist das echte Gründungsjahr der Agenten.
Die weitverbreitete Popularisierung von Agenten auf der C-Seite führt auch dazu, dass der Token-Verbrauch ständig die Erwartungen übersteigt. Im März dieses Jahres überschritt der tägliche durchschnittliche Token-Aufruf im Inland 140 Billionen, was mehr als das Tausendfache des Anfangs von 2024 bedeutet.
Außerdem gibt es derzeit ein ziemlich widersprüchliches Problem. Alle rufen nach einem Mangel an Grafikkarten und kämpfen um Rechenleistung, aber in Wirklichkeit laufen viele GPUs täglich leer, sind ungenutzt und werden verschwendet. Die Carnegie Mellon University hat eine praktische Messung durchgeführt, bei der 756 GPUs 31 Tage lang ununterbrochen betrieben wurden. Dabei wurde festgestellt, dass fast 20 % der Zeit des Clusters mit „Warten“ verbracht wird.
Beispielsweise geht mehr als die Hälfte des Energieverbrauchs des Inferenzgeschäfts von OpenAI auf Leerlauf zurück; inländische intelligente Rechenzentren sind noch extremer, die durchschnittliche Auslastung der GPUs liegt unter 30 %. In den letzten Jahren konnte die rasche Entwicklung der KI-Infrastruktur das Effizienzproblem noch durch die Erhöhung des Umfangs verdecken. Aber jetzt, wo die Zeit der Erträge nahe ist, kommt es darauf an, wer die Token-Kosten senken und die Auslastung der Rechenleistung erhöhen kann.
Effizienz ist zu einem neuen entscheidenden Faktor für den Erfolg von KI-Infra geworden. Daher ist das dringende Problem jetzt, wie man die im Leerlauf befindliche Rechenleistung aktivieren und die Inferenzkosten senken kann. Während sich die Entwicklung von KI-Infra in eine tiefe Phase bewegt, nehmen die Branchengeräusche allmählich zu.
Die KI-Spur ist zu weit ausgebreitet: Chips, Stromversorgung, Hardware, Software, Modelle und Anwendungen überlagern sich Schicht für Schicht. Jeden Tag tauchen neue Finanzierungen, neue Geschichten und neue Konzepte auf, und jede Partei erzählt eine konsistente Version, die ihren eigenen Interessen entspricht. Wie in „Signale und Geräusche“ gesagt wird: In der Ära der Informationsexplosion gibt es immer mehr Geräusche als Signale, und sie erscheinen schneller als Signale.
Die KI-Branche befindet sich genau in diesem Zustand: Alle erzählen begeisterte langfristige Geschichten, aber niemand traut sich, die kurzfristige Gewissheit zu bestätigen. Wie hoch ist das Verhältnis zwischen langfristigen Dividenden und kurzfristigen Blasen bei Investitionen in die Infrastruktur im Wert von Hunderten Milliarden? Hat KI-Infra echte Barrieren? Wird die Abkühlung der Marktstimmung die Finanzierung und den Exit auf dem Primärmarkt beeinflussen? Wo liegen die Unterschiede und Lücken zwischen China und den USA bei KI-Infra? Welche Chancen gibt es, um die Konkurrenz auf der Überholspur zu überholen? Diese Fragen erfordern, die „Geräusche“ zu entfernen, um die echten „Signale“ zu finden. Mit diesen Trends und Fragen hat NetEase Finance gemeinsam mit der Zhongguancun Science City Company und der Zhongguancun Entrepreneurship Street einen tiefgehenden geschlossenen Salon mit dem Thema „Das Gründungsjahr der Agenten: Die Neuen Mächte von KI-Infra neu gestalten“ veranstaltet.
„Die sieben Schwestern halten zusammen, China ist verteilt“
In diesem KI-Infra-Salon sind Jiuzhang Yunji, Terminus und Qujing Technology alle Kernanbieter von direkten Token im Inland. Mit ihren Fähigkeiten in selbst entwickelter Planung, heterogener Integration und Optimierung der gesamten Kette haben sie jeweils eigene Ansätze, um Probleme wie den Leerlauf von GPUs, die geringe Auslastung der Rechenleistung und die hohen Inferenzkosten zu lösen.
Gerade zu dem Zeitpunkt, an dem Agenten massiv aufblühen und die Nachfrage nach Token im gesamten Netz explodiert, sind diese Unternehmen, die die Effizienz tatsächlich steigern, die Kosten senken und die stabile Versorgung mit Rechenleistung gewährleisten können, bereits zu einer zentralen grundlegenden Stütze für die verfeinerte Modernisierung von KI-Infra geworden.
Jiuzhang Yunji hat im Inland 12 Knotenpunkte für intelligente Rechenzentren angelegt und ist bereits auf den südostasiatischen Markt expandiert. Sein Geschäft deckt drei Bereiche ab: die neue Cloud für intelligente Berechnung, Trainingsfabrik und Token-Fabrik.
Shang Mingdong, Mitbegründer und COO von Jiuzhang Yunji, hat einen Branchentrend beobachtet: Auf dem US-amerikanischen Markt ist die Versorgung mit Rechenleistung hochkonzentriert, und führende Cloud-Anbieter und Unternehmen für KI-Infrastruktur bilden eine enge ökologische Zusammenarbeit. Der chinesische Markt wird dagegen eher von der tatsächlichen Nachfrage angetrieben und zeichnet sich durch eine stärkere Verteilung und eine engere Bindung an die Industrie aus.
Die Kernteammitglieder von Qujing Technology haben einen wissenschaftlichen und technischen Hintergrund im Institut für Hochleistungsrechnen der Fakultät für Informatik der Tsinghua-Universität. Sie haben die technischen Akkumulationen der relevanten Teams über mehr als zehn Jahre übernommen, und die meisten Mitglieder des Kernforschungs- und Entwicklungsteams haben einen Hintergrund an der Tsinghua-Universität. Als das Unternehmen Ende 2023 gegründet wurde, gerade zu dem Zeitpunkt, an dem der „Krieg der hundert Modelle“ sehr populär war, konzentrierte sich Qujing Technology klar auf die Inferenz von großen Modellen, was unter den damaligen Startup-Unternehmen der Branche nicht üblich war.
Wu Wenjie, Präsidentin und CFO von Qujing Technology, war vor drei Jahren noch Investorin und Forscherin in dieser Branche und hat sich nun dem Unternehmertum gewidmet. Ihre Empfindung ist: „Echte Unternehmer und Praktiker spüren tief, dass es noch eine große Lücke zwischen inländischen Grafikkarten und leistungsstarken Grafikkarten aus Übersee gibt, und es wird immer schwieriger, diese Karten zu beschaffen.“
Liu Yue, Leiter des KI-Infra-Geschäfts bei Terminus, konzentriert sich auf die Anwendungsseite. Terminus wurde 2015 in Chongqing gegründet. Es begann mit KIoT-Anwendungen und wuchs zu einem KI-IoT-Einhorn heran. Sein Aktionärskreis umfasst bekannte Investmentinstitute wie staatliche und staatseigene Unternehmen, IDG Capital und AL Capital sowie führende industrielle Kapitalgeber wie JD, iFlytek und SenseTime. Bis heute wurden seine Produkte in mehr als 170 Städten weltweit bereitgestellt und bedienen über 900 Kunden.
Seine Kernaussage lautet: Die Strategie von Terminus besteht darin, die Produktiteration von KI-Infra und Agenten durch vertikale Anwendungen voranzutreiben, was nicht mit dem auf dem Markt üblichen Weg übereinstimmt, der hauptsächlich auf allgemeine Token-Dienste und die Vermietung von Rechenleistung ausgerichtet ist. „US-amerikanische Hersteller konzentrieren sich stärker auf die Infrastruktur und die allgemeinen Modelle auf der oberen Ebene. Der chinesische Markt ist anders: Er hat eine hohe Anwendungsdichte, eine vollständige Palette von Industriebranchen und eine blühende Vielfalt an Anwendungsebenen.“
Die Lücke auf der Chipebene hat noch eine andere Form. Liu Chen, Geschäftsführender Direktor von Haisong Capital, gibt ein Beispiel: Es gibt jetzt einige neue Unternehmen, die sich ausschließlich auf Inferenzchips spezialisieren. Sie schreiben sogar die Architektur eines bestimmten Modellunternehmens direkt in den Chip, was gleichbedeutend damit ist, einen speziellen Chip für ein bestimmtes Modell herzustellen. Die Betriebseffizienz ist 100 Mal höher als bei bestehenden Lösungen. Der Nachteil ist offensichtlich: Wenn man das Modell wechselt oder das Modell iteriert, ist dieser Chip nicht mehr nutzbar.
Liu Chen erläutert weiter, dass es zwischen absoluter Allgemeinverwendbarkeit und absoluter Effizienz viele Zwischenbereiche gibt, und jeder Chip löst nur ein bestimmtes Szenario in diesen Zwischenbereichen. „Es ist schwierig, alle Probleme mit einem einzigen Unternehmen oder einem einzigen Produkt zu lösen.“ Große Unternehmen können nicht das gesamte Unternehmen kaufen, also kaufen sie Mitarbeiter und Patente.
Der Weg der inländischen allgemeinen GPUs wird durch die Erfahrungen von Imagination Vision selbst sehr deutlich veranschaulicht. Imagination Vision wurde im September 2020 in Chongqing gegründet. Sein Gründer Tang Zhimin war an der Forschung und Entwicklung von Loongson 1 und 2 beteiligt und war einer der Gründer von Hygon Information. 80 % der Forschungs- und Entwicklungsmitarbeiter stammen von Hygon Tongxin, und die zum Verkauf stehenden Produkte sind bereits in der dritten Generation. Das Unternehmen hat insgesamt etwa 3 Milliarden Yuan an Finanzmitteln aufgenommen, und seine Bewertung erreichte einmal 15 Milliarden Yuan, aber der Druck durch die Finanzmittel lastete ständig auf ihm. 2025 konnte es sich durch eine strategische Investition von mehreren Milliarden Yuan durch die Investoren erholen. Im April dieses Jahres hat es bereits mit CITIC Securities unterzeichnet, um alle Vorbereitungsarbeiten vor dem Börsengang zu beginnen.
Wang Yaoyu von Imagination Vision ist der Meinung, dass NVIDIA kein reines Hardwareunternehmen ist. Sein Erfolg liegt in der Software, die das CUDA-Ökosystem geöffnet hat. Die Verbindung von Hard- und Software aller Parteien über das Ökosystem bildet die Branchenbarriere. „Derzeit sind wir im Inland noch nicht in der Lage, dieses Niveau zu erreichen. Es ist tatsächlich sehr schwierig, den Markt für inländische GPUs vollständig allgemeinverwendbar zu gestalten, da es keine einheitliche Schnittstelle in der Branche gibt.“ Er gibt den Weg der zuerst erfolgenden Individualisierung an: „Im Gegensatz zur Schwierigkeit der Allgemeinverwendbarkeit können inländische Chiphersteller dies erreichen, und dies sollte schneller sein als die Allgemeinverwendbarkeit. Mit der raschen Erweiterung der Nachfrage nach KI-Agenten können inländische GPUs durch Individualisierung die schnell wachsende Marktnachfrage befriedigen.“
Außerdem vergrößert sich die Lücke in der Chipversorgung zwischen In- und Ausland im Vergleich zur Vergangenheit weiter. Chen Qiuwu, Mitbegründer und CTO von AIGCode, hat auf dem Salon eine Gruppe intuitiver Vergleichsdaten vorgelegt: Die Anzahl der Rechenleistungschips, die NVIDIA im letzten Jahr hergestellt hat, war 100 Mal so groß wie die von Ascend. In diesem Jahr hat sich diese Lücke auf etwa 200 Mal vergrößert.
Als technisches Team, das seit langem tief an die inländische Rechenleistung angepasst ist, arbeitet AIGCode ständig an der Optimierung der Trainings- und Inferenzleistung von inländischen Chips. Seine Dienstleistungen umfassen nicht nur Ascend, sondern in letzter Zeit auch die Anforderungen großer inländischer Unternehmen an die Optimierung von Modelltraining und Inferenz. Die Fähigkeit des Teams, inländische große Modelle anzupassen, iteriert ebenfalls schnell. Ende 2025 hat es bereits mit HiSilicon zusammengearbeitet, um das Vortraining des Modells mit 130B Parametern abzuschließen. Bis heute kann es die Trainingsaufgabe des großen Modells mit 700B Parametern auf der inländischen Hardwarebasis abschließen.
Aber die harte Kluft in der Hardwareproduktion besteht weiterhin objektiv. Selbst wenn die Softwareoptimierung die effektive Rechenleistung von einzelnen Karten und Clustern erhöhen kann, ist der unzureichende Gesamtumfang der Hardwareversorgung immer noch eine unvermeidliche reale Einschränkung für die inländische KI-Infra.
Zhang Ruiqi, Managing Partner von Junke Danmu, war früher im Angel Fund von Legend Capital tätig. Dollar-Fonds haben von Natur aus eine doppelte Währungsperspektive. Seine Meinung ist, dass China und die USA nach und nach zwei verschiedene Systeme bilden werden. „In China werden Verpackung und Wärmeableitung kurzfristig wichtiger sein, da die Herstellungsverfahren noch nicht ausgereift sind und der Stromverbrauch hoch ist. In den USA verfolgt man dagegen schon immer die fortschrittlichere Rechenleistung von Chips.“
Was das Gründungsökosystem betrifft, macht er einen Vergleich: Das US-amerikanische Venture-Capital-Ökosystem ähnelt ein wenig einer Pizza – es hat zwei Schichten und ist relativ einfach. Das chinesische ähnelt dagegen eher einem Tausend-Schichten-Kuchen und ist reichhaltiger.
Seine Beobachtung auf der Kapitalseite ist, dass die „sieben Schwestern“ an der US-amerikanischen Börse im letzten Jahr mehr als 300 Übernahmen durchgeführt haben, während die Anzahl der Übernahmen im Inland begrenzt ist. Das ist eine Lücke im Kapitalvolumen. „Chinesische Gründer sind durch den unzureichenden Gesamtkapitalbestand des Landes eingeschränkt. Im Vergleich zu dem Kapitalvolumen, das US-amerikanische Venture-Capital-Institute erhalten, fehlt mindestens die Währungseinheit – also der Wechselkurs von Dollar zu Yuan.“
Jiang Xu, Geschäftsführender Direktor von Vertex Ventures, konzentriert sich hauptsächlich auf die Speicherung und Vernetzung von Rechenzentren. Sie ist der Meinung, dass sich mit der Entwicklung der KI-Rechenleistung von einzelnen Karten und einzelnen Geräten zu Clustern mit zehntausend Karten die Engpässe allmählich von der einzelnen Berechnungsfähigkeit auf den effizienten Datenfluss zwischen Berechnung, Netzwerk und Speicher erstrecken. Je größer der Umfang der Rechenleistung ist, desto wichtiger werden der Datentransport und die Zusammenarbeit von Ressourcen, und desto mehr werden Speicherung und Vernetzung zu den entscheidenden Infrastrukturen, die die tatsächliche Auslastung der Rechenleistung von Clustern bestimmen.
Dieser Trend ist in Superknoten und großen Clustern noch deutlicher. Scale Up und Scale Out erfordern nicht nur eine höhere Vernetzungsfähigkeit zwischen mehreren Karten, sondern auch höhere Anforderungen an die Netzwerkarchitektur, den Speicherzugriff und die Zusammenarbeit von heterogener Rechenleistung. Selbst wenn die Leistung einzelner Karten ständig verbessert wird