StartseiteArtikel

CPU feiert sein Comeback auf dem Markt – ein 170-Milliarden-Dollar-Spiel um die Vorherrschaft beginnt

36氪的朋友们2026-06-22 09:35
Die CPU ist die am meisten über die Erwartungen hinausgehende Variable im aktuellen KI-Zyklus. Da sich die KI vom Dialog zum Agenten entwickelt, hat der Bedarf an CPUs für Inferenz den für das Training bereits überstiegen.

Am 1. Juni hat NVIDIA auf der GTC Taipei 2026, die während der Computex Taipei stattfand, die Vera CPU vorgestellt. Gleichzeitig hat es die neue Generation des AI-Supercomputer-Platforms Vera Rubin vorgestellt. Die ersten Kunden umfassen OpenAI und Anthropic.

Dies ist die erste Zeit, dass NVIDIA eine unabhängige CPU-Produktlinie einführt. NVIDIA hat in den letzten 20 Jahren fast ausschließlich auf der GPU aufgebaut. Huang Renxun, CEO von NVIDIA, hat auf der Pressekonferenz erklärt, dass in der Ära der AI-Agenten die CPU zum kritischen Engpass für die Leistung der Rechenzentren geworden ist. Man darf nicht zulassen, dass die CPU die Token-Produktionsgeschwindigkeit der AI-Fabriken verlangsamt.

Im vergangenen Mai hat Lisa Su, CEO von AMD, in einem Gewinntelefonat angekündigt, dass die Prognose für den Marktumfang der Server-CPUs von 60 Milliarden US-Dollar auf über 120 Milliarden US-Dollar verdoppelt wird. Die entsprechende durchschnittliche jährliche Wachstumsrate von 2025 bis 2030 steigt von 18 % auf 35 %.

Nach Statistiken der IDC hat der weltweite Servermarkt im Jahr 2025 einen Umsatz von 444,1 Milliarden US-Dollar erreicht, was einem Anstieg von 80,4 % gegenüber dem Vorjahr entspricht. Die AI-Server haben den größten Teil des Zuwachses beigetragen. Die UBS hat in einem kürzlich veröffentlichten Bericht über die Halbleiterbranche vorhergesagt, dass der potenzielle Marktumfang der Server-CPUs von etwa 30 Milliarden US-Dollar im Jahr 2025 auf etwa 170 Milliarden US-Dollar im Jahr 2030 steigen wird, was einem Fünffachen des ursprünglichen Werts entspricht.

Die Daten der Marktforschungsfirma Mercury Research zeigen, dass AMD im ersten Quartal 2026 einen Anteil von 46,2 % am Umsatz der Server-CPUs erreicht hat, während Intel 53,8 % hat. Allerdings hat AMD nur einen Anteil von 33,2 % an der Auslieferungszahl, während Intel immer noch 66,8 % hat. Das heißt, AMD hat mit weniger Chips einen höheren Umsatz erzielt. Die Prämienfähigkeit der Produkte mit hoher Kernzahl hat sich in diesem Quartal besonders deutlich gezeigt.

Lin Meibing, der Chefanalyst von ICTIME, hat der Economic Observer mitgeteilt, dass die CPU die am meisten überraschende Variable in der aktuellen AI-Zyklus ist. Mit der Entwicklung der AI von Dialog zu Agenten (Intelligent Agents) ist der Bedarf an CPU für die Inferenz größer geworden als für das Training.

01

Die GPU wartet auf die CPU

Intel und das Georgia Institute of Technology haben im November 2025 eine Studie mit dem Titel "A CPU-Centric Perspective on Agentic AI" veröffentlicht. In dieser Studie haben die Forscher fünf typische Agenten-Workloads getestet. Die Ergebnisse zeigen, dass die Zeit, die die CPU für die Verarbeitung benötigt, zwischen 43,8 % und 90,6 % der gesamten Verzögerung ausmacht.

Ein Analyst einer Wertpapierfirma, der die Halbleiterbranche seit langem verfolgt, hat erklärt, dass in der Phase des Trainings großer Modelle der Anteil der CPU-Arbeit nur etwa 10 % bis 30 % beträgt. Bei einigen Workloads kann es bis auf fast 40 % steigen. Der Großteil der Berechnungen wird von der GPU übernommen. Dies liegt daran, dass der Rechenprozess beim Training von großen AI-Modellen sehr regulär ist. Milliarden von Parametern werden wiederholt in Matrizenmultiplikationen auf Massendaten angewandt. Die parallele Architektur der GPU ist für diese Art von Aufgaben entwickelt worden. Die CPU ist für das Laden von Daten, die Kommunikationssteuerung und das Kopieren der Ergebnisse verantwortlich und beteiligt sich nicht an den Kern-Matrizenberechnungen.

Aber in der Inferenzphase kehrt sich dieses Verhältnis um. Der Anteil der CPU-Arbeit steigt auf über 70 % und ist in Agenten-Szenarien noch höher. Denn Agenten-Aufgaben erfordern mehrstufige Inferenzen, den Aufruf externer Tools, die Ausführung von Code, das Lesen und Schreiben in Datenbanken, das Suchen im Internet und die Zusammenstellung der Zwischenergebnisse zu einem endgültigen Output.

Programmierungshilfen, Datenanalyse-Tools und automatisierte Forschungsagenten gehören zu dieser Kategorie und sind derzeit die am schnellsten wachsenden Szenarien in der Anwendung von großen Modellen. Ein gemeinsames Merkmal dieser Aufgaben ist die intensive Steuerflusskontrolle, die komplexen Verzweigungen und die häufigen Ein- und Ausgaben. Die GPU nutzt diese seriellen und fragmentierten Aufgaben deutlich weniger effizient.

Mehrere Branchenmitglieder haben angegeben, dass die Gesamtauslastung der GPU in Agenten-Aufgaben im Allgemeinen weniger als 50 % beträgt, was weit unter der Auslastung von 70 % bis 85 % bei herkömmlichen Inferenzdiensten liegt. Der Token-Verbrauch bei der AI-Bereitstellung in Agenten-Modus ist normalerweise 20 bis 30 Mal höher als bei normalen Dialogen, da hinter einer Benutzerinteraktion oft mehrere Dutzend Tool-Aufrufe und Zwischeninferenzen liegen.

Nach Schätzungen der IDC wird die Anzahl der jährlichen Agenten-Aufgaben weltweit von etwa 44 Milliarden im Jahr 2025 auf über 400 Billionen im Jahr 2030 steigen.

Das Intel-Management hat in einem Gewinntelefonat im ersten Quartal 2026 erklärt, dass die Anzahl der CPU-Kerne pro Gigawatt Leistung in der Ära der AI-Agenten von derzeit etwa 30 Millionen auf 120 Millionen steigen könnte. Die Marktforschungsfirma Gartner hat auch vorhergesagt, dass bis 2027 40 % der Agenten-Projekte aufgrund von überschrittenen Infrastrukturkosten reduziert oder abgebrochen werden. Ein Großteil dieser Überschreitungen stammt von den kontinuierlichen Tool-Aufrufen und dem Kontextmanagement auf der CPU-Seite.

Agenten erzeugen bei der Verarbeitung von langen Dialogen und komplexen Aufgaben eine große Menge an Zwischendaten. Das AI-System muss während der Inferenz alle vorherigen Dialoginhalte und Tool-Aufruf-Ergebnisse im Gedächtnis behalten. Dies wird in der Branche als KV Cache (Key-Value Cache) bezeichnet. Dieser Cache wächst mit der Anzahl der Dialogrunden stetig an. Die eigene Speicherkapazität der GPU ist jedoch sehr begrenzt. Die NVIDIA H100 hat nur 80 GB, und die nächste Generation B200 hat nur 192 GB. Die Zwischendaten, die eine komplexe Agenten-Aufgabe erzeugt, können leicht diese Obergrenze überschreiten.

Derzeit wird allgemein die Methode angewandt, diese Zwischendaten von der GPU auf die CPU-Seite zu übertragen. Die CPU kann externe DDR5-Speicher anschließen, deren einzelne Kapazität mehrere Terabyte erreichen kann, was um ein bis zwei Größenordnungen größer ist als die GPU-Speicher.

Die CXL-Industrieallianz, die aus Chip-Herstellern wie Intel, AMD und ARM besteht, hat im November 2025 das CXL 4.0-Protokoll (Compute Express Link, ein offener Standard für die Hochgeschwindigkeitsverbindung zwischen Chips) veröffentlicht. Dieses Protokoll ermöglicht es mehreren CPUs, denselben Speicherpool mit großer Kapazität zu teilen und die Kosten für den Datentransfer zwischen den Chips zu reduzieren.

Somit ist die CPU nicht mehr nur für die Aufgabensteuerung verantwortlich, sondern auch für die Datenspeicherung und das Speichermanagement während des AI-Inferenzprozesses.

Li Bin, der stellvertretende R & D-Vorstand von Beijing Qingwei Intelligence Technology Co., Ltd., hat erklärt, dass wenn die AI-Rechenleistungskluster auf die Größe von Superknoten mit Tausenden von direkt verbundenen Chips erweitert werden, die Komplexität der Verbindung und Steuerung zwischen den Chips exponentiell steigt. Das Qingwei Intelligence-System kann bereits 4.096 Chips direkt verbinden, und die Verbindungskosten sind im Vergleich zu herkömmlichen Lösungen erheblich reduziert.

Li Bin hat gesagt, dass die Superknotentechnologie an sich nicht neu ist. Die Zunahme der Parametergröße großer Modelle hat diese Art von Architektur erst sinnvoll gemacht. In einem Cluster dieser Größe übernimmt die CPU viel mehr Koordinierungs- und Verwaltungsarbeit als bei kleineren Anlagen.

Außerdem hat die CPU in den letzten Jahren eine intensive technologische Aufrüstung erfahren. Die Anzahl der Kerne von Server-CPUs ist von 28 Kernen im Jahr 2017 auf 288 Kerne (Intel Clearwater Forest) und 256 Kerne (AMD Venice) im Jahr 2026 gestiegen, was einer nahezu zehnfachen Zunahme der Dichte entspricht.

Intel hat 2023 die AMX (Advanced Matrix Extensions)-Befehlssammlung eingeführt, die es der CPU erstmals ermöglicht, über eine spezielle Matrixberechnungseinheit zu verfügen. Nach Testdaten von Intel ist die AI-Leistung des vierten Generation Xeon-Prozessors mit AMX in Deep Learning-Inferenzszenarien gegenüber der vorherigen Generation um bis zu fast zehn Mal höher. Das Speichersubsystem ist von DDR4 auf DDR5 upgradet worden, und sowohl die Bandbreite als auch die Kapazität einer einzelnen Plattform haben sich verdoppelt.

Die Aufrüstung der Kernzahl und der Befehlssammlung hat auch eine Veränderung des Verhältnisses zwischen CPU und GPU zur Folge. Pat Gelsinger, CEO von Intel, hat in einem Gewinntelefonat im ersten Quartal 2026 erklärt, dass in Trainingsszenarien normalerweise 7 bis 8 GPUs auf eine CPU kommen, in Inferenzszenarien konvergiert dieses Verhältnis auf 3 bis 4 GPUs auf eine CPU und in Agenten-Szenarien ist es möglicherweise sogar auf 1:1 zu konvergieren.

David Zinsner, CFO von Intel, hat in demselben Telefonat ergänzt, dass das Verhältnis zwischen CPU und GPU in der gesamten Branche von 1:8 in der Vergangenheit auf etwa 1:4 konvergiert ist.

02

Erster großer Preisanstieg seit über einem Jahrzehnt

Diese Veränderung des Verhältnisses hat sich auf die Produktpreise ausgewirkt.

Jia Bin, der Marktverantwortliche eines CPU-Händlers in Shenzhen, hat dem Reporter mitgeteilt, dass Intel und AMD seit Februar 2026 die Preise ihrer gesamten Server-CPU-Serie schrittweise erhöht haben. Der Gesamtpreisanstieg liegt zwischen 10 % und 15 %. Der Spot-Preis-Prämium für einige hochwertige AI-Server-CPUs ist noch höher, und es könnte im zweiten Halbjahr eine weitere Preiserhöhung geben.

Jia Bin hat gesagt, dass die Server-CPUs in den letzten über zehn Jahren im Wesentlichen "mehr Leistung bei gleichem Preis" boten. Die Leistung hat sich mit der Verbesserung des Herstellungsprozesses erhöht, aber der Einzelpreis ist gleich geblieben. Dieser Preisanstieg in diesem Jahr ist in der Branche sehr ungewöhnlich. Die Kapazitätsauslastung der Hauptproduktionslinien von Intel ist von weniger als 80 % auf 100 % gestiegen, und mehrere Modelle sind ausverkauft. Die Lieferzeit beträgt 3 bis 4 Monate.

AMD steht ebenfalls vor einer Kapazitätsknappheit. Jia Bin hat gesagt, dass 2026 das erste Mal in seiner Laufbahn ist, dass die Server-CPU-Kapazitäten von Intel und AMD fast vollständig ausgebucht sind. "In der Vergangenheit war die CPU-Zusammensetzung immer ausreichend, aber in diesem Jahr ist es umgekehrt."

Jia Bin hat auch bemerkt, dass die Kunden bei der Anschaffung von AI-Servern ihre Anforderungen an die CPU in zwei Kategorien aufgeteilt haben. Eine Kategorie sind die CPUs, die innerhalb des Racks mit der GPU-Rechnung zusammenarbeiten. Sie streben die maximale Kernzahl an, über 128 Kernen, und der Durchschnittspreis liegt über 4.000 US-Dollar. Der Durchschnittspreis für herkömmliche Server-CPUs liegt nur bei etwas über 2.000 US-Dollar. Die andere Kategorie sind die CPUs, die außerhalb des Racks unabhängig bereitgestellt werden. Sie werden für die Tool-Ausführung, die Sandbox-Ausführung und die Aufgabenplanung von Agenten verwendet. Sie benötigen keine maximale Leistung, etwa 64 Kerne reichen aus, aber die Anzahl muss viel größer sein.

Jia Bin hat gesagt, dass jeder Agenten-Aufgabe idealerweise eine eigene CPU zugewiesen wird. Die unabhängige Bereitstellung ist effizienter als die virtuelle Partitionierung. Der Durchschnittspreis für die CPUs außerhalb des Racks liegt bei etwa 3.000 US-Dollar. "Je höher die Kernzahl, desto größer ist der Anstieg des Einzelpreises. Es ist nicht proportional. Deshalb ist es derzeit die übliche Praxis der Kunden, mittlere Produkte außerhalb des Racks zu verwenden, um die Quantität zu erhöhen, und Flaggschiffprodukte innerhalb des Racks zu verwenden, um die Leistung zu gewährleisten."

Die Bank of America Securities hat in einem am 11. Juni veröffentlichten Bericht über die Halbleiterbranche mit dem Titel "Rise of the Agents" die Prognose für den gesamten potenziellen Marktumfang (TAM) der Server-CPUs im Jahr 2030 auf über 170 Milliarden US-Dollar erhöht und diesen Markt erstmals in drei Teile aufgeteilt: etwa 30 Milliarden US-Dollar für herkömmliche Cloud-Computing-CPUs, etwa 70 Milliarden US-Dollar für die CPU der Kopfknoten von AI-Clustern und etwa 70 Milliarden US-Dollar für die CPU der unabhängigen Knoten von AI-Agenten. Der dritte Teil war im Jahr 2025 nahezu Null und ist ein völlig neuer Markt, der erst im Jahr 2026 entstanden ist.

Die Morgan Stanley hat in einem Bericht am 4. Juni ebenfalls vorhergesagt, dass die Agenten-AI bis 2030 einen zusätzlichen Bedarf von 32,5 bis 60 Milliarden US-Dollar für den Server-CPU-Markt schaffen wird. Die Zhongtai Securities hat in einem am 7. Juni veröffentlichten tiefgehenden Bericht über die CPU das Jahr 2026 als "das erste Jahr, in dem die CPU von der AI-Boom profitiert" definiert.

Der obige Bericht der Bank of America Securities hat auch eine historische Vergleichstabelle der Auslieferungszahlen aufgeführt: 2022 entsprach die Auslieferungszahl der AI-CPUs 19 % der Auslieferungszahl der AI-Beschleuniger (wie GPUs). Bis 2025 stieg dieser Anteil auf 51 %, und es wird vorausgesagt, dass er bis 2030 auf 127 % steigen wird. Nach dieser Prognose wird die Anzahl der CPUs in AI-Servern innerhalb von fünf Jahren die Anzahl der GPUs übersteigen.

03

Neue Anforderungen an chinesische CPUs

Die Informationen, die NVIDIA während der Computex Taipei bekanntgegeben hat, zeigen, dass die neu veröffentlichte Vera CPU auf der ARM-Architektur basiert (einem CPU-Befehlssatz, der für niedrigen Stromverbrauch und hohe Energieeffizienz bekannt ist und neben x86 zu den beiden Hauptarchitekturen zählt). In einem einzelnen Rack können 256 CPUs installiert werden, und es wird eine Flüssigkeitskühlung verwendet.

In Agenten-Sandbox-Szenarien ist die Leistung der Vera 1,8 Mal höher als die eines x86-Prozessors. In der neuesten NVIDIA Vera Rubin Supercomputer-Cluster (NVIDIA's nächste Generation der AI-Rechenzentrumsplattform) enthält ein 40-Rack-POD (die kleinste vollständige Recheneinheit, die aus mehreren Racks besteht) 1.152 Rubin GPUs und maximal 1.088 Vera CPUs. Das Verhältnis zwischen den beiden liegt nahe an 1:1.

NVIDIA hat auch erwähnt, dass die bisher veröffentlichte Grace CPU bereits fast 2,5 Millionen Einheiten ausgeliefert hat und dass die CPU-verwandten Einnahmen im Jahr 2026 möglicherweise nahe an 20 Milliarden US-Dollar liegen werden.

Jia Bin ist der Meinung