Der Chip verbraucht viel zu viel Strom! Was soll man tun?
In modernen Chips für Rechenzentren ist die Stromversorgung zu einem entscheidenden Engpass für die Leistungssteigerung geworden. Die sprunghafte Zunahme der Arbeitslasten im Bereich der Künstlichen Intelligenz (KI) und des Hochleistungsrechnens (HPC) stellt das Stromversorgungsnetz (PDN: Power Delivery Network) vor enorme Herausforderungen, die weit über die Auslegungskapazitäten traditioneller Lösungen hinausgehen. Mit steigenden Strompegeln verstärken sich die Widerstandsverluste und der Effekt des Spannungsabfalls (Voltage Droop) im PDN. Inkrementelle Verbesserungen allein reichen nicht mehr aus, um die Anforderungen zu erfüllen. Die mehrchippige Architektur mit gestapelten Dies verschärft dieses Problem zusätzlich, da sie zu einer Erhöhung der effektiven Stromdichte, Verdrahtungsstaus und Herausforderungen bei der Zuverlässigkeit führt.
Vor kurzem hat Intel ein Weißbuch veröffentlicht, das die Herausforderungen der Stromversorgung auf allen Ebenen von Beschleunigern über Racks bis hin zu Rechenzentren untersucht und dabei schwerpunktmäßig analysiert, wie Expansions trends die Anforderungen an die Stromversorgung auf gesamter Systemebene neu gestalten. Dieser Text vertritt nicht die Auffassung, dass es eine einzige „optimale“ Lösung für die Stromversorgung gibt. Stattdessen wird eine Reihe technischer Ansätze skizziert, die erfahrene Architekten und Fachexperten unter Berücksichtigung von Systemanforderungen und Architekturabwägungen gezielt einsetzen können.
Herausforderungen bei der Stromversorgung von Chips
Die Designtrends im Bereich von Chips, Servern und Rechenzentren drängen die Stromversorgungsfähigkeit an die physikalischen Grenzen. Mit steigender Rechendichte muss das gesamte Stromversorgungsnetz (PDN) optimiert werden, um eine robuste Stromintegrität (PI) zu gewährleisten – dies erstreckt sich über alle Ebenen von Leiterplatten und Gehäusen bis hin zu den Chips selbst.
Designtrends bei der Gehäusegestaltung von Beschleunigern
Moderne Beschleunigergehäuse integrieren beispiellose Rechen-, Speicher- und Verbindungsressourcen in einem einzigen Gehäuse, um die Anforderungen an Leistung und Bandbreite von Arbeitslasten der Künstlichen Intelligenz (KI) und des Hochleistungsrechnens (HPC) zu erfüllen.
KI-Beschleuniger arbeiten normalerweise bei niedrigen Versorgungsspannungen und benötigen große Ströme, um eine hohe Leistung zu liefern (siehe Abbildung 1). Daher erfordert das moderne Integrationsniveau Ströme in der Größenordnung von mehreren Tausend Ampere (kA) auf Gehäuseebene. Diese Trends führen zu zwei grundlegenden Herausforderungen bei der Stromversorgung.
Erstens muss das Gehäuse eine enorme Leistung auf einer begrenzten Fläche übertragen, die bereits von Rechenchips, Hochgeschwindigkeitsspeicher- (HBM-) Stapeln, Hochgeschwindigkeitsverbindungen und Wärmeabfuhrinfrastruktur belegt ist. Zweitens muss der Stromversorgungsprozess effizient sein und gleichzeitig die statischen und dynamischen Verluste im Stromverteilungsnetz (PDN) minimieren.
Die effiziente Übertragung großer Ströme ist äußerst herausfordernd, insbesondere wenn sich die Stelle der Spannungswandlung weit von der Last befindet. Der Strom muss über lange widerstandsbehaftete Pfade übertragen werden, was die Widerstandsverluste erhöht und die Gesamteffizienz der Stromversorgung verringert. Darüber hinaus verschärfen höhere Ströme und schnellere transiente Änderungen den Spannungsabfall, was die Entwickler dazu zwingt, Spannungsschutzreserven (Guard Bands) einzurichten, um einen zuverlässigen Betrieb zu gewährleisten. Diese Schutzreserven erhöhen den Stromverbrauch und verringern die Systemeffizienz weiter.
Abbildung 2 zeigt, wie die Effizienz des PDN mit zunehmendem Laststrom abnimmt. Obwohl die Spannungswandlungsverluste relativ konstant bleiben, steigen die Widerstandsverluste und die mit dem Spannungsabfall verbundenen Verluste bei hohen Leistungsniveaus erheblich an.
Daher macht bei traditionellen Stromversorgungslösungen der Anteil der vom PDN verbrauchten Eingangsleistung immer größer aus, während der Anteil der effektiven Leistung, der tatsächlich für die Berechnung verwendet wird, entsprechend abnimmt.
Mehrchip- und Stapelarchitekturen
Da die traditionelle Miniaturisierungstechnik für einzelne Dies (Single-Die) zunehmend mit wirtschaftlichen und technischen Herausforderungen konfrontiert ist, wendet sich die Industrie fortschrittlichen Gehäusetechnologien zu – einschließlich Chiplets, HBM-Integration, Siliziumbrücken und 3D-Stapelung – um die Leistung und Bandbreite auf Systemebene weiter zu steigern. Obwohl diese Mehrchip- und Stapelarchitekturen eine höhere Leistung, Bandbreite und Funktionsintegration ermöglichen, bringen sie neue Herausforderungen bei der Stromverteilung, Entkopplung und Spannungsregelung mit sich.
Im Gegensatz zu traditionellen monolithischen Designs verteilen Mehrchiparchitekturen Rechen-, Speicher- und E/A-Funktionen auf mehrere Silizium-Dies, wobei jeder Die unterschiedliche Anforderungen an Spannung, Strom und Transientenantwort stellt. Strom muss über verschiedene Gehäusestrukturen wie Zwischenschichten (Interposer), Siliziumbrücken, Gehäusesubstrate, Mikrobuckel (Microbump) und Siliziumdurchkontaktierungen (TSV) zu jedem einzelnen Die übertragen werden. Gleichzeitig werden die Arbeitsspannungsreserven von HBM-Schnittstellen und Verbindungen zwischen Dies (Die-to-Die Interconnects) immer enger und sind sehr empfindlich gegenüber Stromrauschen.
Die zunehmende Komplexität von heterogenen Beschleunigergehäusen bringt auch Herausforderungen für den Siliziumwafer selbst mit sich. Die Integration von Rechenzellen (Compute Tiles), Speicherschnittstellen und Hochgeschwindigkeitsverbindungen zwischen Dies belastet die Ressourcen für die Signalverdrahtung immer stärker. Bei traditionellen Architekturen mit Stromversorgung von der Vorderseite müssen Stromleitungen und Signalverbindungen die Verdrahtungsressourcen gemeinsam nutzen, was zu einem grundlegenden Kompromiss zwischen Signalbandbreite und Stromversorgungsfähigkeit führt. Um die steigende Signaldichte zu unterstützen, erhöhen fortschrittliche Technologien stetig die Anzahl der Verdrahtungsebenen und verwenden zunehmend komplexe Verbindungsstrukturen.
Diese zusätzlichen Verdrahtungsebenen können jedoch den effektiven Widerstand der Stromversorgungspfade erhöhen, da der Strom mehr vertikale Verbindungsebenen durchqueren muss, bevor er die aktiven Schaltkreise erreicht. Bei hohen Strömen führt dieser zusätzliche Widerstand zu einem größeren Spannungsabfall (IR Drop), verringert die Effizienz der Stromversorgung und komprimiert die Spannungsreserven weiter.
Diese Trends führen zu einer grundlegenden Umstellung der Architektur hin zur Technologie der rückseitigen Stromversorgung (Backside Power Delivery). Diese Technologie verlagert das Stromverteilungsnetz auf die Rückseite des Wafers, wodurch die Signalverdrahtungsressourcen auf der Vorderseite freigesetzt und die mit dem traditionellen Stromversorgungsnetz (PDN) verbundenen Probleme mit Widerstand und Verdrahtungsstau verringert werden.
Trends bei der Stromversorgung in Rechenzentren
Die Erhöhung der Leistung pro Rack gestaltet die Anforderungen an die Stromübertragung neu und bringt strenge Einschränkungen bei Platzbedarf, Wärmeabfuhr und Architektur mit sich. Traditionelle Racks in Rechenzentren haben normalerweise eine Auslegungsleistung von 10 bis 20 Kilowatt (kW), setzen hauptsächlich auf Luftkühlung und verfügen über großzügig bemessenen Platz für Netzteile, Kabel und Luftstrommanagement. Im Vergleich dazu überschreitet die Leistung moderner Racks für Künstliche Intelligenz (KI) bereits 100 Kilowatt, und um den daraus resultierenden Wärmefluss zu bewältigen, wird allgemein auf Flüssigkühlung umgestellt. Die Erhöhung der Leistungsdichte der Racks verringert nicht nur den verfügbaren Platz für Stromumwandlung, Stromverteilung und Kühlinfrastruktur, sondern erhöht auch die Anforderungen an die Energieeffizienz der gesamten Stromkette.
Mit Blick auf die Zukunft prognostizieren Branchen-Roadmaps, dass die Leistung von Racks in den späten Jahren dieses Jahrzehnts nahe 1 Megawatt (MW) liegen wird; dies bedeutet, dass eine effiziente Raumnutzung, Minimierung von Verlusten und eine enge Kopplung von Stromübertragungs- und Kühlsystemen keine Optionen mehr sind, sondern unverzichtbare Designanforderungen.
In den letzten zehn Jahren haben sich die Grundannahmen für die Gestaltung von Rechenzentren stark verändert. Nach Schätzungen des Lawrence Berkeley National Laboratory vom Juni 2026 könnte der Stromverbrauch von US-amerikanischen Rechenzentren bis 2030 11,8 % des gesamten Stromverbrauchs in den USA ausmachen (der genaue Anteil liegt je nach Umfang der KI-Bereitstellung und Infrastrukturannahmen voraussichtlich zwischen 9,5 % und 15,3 %). Dieser Prognosewert wurde gegenüber den Schätzungen aus dem Bericht von 2024 nach oben korrigiert – der Bericht hatte vorhergesagt, dass der Stromverbrauch von Rechenzentren bis 2028 6,7 % bis 12,0 % des gesamten Stromverbrauchs in den USA ausmachen wird – der Haupttreiber für dieses Wachstum ist die sprunghafte Zunahme der Nachfrage nach hochdichter Berechnung in KI- und beschleunigerbasierten Geräten.
Gleichzeitig stehen mit der zunehmenden Skalierung der Bereitstellung von Hochleistungsbeschleunigern die Infrastrukturen für Stromversorgung und Wärmeabfuhr vor immer größeren Herausforderungen, und die Geräte-Technologie-Roadmaps treiben stetig die Steigerung der Leistungsniveaus auf Gehäuseebene voran. GPUs sind einer der Hauptmotoren für das Wachstum der KI-Arbeitslasten und bringen bei der Steigerung der Rechenleistung auch einen höheren Stromverbrauch mit sich. Höhere Leistungsniveaus führen zu überproportionalen Effizienzverlusten und stellen ernsthafte Herausforderungen bei der Wärmeverwaltung dar. Diese Probleme erhöhen die Betriebskosten und den Bedarf an Wärmeabfuhr, steigern die Komplexität der Infrastruktur – daher wird die Verbesserung der Ende-zu-Ende-Effizienz der Stromversorgung für die zukünftige Skalierung immer wichtiger.
Viele der heutigen Herausforderungen bei der Stromversorgung von KI-Beschleunigern traten erstmals in den Hochleistungs-CPUs von Intel auf; bei diesen Chips drängten die wachsenden Stromanforderungen die traditionellen Stromversorgungsarchitekturen an ihre Grenzen. Abbildung 3 zeigt, wie Intel diese Herausforderung durch eine Reihe bahnbrechender Innovationen im Bereich der Stromversorgung gemeistert hat, die später in der gesamten Branche weit verbreitet eingesetzt wurden. Dazu gehören dicke Metallschichten zur Verbesserung der Stromverteilung, die Einführung von integrierten Metall-Isolator-Metall- (MIM-) Kondensatoren auf dem Chip und frühe Formen von integrierten Spannungsreglern (IVR).
Die Anforderungen an den Stromverbrauch moderner KI-Beschleuniger treiben die Innovation einer neuen Generation von Stromversorgungstechnologien voran. Um diese Herausforderungen zu bewältigen, treibt Intel Foundry mehrere Technologien voran, darunter die rückseitige Stromversorgung (Backside Power Delivery), fortschrittliche Entkopplungslösungen auf Gehäuseebene, eingebettete Brückentechnologien mit Siliziumdurchkontaktierungen (TSV) sowie eine neue Generation von IVR-Architekturen, die die Funktion der Stromumwandlung näher an die Last heranbringen. Die folgenden Abschnitte untersuchen diese Technologien im Detail.
Rückseitige Stromversorgung: Trennung von Stromversorgung und Signalen
Bei traditionellen Architekturen mit Stromversorgung von der Vorderseite konkurrieren Stromleitungen und Signalverbindungen um dieselben Verdrahtungsressourcen, was zu einem grundlegenden Kompromiss zwischen Signalbandbreite und Stromversorgungsfähigkeit führt. Mit zunehmender Komplexität des Stapels von Metallschichten muss der Strom mehr Verdrahtungsebenen durchqueren, bevor er die Transistoren erreicht, was zu einem größeren IR-Spannungsabfall führt. Die Power-Via-Technologie leitet die Hauptstromversorgung auf die Rückseite des Chips um und trennt so die Stromverdrahtung physikalisch von den Signalverbindungen auf der Vorderseite (siehe Abbildung 4). Dieser Ansatz verkürzt die widerstandsbehafteten Strompfade, mildert den Verdrahtungsstau auf der Vorderseite und ermöglicht die unabhängige Optimierung beider Netze.
Die Power-Via-Technologie kann den IR-Spannungsabfall auf dem Chip erheblich verringern, die Verdrahtungsressourcen auf der Vorderseite effizienter für die Signalübertragung nutzen und die Auslastung von Standardzellen verbessern. Für hochstromführende Logikschaltkreise löst die Technologie der rückseitigen Stromversorgung direkt viele grundlegende Einschränkungen der Skalierbarkeit, denen das traditionelle Stromversorgungsnetz (PDN) auf der Vorderseite unterliegt.
Um diese Vorteile zu realisieren, ist eine enge gemeinsame Optimierung auf mehreren Ebenen erforderlich, einschließlich Prozessintegration, Wärmeverwaltung und Architekturdesign.
Die PowerVia-Technologie wurde erstmals im Intel-18A-Prozess eingesetzt und bildet gleichzeitig die Grundlage für die Power-Boost-Technologie auf Intel 18A-P; Power Boost ist eine neuartige Architektur mit zwei Kontakten, die eine Frequenzsteigerung von über 10 % bei unveränderter Kapazität ermöglicht. PowerDirect ist die zweite Generation der rückseitigen Stromversorgungstechnologie, die Intel Foundry für den Intel-14A-Prozess plant. Sie wird die Vorteile von PowerVia erben und durch weitere Verbesserung der Flächeneffizienz und Optimierung der Stromversorgungsarchitektur die Leistung in Bezug auf Stromverbrauch, Leistung und Fläche (PPA) umfassend verbessern.