HardKrypton Exklusivveröffentlichung | Heterogene intelligente Rechenplattform schließt eine Angel-Finanzierung in Höhe von zehn Millionen Yuan ab und zielt auf die Rechenleistungssteuerung von NVIDIA sowie einheimischen GPUs ab
Laut Hard Krypton hat kürzlich Bolun Zhihui, ein Technologiedienstleister für heterogene intelligente Rechenplattformen und gradientenbasierte Token-Fabriken, eine Angel-Finanzierung in Millionenhöhe abgeschlossen, mit einer Post-Money-Bewertung von etwa 150 Millionen Yuan. Diese Finanzierungsrunde wurde von einem erstklassigen Industriefonds investiert, der sich auf die KI- und KI-Infra-Spur konzentriert und gleichzeitig große Modell-Trainingsrahmen aufgebaut hat. Die Mittel werden hauptsächlich für die Iteration der Kerntechnologie des heterogenen intelligenten Rechnens, die Verbesserung der Recheninfrastrukturprodukte und die Erweiterung des Kerntechnikteams verwendet.
Bolun Zhihui wurde 2026 gegründet und hat seinen Hauptsitz in Peking. CEO Liu Jinzhi arbeitete früher im Asiatisch-Pazifik-Forschungszentrum von Intel und war verantwortlich für das verteilte Systemsoftwaregeschäft in China im Silicon Valley, mit reicher Erfahrung in den Bereichen Rechenarchitektur und Systemsoftware. Im Jahr 2016 war Liu Jinzhi eines der ersten Kernmitglieder eines globalen KI-Startups, das sich auf die natürliche Sprachverarbeitung konzentrierte. Später beteiligte er sich am Aufbau der ersten Nvidia Superpod-Trainingscluster in China, um die Forschung und Entwicklung großer Sprachmodelle sowie die Umsetzung von Dienstleistungen zu unterstützen.
CTO Yang Guang war nacheinander für die Softwareentwicklung und Systemarchitektur in multinationalen Unternehmen wie Siemens Communications, Oracle, IBM und Huawei Cloud verantwortlich und war ein frühes Mitglied der Cloud-Native-Entwicklung. Die Kernmitglieder des Unternehmens stammen alle aus innovativen Unternehmen wie IBM, Iluvatar CoreX, Huawei und DriveStack Technology. Das Kernteam hat die ersten inländischen Nvidia SuperPod-Trainingscluster betrieben und realisierte früh die inländische heterogene GPU-Inferenz mit zehntausend Karten.
Mit dem Trend des Baus intelligenter Rechenzentren in verschiedenen Regionen steigt die Größe der rechnerisch auf dem Papier angegebenen Rechenleistung kontinuierlich an, aber viele Schaltschränke befinden sich nach der Installation im Leerlauf. Ein Chip bedeutet nicht gleich Rechenleistung, und Rechenleistung bedeutet nicht, dass sie nutzbar ist. Vom Chip bis zur Ausgabe von Token gibt es mehrere technische Lücken. Wie können Chips unterschiedlicher Architektur einheitlich verwaltet werden? Wie kann fragmentierte Rechenleistung optimiert werden? Wie kann die Rechenleistung nach Bedarf gestuft werden, um unterschiedliche Werte zu erzeugen?
Gleichzeitig hat die tägliche Aufrufzahl von globalen KI-Token 300 Billionen überschritten. Mit dem Aufkommen von Agenten steigen die komplexen Aufgaben der intelligenten Agenten, und die Menge an Token, die für eine einzelne Aufgabe verbraucht wird, beträgt oft hunderttausend oder sogar Millionen, was zu einem explosionsartigen Anstieg des Bedarfs an Rechenleistung führt. Der globale Markt für KI-Inferenzchips hat bereits ein Volumen von fast 50 Milliarden US-Dollar erreicht, und die Inferenzkosten sind zum größten Betriebsaufwand für KI-Unternehmen geworden.
Liu Jinzhi stellte Hard Krypton vor, dass das Unternehmen vor diesem Hintergrund den eigenen Technologie-Stack TOLD (Token Oriented Large-scale Distributed Architecture) entwickelt hat, um die Rechenleistung in gestufte Token-Ausgabe zu optimieren.
Liu Jinzhi ist bereits 2023 in die Branche des intelligenten Rechnens eingetreten. „Vor dem Verkaufsverbot von Nvidias hochwertiger Rechenleistung haben wir die ersten Nvidia SuperPod im Inland hergestellt, also die SuperPod-Architektur auf Basis von Nvidia DGX, und haben eine tiefe Zusammenarbeit mit führenden Unternehmen für große Modelle durchgeführt.“ Andererseits beteiligte sich sein Team auch früh am Ökosystem und Technologiesystem von inländischen GPUs.
Aufgrund verschiedener Faktoren wie der Geopolitik und dem Aufstieg inländischer GPUs sind die von verschiedenen Unternehmen gehaltenen GPU-Vermögenswerte sehr verteilt. Es gibt nicht nur Nvidias GPUs, sondern auch verschiedene inländische GPUs. „Das Problem ist, dass diese verschiedenen GPUs aufgrund unterschiedlicher technischer Routinen nicht direkt zusammenarbeiten können. Es ist ein technisches Problem, sie nicht nur zusammenzubringen, sondern auch den optimalen Betrieb zu erreichen.“
Daher ist es zu einer dringenden Notwendigkeit geworden, dass inländische Unternehmen diese heterogenen Rechenvermögenswerte integrieren und optimieren. „Und da die GPU-Vermögenswerte, die von verschiedenen Unternehmen sowie staatlichen und zentralen Unternehmen angesammelt werden, immer zahlreicher und vielfältiger werden, wird dies zu einem sehr großen Bedarf werden.“
Die selbst entwickelte Architektur TOLD von Bolun Zhihui kann sowohl Nvidias GPU-Architektur als auch verschiedene inländische GPU-Architekturen kompatibel machen. Mit der selbst entwickelten Cloud-Native-verteilten Planungstechnologie wird die einheitliche Verwaltung und Inferenzplanung von heterogenen GPUs auf Zehntausenden von Karten realisiert. Dadurch arbeiten verschiedene Chips im selben Rahmen nach der optimalen Effizienz des Modells zusammen. Für Token und Anwendungen kann es außerdem eine Ein-Klick-Anpassung für große Modelle und ein innovatives B2B2C-Mehrmieter-Modell bereitstellen.
Liu Jinzhi stellte vor, dass das Unternehmen bereits unterzeichnete Kunden hat und in Zukunft auch Hardwareprodukte auf den Markt bringen wird. Im Folgenden finden Sie einen Auszug aus dem Interview zwischen Hard Krypton und ihm:
Hard Krypton: In der aktuellen Phase großer Modelle, in welchen Gliedern wird die Rechenleistung hauptsächlich verwendet?
Liu Jinzhi: Betrachtet man die Phase großer Modelle, so teilt sich die Rechenleistung hauptsächlich in zwei große Bereiche auf: das Training großer Modelle und die Inferenzanwendungen nach Abschluss des Trainings.
Jetzt sind die Unternehmen für große Modelle bereits relativ konzentriert, und einige staatliche und zentrale Unternehmen trainieren auch selbst große Modelle, aber sie vermarkten sie nicht nach außen, sondern nutzen sie nur intern, und ihre Investitionen sind ebenfalls sehr groß. Diese Unternehmen legen weiterhin massiv Trainingsrechenleistung an. Die hochwertige Trainingsrechenleistung in China macht derzeit noch weniger als ein Zehntel der der Vereinigten Staaten aus, sodass die Trainingsrechenleistung weiter aufholen muss.
Der größere Markt in der Zukunft ist die Inferenz. DeepSeek R1 hat die echte Inferenz und die Umsetzung von KI vorangetrieben. Zusammen mit einigen neuen Anwendungen, die in diesem Jahr erschienen sind, hat dies einen großen Bedarf an Inferenz für die Umsetzung von Token ausgelöst. Langfristig gesehen kann der Bedarf an Inferenz mehr als das Zehnfache oder sogar Hundertfache des Bedarfs an Training erreichen. Mit der Umsetzung einer großen Anzahl von KI-Anwendungen wird die Inferenz theoretisch zu einem breiteren Markt und zu einem Bereich, in dem inländische Rechenleistung eine große Rolle spielen kann.
Hard Krypton: Was genau ist Ihr eigener TOLD-Technologie-Stack? Wo zeigt sich die technische Barriere?
Liu Jinzhi: Es hat mehrere Merkmale. Erstens ist es auf Token ausgerichtet, sodass Token am schnellsten und optimalsten verarbeitet werden. Zweitens ist es Large Scale. Viele Unternehmen auf dem Markt sprechen von Heterogenität, aber unser Merkmal ist, dass wir wirklich große inländische GPU-Cluster gebaut haben. Aus technischer Sicht ist die groß angelegte Heterogenität völlig anders als die Heterogenität mit nur wenigen Karten. Zum Beispiel nähert sich die Leistung einiger neuester inländischer Grafikkarten bereits der von Nvidia H200 an, aber das Training großer Modelle erfordert die Bildung von sehr großen Clustern mit Tausenden oder sogar Zehntausenden von Karten, und die Stabilität solcher Cluster ist die größte Herausforderung.
Darüber hinaus können unsere Cluster im ganzen Land und sogar weltweit verteilt sein. Tatsächlich haben wir mehr als 10 Rechenzentren auf Kartenebene mit tausend Karten verwaltet, die über das ganze Land verteilt sind, und das Niveau von zehntausend Karten erreicht. In diesem Prozess haben wir sehr viel Entwicklungsarbeit geleistet. Die erste Ebene ist die Planungsebene. Wir basieren auf Cloud-Native, modifizieren aber tiefgreifend einige Dinge im Unterbau von Cloud-Native. Es ist keine einheitliche Architektur. Wir müssen Cloud, verteilte Architektur, groß angelegte verteilte Architektur und das Verständnis des Modells selbst in das Produkt integrieren.
Derzeit werden mehr als 5 Arten von heterogenen GPUs unterstützt, einschließlich großer GPUs von Nvidia und inländischen Anbietern.
Hard Krypton: Wurde diese groß angelegte heterogene Plattform bereits validiert? In welchen Szenarien wird sie hauptsächlich verwendet?
Liu Jinzhi: Wir haben tatsächlich inländische GPU-Cluster mit zehntausend Karten gebaut, die aus mehr als 10 Clustern mit je tausend Karten bestehen, ähnlich einem „großen Internetcafé“, und dieser Cluster bietet wirklich Dienste nach außen an. Später wurden einige Karten kommerziell vermietet, aber wir haben die Validierung darauf abgeschlossen.
Dieses Szenario ist eigentlich sehr universell und kann sowohl To B als auch To C sein. To B kann Dienste für interne Unternehmen bereitstellen, zum Beispiel ein Unternehmen, das AIGC-Kurzfilme herstellt, das verschiedene Sprachmodelle, Multimodal-Modelle und Bildgenerierungsmodelle aufrufen muss, es kann auch Embodied Intelligence oder andere Szenarien im allgemeinen Ökosystem sein. Auf der C-Seite wird es von Einzelpersonen verwendet, zum Beispiel die private Nutzung von „Lobster“-Agenten, Aufrufe von Agent-Tools, Codex, Claude Code und andere können alle auf das von uns bereitgestellte Modell zugreifen.
Hard Krypton: Warum legen Sie Wert auf die C-Seite? Welche Art von Geschäftsmodell wird es in Zukunft geben?
Liu Jinzhi: Jetzt sagen alle, dass man sich „Lobster“ nicht leisten kann, weil es Tag und Nacht im Standby-Modus Aufgaben ausführen muss. Das Kernproblem ist, dass die Hierarchisierung noch nicht gut umgesetzt ist. Alle wollen gleichzeitig auf die Top-Modelle zugreifen, und die Top-Modelle bedeuten auch die teuersten Karten für den späteren Einsatz.
Aber in Wirklichkeit reichen für viele Aufgaben wie das Organisieren von Dateien und Daten bereits grundlegende Modelle völlig aus, was bedeutet, dass günstigere Karten ausreichen, insbesondere inländische GPUs.
Im Geschäftsmodell werden wir auf der C-Seite zunächst einen Teil der Token-Fabriken selbst betreiben, die auf unserer eigenen Plattform installiert sind. Wir werden die Debugging-Arbeiten durchführen, um sicherzustellen, dass Benutzer das gewünschte Modell selbst auswählen und gleichzeitig die optimale Lösung erhalten. Auf der B-Seite können wir mit Unternehmen zusammenarbeiten, um Dienste für ihre eigenen privaten intelligenten Rechencluster bereitzustellen und sogar von Grund auf das passende Kartenmodell zu entwerfen, um ihre spezifischen Szenarien zu erfüllen.