Professor Kong Lingpeng von der Universität Hongkong gründete ein Startup und sicherte sich die weltweit größte Finanzierung für das dLLM-Modell.
Am 9. Oktober erfuhr ChinaVenture exklusiv, dass DiffuSpace (im Folgenden als „DiffuSpace“ bezeichnet) zwei aufeinanderfolgende Finanzierungsrunden abgeschlossen hat, die gemeinsam von Matrix Partners China, Shunwei Capital und Legend Capital angeführt wurden, gefolgt von CAS Star, Huawei Hubble, Horizon Robotics und anderen. Der Gesamtbetrag belief sich auf mehrere hundert Millionen Yuan und stellte damit den größten Finanzierungsrekord für diffuse Sprachmodelle (dLLM) weltweit auf.
Nach verfügbaren Daten gehört das von dem DiffuSpace-Team entwickelte Dream 7B zu den weltweit führenden diffusen Sprachmodellen, wobei einige Fähigkeiten mit DeepSeek V3 (671B) mithalten können. In den entsprechenden Vorträgen auf der ICML wurden Dream 7B, Google Gemini Diffusion und Inception Mercury als drei repräsentative diffuse Sprachmodelle aufgeführt.
Es ist bekannt, dass DiffuSpace derzeit eine neue Generation von diffusen Sprachmodellen mit größerem Parameterumfang trainiert und plant, diese in Kürze zu veröffentlichen und als Open-Source bereitzustellen.
DiffuSpace wurde im Mai 2026 in Shenzhen gemeinsam von Prof. Kong Lingpeng, dem stellvertretenden Leiter des NLP-Labors der Universität Hongkong, sowie den Doktoranden der Universität Hongkong Gong Shansan, Ye Jiacheng und weiteren Mitgliedern gegründet. Bereits 2022 begann das Kernteam des Unternehmens mit der Erforschung von diffusen Sprachmodellen und war eines der ersten Teams weltweit, das diesen technischen Weg systematisch erforschte.
Seit dem ersten Tag seiner Gründung hat DiffuSpace bewusst einen technischen Pfad gewählt, der sich von den autoregressiven Mainstream-Modellen wie GPT und Claude unterscheidet – das diffuse Sprachmodell. Die Generierung durch autoregressive Modelle funktioniert wie „mündliches Diktieren Wort für Wort“, wobei Token nacheinander von links nach rechts generiert werden. Diffuse Sprachmodelle hingegen verarbeiten zuerst das Ganze, ergänzen dann schrittweise die Details, können Inhalte an mehreren Positionen gleichzeitig generieren und bereits vorhandene Inhalte wiederholt korrigieren.
Seit 2026 beschleunigt sich die Entwicklung von diffusen Sprachmodellen: In den ersten 8 Monaten hat die Anzahl der entsprechenden Veröffentlichungen das 2,4-fache des gesamten Jahres 2025 erreicht. Google hat auf Basis von Gemini Diffusion das offene Modell DiffusionGemma weiterentwickelt, Inception iteriert die Modellreihe Mercury kontinuierlich und die Ant Group hat ebenfalls LängDA 2.2 veröffentlicht.
Unterstützt von Huawei und Horizon Robotics: Ein neuer Akteur für große Modelle entsteht in Shenzhen
Was DiffuSpace im Wesentlichen anstrebt, ist die Herausforderung der seit Jahren in der Branche großer Modelle üblichen zugrundeliegenden Generierungsmethode.
Dies ist keine spontane Idee, sondern eine Entscheidung nach langjähriger Forschung. Während die großen Sprachmodelle im Mainstream bereits allgemein die autoregressive Architektur verwenden, weist dieses Muster, bei dem ein Token nach dem anderen rückwärts generiert wird, unvermeidbare Schwächen auf.
Die Grenzen autoregressiver Modelle sind leicht verständlich. Erstens können autoregressive Modelle nur von links nach rechts generieren. Bei Aufgaben, die eine globale Betrachtung erfordern, neigen sie dazu, nur den unmittelbaren Schritt zu berücksichtigen und in ein lokales Optimum zu geraten. Zweitens muss für die Generierung jedes einzelnen Tokens gewartet werden, bis der gesamte vorherige Text abgeschlossen ist, was die Generierungsgeschwindigkeit des gesamten autoregressiven Modells verlangsamt.
Auf der Suche nach einer Lösung lernte Gong Shansan, der sich für wissenschaftliche Forschung interessierte, Kong Lingpeng kennen, was den Grundstein für ihren zukünftigen Weg in die Selbstständigkeit legte.
Nach seinem Bachelor- und Masterstudium an der Shanghai Jiao Tong University kam Gong Shansan zum Shanghai AI Lab und trat dem NLP-Team bei, das von Kong Lingpeng gegründet wurde, der zuvor bei DeepMind gearbeitet hatte. 2022 begann er mit der Erforschung von diffusen Sprachmodellen. Danach wurde Gong Shansan der Student von Kong Lingpeng und befindet sich derzeit im letzten Jahr seines Doktoratsstudiums an der Universität Hongkong.
Ihrer Meinung nach haben diffuse Modelle Vorteile, die autoregressive Modelle nicht haben: Bereits generierte Inhalte können geändert werden, bei der gleichzeitigen Generierung beliebiger Positionen kann auf einen vollständigeren Kontext zurückgegriffen werden, und die Rechenressourcen können stärker den schwierigeren Teilen zugewiesen werden.
Kong Lingpeng erläutert den Unterschied zwischen den beiden Trainingslogiken an einem einfachen Beispiel: „Wenn das autoregressive Modell ‚1, 2‘ sieht, muss es nur die nächste Zahl ‚3‘ vorhersagen und kann nur nacheinander einzelne nachfolgende Inhalte antizipieren. Das diffuse Modell hingegen ist eher wie eine Sequenz, bei der mehrere Positionen fehlen, wobei diese Lücken gleichzeitig ausgefüllt und zwischen verschiedenen Positionen gegenseitig korrigiert werden.“
Das erste Problem, mit dem das Team damals konfrontiert war, war nicht, wie groß das Modell werden kann, sondern ob diffuse Modelle wirklich für die Sprache verwendet werden können. Bilder können als kontinuierliche Signale verarbeitet werden, aber Sprache besteht aus diskreten Token, und ein Satz muss gleichzeitig Syntax, Semantik und Kontextbeziehungen erfüllen.
Die Methoden, die im Bildbereich bereits funktionieren, können nicht direkt übernommen werden. Das bedeutet auch: Wenn man einen anderen technischen Weg als den Mainstream einschlagen möchte, muss zuerst nachgewiesen werden, dass das diffuse Sprachmodell selbst stabil arbeiten kann.
Mit der Veröffentlichung von Veröffentlichungen zu diffusen Modellen bestätigten sie erstmals die Machbarkeit des technischen Pfads für diffuse Sprachmodelle. Bis 2023 hatte das Team ein vollständiges Trainingsverfahren für diffuse Modelle entwickelt, das an diskrete Sprachsignale angepasst ist und die Grundlage für die anschließende Skalierung und Iteration von Modellen legte.
Das im April 2025 veröffentlichte Dream 7B wurde zu einem Wendepunkt auf diesem Weg. Mit 7 Milliarden Parametern hat die Forschung des Teams die Phase der frühen Experimente hinter sich gelassen und das Niveau großer Modelle erreicht. Damals übertraf Dream 7B in Aufgaben wie Mathematik, Codierung und Planung alle autoregressiven Modelle gleicher Parametergröße, wobei einige Indikatoren sogar mit DeepSeek V3 (671B) mithalten konnten.
Mit der weltweiten Anerkennung von Dream 7B entstand DiffuSpace. Ihre Idee ist klar: Sie konzentrieren sich auf diffuse Sprachmodelle und entwickeln DiffuSpace zu einem KI-Unternehmen, das die nächste Generation von Grundmodellarchitekturen nach den autoregressiven Modellen erforscht.
Es gibt nur sehr wenige Gründungsakteure in diesem Bereich. Der Kern des Grundes liegt in der extrem hohen technischen Hürde und der großen Umsetzungsschwierigkeit. Diffuse Sprachmodelle sind keine lokalen Optimierungen an bestehenden großen Modellen, sondern umfassen eine Reihe von Veränderungen in Generierungsparadigmen, Trainingsmethoden, Inferenzsystemen und sogar der zugrundeliegenden Infrastruktur. Um von der Veröffentlichung zur groß angelegten Modellentwicklung zu gelangen, müssen Algorithmen, Daten, Trainings- und Inferenzfähigkeiten gleichzeitig vorangetrieben werden.
Derzeit stammen die Kernmitglieder von DiffuSpace, einschließlich Kong Lingpeng und Gong Shansan, hauptsächlich von renommierten Universitäten wie der Universität Hongkong, der Peking-Universität und der Tsinghua-Universität sowie von führenden Modellentwicklungsunternehmen. Dieses Team, das seit 2022 tief in die Erforschung von diffusen Sprachmodellen eintaucht, hat ein vollständiges System für diffuse Sprachmodelle aufgebaut, das „Algorithmus – Daten – Training – Inferenz“ abdeckt.
Von dem Labor der Universität Hongkong in die Selbstständigkeit gewechselt, hat DiffuSpace seinen Standort in Shenzhen gewählt. Ihrer Meinung nach bietet die vollständige Industriekette für Chips, Autos, Roboter und intelligente Endgeräte in Shenzhen einen fruchtbaren Boden für die Entwicklung dieses Modellpfades.
Ihre Stärke hat auch zahlreiche Investoren angezogen. So ist es zu sehen, dass DiffuSpace weniger als ein halbes Jahr nach seiner Gründung zwei aufeinanderfolgende Finanzierungsrunden abgeschlossen hat und mehrere hundert Millionen Yuan von Matrix Partners China, Shunwei Capital, Legend Capital, CAS Star, Huawei Hubble, Horizon Robotics und anderen erhalten hat.
Die Grenzen der AGI erkunden: dLLM tritt in die Skalierungsphase ein
Von der Veröffentlichung von Dream 7B über die Erkundung von Anwendungszenarien bis hin zum Abschluss der beiden Finanzierungsrunden verlaufen die technische Iteration und das Kapitalrhythmus von DiffuSpace fast synchron und beschleunigen sich ständig.
Nach der Veröffentlichung und Bereitstellung als Open-Source hat das Dream 7B-Modell auf HuggingFace insgesamt mehr als 2,5 Millionen Downloads erreicht. Das neue Modell, das sie in diesem Jahr veröffentlichen wollen, wird den Parameterumfang weiter vergrößern und gleichzeitig gezielt komplexe Aufgaben wie Code-Agenten und intelligente Inferenz unterstützen.
Die Weiterentwicklung des Modells zu einem größeren Parameterumfang bedeutet nicht nur, eine größere Zahl anzustreben. Modelle unterschiedlicher Größe entsprechen unterschiedlichen Einsatzbedingungen: Kleinere Modelle eignen sich besser für Endgeräte und Szenarien mit Latenzempfindlichkeit wie Embodied Intelligence, die eine lokale Bereitstellung erfordern, während größere Modelle für Büroanwendungen, Code-Entwicklung und komplexere wissenschaftliche Berechnungen ausgelegt sind.
Mit der fortlaufenden Vergrößerung des Parameterumfangs des Modells verfolgt DiffuSpace das Ziel, die rationalste und effizienteste Generierungslogik für allgemeine Intelligenz zu finden und damit die Fähigkeitsgrenzen bestehender großer Modelle zu durchbrechen.
Ob dieses Ziel erreicht werden kann, hängt vor allem von der Leistung des Modells ab. Das allgemeine Bewertungskriterium lautet: Die Effizienz misst sich an der Generierungsgeschwindigkeit und der Anzahl der pro Sekunde generierten Token (TPS), während die Genauigkeit sich an der Präzision und der Gesamtleistung verschiedener nachgelagerter Aufgaben misst.
„Unter der Voraussetzung hoher Genauigkeit können diffuse Sprachmodelle eine hocheffiziente Generierung erreichen“, gab Gong Shansan bekannt. „Testergebnisse zeigen, dass bei gleichem Grafikkartenmodell, gleicher Generierungslänge und einer einzigen Abfrage durch einen einzelnen Benutzer die Inferenzgeschwindigkeit des diffusen Sprachmodells von DiffuSpace etwa das Zehnfache derjenigen der gängigen autoregressiven Modelle beträgt.“
Aufgrund der Vorteile des Modells gehören Code-Generierung, Embodied Intelligence und autonomes Fahren zu den priorisierten Entwicklungsrichtungen von DiffuSpace. Diese drei Arten von Aufgaben scheinen unterschiedlich zu sein, haben aber eines gemeinsam: Die Reihenfolge der Problemlösung ist nicht immer natürlich von links nach rechts, und es müssen häufig Einschränkungen in einem größeren Bereich gleichzeitig berücksichtigt werden.
An erster Stelle steht die Code-Generierung. Der echte Programmierprozess läuft selten sequenziell von der ersten bis zur letzten Zeile ab. Entwickler bauen zuerst die Struktur auf, ergänzen dann die Details und ändern wiederholt zwischen verschiedenen Positionen. Die Fähigkeit der diffusen Sprachmodelle zur globalen und parallelen Generierung kann Code in einer flexibleren Reihenfolge verarbeiten.
An zweiter Stelle steht die Embodied Intelligence: Diffuse Sprachmodelle können eine gesamte Aktionssequenz global steuern. Zuletzt das autonome Fahren: Dieses Szenario ist besonders latenzempfindlich, und der Vorteil der schnellen Generierung durch diffuse Sprachmodelle kommt hier direkt zum Tragen.
Im September 2026 schloss DiffuSpace eine Partnerschaft mit Acrab, einem asiatischen Unternehmen für Plattformen zur Berechnung von Agenten. Die beiden Seiten führten eine systemweite kooperative Anpassung für Endgeräte-Agenten durch. Tests zeigten, dass unter bestimmten Bedingungen die Ausführungsgeschwindigkeit von Endgeräte-Agenten durch die parallele Generierung und globale Modellierung von dLLM um das Fünffache gesteigert werden kann.
Für DiffuSpace muss seine Stärke noch weiter vom Markt überprüft werden: Im Bereich Code muss die Fähigkeit des Modells, zwischen verschiedenen Positionen wiederholt Änderungen vorzunehmen, stabil in der Praxis eingesetzt werden. Im Bereich Embodied Intelligence und autonomes Fahren muss die globale Planung und dynamische Korrektur in längeren Aktionssequenzen weiter validiert werden.
Es ist nicht zu übersehen, dass die autoregressiven Modelle nicht stillstehen. Die Mainstream-Modelle verbessern weiterhin ihre Leistungsgrenzen durch die Vergrößerung von Parametern sowie verbesserte Inferenz- und Trainingsmethoden.
DiffuSpace zeigt sich darüber nicht übermäßig besorgt. Ihrer Meinung nach weist jede Technologie Grenznutzen auf. Für Aufgaben, die nicht für eine strenge Modellierung von links nach rechts geeignet sind, müssen autoregressive Modelle mehr Rechen- und Datenkosten aufwenden, um ähnliche Ergebnisse wie diffuse Sprachmodelle zu erzielen.
„Aus der Sicht der grundlegenden Prinzipien sind diffuse Sprachmodelle eine allgemeine verbesserte Version von autoregressiven Modellen und umfassen vollständig alle Fähigkeiten von autoregressiven Modellen. Diffuse Sprachmodelle können durch Regelbeschränkungen zu autoregressiven Modellen degradiert werden. Wenn das technische System und die Algorithmuskontinenz von diffusen Sprachmodellen ausreichend ausgereift sind, muss das technische System der autoregressiven Modelle nicht separat beibehalten werden“, meinte Gong Shansan. In Zukunft werden höchstwahrscheinlich zwei Szenarien eintreten: Erstens werden diffuse Sprachmodelle die autoregressiven Modelle vollständig ersetzen und zum Mainstream-Paradigma der Branche werden. Zweitens werden beide Modellarten aufgrund ihrer jeweiligen Vorteile langfristig nebeneinander bestehen und unterschiedliche Szenarien abdecken.
In seiner langfristigen Planung definiert sich DiffuSpace als „Hersteller von Intelligenz“. Durch kontinuierliche Durchbrüche in der KI-Technologie erforscht es die Grenzen der allgemeinen künstlichen Intelligenz und stellt seine erstklassigen KI-Fähigkeiten allen Branchen zur Verfügung. „Wir hoffen, ein erstklassiges, wohlwollendes und technisch ästhetisches Unternehmen für die Produktion von Intelligenz zu werden.“
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „ChinaVenture“, Autor: Lu Zhigao, Redakteur: Wang Qingwu, veröffentlicht mit Genehmigung von 36Kr.