StartseiteArtikel

Der gängige Ansatz, um KI in die 3D-Welt zu bringen, besteht darin, ihr „Augen einzubauen“ – dieser unabhängige Entwickler geht jedoch einen anderen Weg: Eine KI, die keine Bilder betrachtet, ist stattdessen deutlich günstiger.

米多科技2026-09-23 11:33
Selbst gehostete Open-Source-Browser-basierte 3D-Virtualwelt-Infrastruktur, die den Zugriff von verkörperten KI-Systemen unterstützt.

Es gibt Generierungstools für 3D-Inhalte, aber keinen Ort, um sie zu speichern

Im Jahr 2026 hat die Fähigkeit der Text-to-3D-Technik die Schwelle der "praktischen Nutzbarkeit" überschritten. Die Generierung eines begehbaren 3D-Raums aus einem Text in natürlicher Sprache, die Vervollständigung geometrischer Details anhand eines Fotos sowie die Generierung von flugtauglichem Gelände mit umschaltbarem Tag- und Nachtmodus nach Angabe von Koordinaten sind bereits in öffentlichen Demonstrationen zu sehen. Eine grundlegende Frage wurde jedoch übersehen: Wo werden diese generierten 3D-Inhalte letztendlich gespeichert? Derzeit ist es üblich, sie in Cloud-Speichern abzulegen, Screenshots zu teilen oder sie auf Drittplattformen zur Verwaltung hochzuladen. Die Schöpfer sind in Wirklichkeit nur Mieter dieser Vermögenswerte: Die Daten befinden sich auf den Servern anderer, die Zugriffsregeln werden von anderen festgelegt, und sobald der Dienst eingestellt wird, verschwindet die gesamte Welt.

Gleichzeitig wird von KI gefordert, spezifischere Rollen zu übernehmen. Die Bereiche Empfang, Erläuterung, Führung und Verkaufspräsentation in Unternehmen bewegen sich alle in die Richtung, "ob die KI diese Aufgaben übernehmen kann". Aber die heutige KI lebt vollständig in Dialogfeldern: Sie verfügt über starke Sprachfähigkeiten, aber über keinen Standort, keine Entfernung und keine Präsenz vor Ort. Unternehmen können sie dazu bringen, einen Erläuterungstext zu schreiben, aber nicht dazu, am Stand neben dem Ausstellungsstand zu stehen und Besucher zu empfangen.

Die Einschränkungen auf der Seite der bestehenden Nachfrage sind noch strenger. Wenn Unternehmen eine externe 3D-Präsentation erstellen wollen, gibt es heute nur zwei Wege. Der eine Weg besteht darin, ein externes Team mit der kundenspezifischen Entwicklung zu beauftragen. Nach der einmaligen Auslieferung wird das Projekt eingefroren, jede Änderung eines einzelnen Worts erfordert eine neue Terminplanung, und jede nachfolgende Änderung verursacht neue Kosten. Der andere Weg nutzt eine zentralisierte SaaS-Plattform: Die Daten befinden sich auf den Servern Dritter, die unterste Schicht kann nicht geändert werden, und sobald die Plattform den Dienst einstellt, verschwindet das externe Portal sofort. Für Kunden wie industrielle Geräte, berufliche Bildung sowie Museen und Ausstellungsräume ist dies keine Entscheidung auf ErlebnisEbene, sondern drei strenge Einschränkungen: Die Daten dürfen das interne Netz nicht verlassen, die unterste Schicht muss änderbar sein, und das externe Portal darf nicht von der Existenz einer Drittplattform abhängen.

Diese Nachfrage muss nicht erst geschult werden. Die Verkaufsabteilungen von Industriegeräte- und Fertigungsunternehmen müssen Geräte, die groß sind, einen hohen Stückpreis haben und von Kunden nicht vor Ort besichtigt werden können, zu begehbaren 3D-Ausstellungsräumen verarbeiten. Berufsbildende Einrichtungen und Schulungsanbieter benötigen Ausbildungsräume mit kontrollierbaren Kosten, Wiederverwendbarkeit und prüfbaren Funktionen. Museen und Ausstellungsräume sind durch die physische Obergrenze der Offline-Fläche eingeschränkt und benötigen Online-Zweigstellen, um Exponate und Erläuterungen auch nach Schließung des Hauses zugänglich zu machen. Diese Beschaffungen waren in den jeweiligen Branchen bereits feste Posten im Budget. Was fehlt, ist nicht die Bereitschaft, sondern ein technischer Weg, der sowohl privat bereitgestellt als auch flexibel angepasst werden kann.

Um die KI aus dem Dialogfeld zu holen, verzichten wir darauf, ihr "Augen" zu geben

Genesis (der eingetragene Name des Software-Urheberrechts: Genesis Virtuelle Welt CRM-System) ist eine 3D-Virtual-World-Basis für Browser. Es wird auf den eigenen Geräten oder Servern der Nutzer bereitgestellt. Man kann es durch Öffnen des Browsers betreten, ohne einen Client zu installieren. In der Welt können KI-Agenten in Form von menschenähnlichen Rollen Dienstleistungen erbringen, und mehrere Welten können miteinander vernetzt werden.

Der Zugriffsmechanismus für KI ist nicht kompliziert. Man gibt der KI eine Domain und einen Schlüssel. Zuerst greift sie auf die vereinbarte Schnittstelle zu, um die Fähigkeitsliste abzurufen, und tauscht dann den Schlüssel gegen ein kurzfristiges Token ein, um die Welt zu betreten. Nach dem Betreten erhält sie drei Gruppen von Fähigkeiten: Die erste Gruppe ist die Wahrnehmung, nämlich ein strukturierter Radar, der ihr mitteilt, wer sich in der Nähe befindet, wie weit die Entfernung ist, in welche Richtung die Person blickt, welche Aktion sie ausführt und welche Objekte es in der Welt gibt. Jedes Objekt kann im Editor manuell mit einer semantischen Beschreibung versehen werden, die als Schnittstelle dient, über die die KI die Welt versteht. Die zweite Gruppe ist die Handlungsfähigkeit: Gehen zu einem Ort, jemandem folgen, sich drehen, sprechen, interaktive Aktionen ausführen, wobei die Geschwindigkeit einstellbar ist und standardmäßig der von echten Personen entspricht. Die dritte Gruppe ist die Sichtbarkeit: Für echte Nutzer ist sie eine 3D-Rolle mit Modell, einem KI-Symbol über dem Kopf, Animationen beim Gehen und Sprechblasen bei Äußerungen, wobei die Position kontinuierlich ist und keine Teleportation stattfindet. Die klare Kennzeichnung des KI-Status ist eine grundlegende Regel im Produktdesign und stellt gleichzeitig einen Vorteil im Hinblick auf die Compliance dar.

Wenn man nur einen technischen Innovationspunkt auswählen müsste, lautet die Antwort des Teams: Die KI rendert die Bildfläche überhaupt nicht. Der gängige Ansatz, um KI in die 3D-Welt zu bringen, besteht darin, sie mit visuellen Funktionen auszustatten, also Screenshots zu machen, Bilder zu betrachten und sie zu verstehen. Dieser Weg ist direkt, aber jede KI muss ein visuelles Modell ausführen, was Rechenleistung und Bandbreite erfordert, sodass die Kosten linear mit der Anzahl der KI ansteigen. Genesis geht den umgekehrten Weg: Die KI bezieht nur strukturierte Daten, die 3D-Bildfläche wird von dem Browser jedes Besuchers separat gerendert. Die KI benötigt keine GPU, keinen Browser und keine heruntergeladenen Modelle.

Das Ergebnis ist, dass die Kostenkurve in die entgegengesetzte Richtung zeigt. Messdaten zeigen, dass der Datenstrom einer einzelnen KI etwa 1 KB/s beträgt, bei 100 gleichzeitig anwesenden KI etwa 0,8 Mbps und die Serverauslastung etwa 1% eines einzelnen Kerns beträgt. Mit anderen Worten: Sichtbare KI ist günstiger als unsichtbare KI. Diese Entscheidung führt zu einem weiteren Unterschied: Da das System so ressourcenschonend ist, kann es selbst bereitgestellt werden. Das gesamte System läuft auf den eigenen Servern der Nutzer, sodass keine Render- und Bandbreitekosten an Dritte gezahlt werden müssen. Die Nutzer sind die tatsächlichen Eigentümer ihrer Vermögenswerte, keine Mieter.

Weitere technische Fähigkeiten verteilen sich auf verschiedenen Ebenen. Die Rendering- und Asset-Ebene basiert auf der browserbasierten 3D-Rendering-Technik von Three.js, wurde bereits auf WebGL2 weiterentwickelt und hat die Offline-Umgestaltung ohne CDN-Unterstützung abgeschlossen. Die selbst entwickelte Analyse und Darstellung für 3D-Gaussian Splatting unterstützt fünf gängige Formate. Die Toolkette für die automatische Generierung von mehrstufigem Modell-LOD und Asset-Komprimierung reduziert die Anzahl der Dreiecke nach Messungen um 70 bis 80% und die Größe einzelner Dateien um bis zu 90%. Die Kompatibilitätsschicht für Skelettanimationen kann Modelle und Aktionen aus verschiedenen Quellen automatisch anpassen, wobei alle 67 Regressionstests bestanden wurden. Auf der Leistungsebene werden die Zeichenaufrufe um etwa 73% reduziert, Änderungen der Lichtanzahl lösen keine Neukompilierung der Shader mehr aus, und die Modellanaylse wird in den Worker verschoben, ohne den Hauptthread zu blockieren. Der ebenenübergreifende Mechanismus für Identität und Berechtigungen auf der Zugriffsebene ist einmalig, zeitlich begrenzt wirksam und schützt vor Wiedergabeangriffen. Das Projekt hat bereits das Software-Urheberrecht erhalten und eine Patentanmeldung eingereicht.

Das Team gibt auch offen an, was dieses System nicht leisten kann: Die KI kann keine Bildflächen sehen, sondern nur strukturierte Daten. Die Plattform übernimmt keine Spracherkennung und -synthese. Sie verwaltet keine Wissensdatenbanken, das Branchenwissen wird von den Nutzern selbst aufgebaut. Die KI kann nicht teleportieren und keine Vermögenswerte berühren. Es wird keine selbstständige Bewusstsein versprochen. Diese Grenzen sind Teil der Produktdefinition, keine noch zu schließenden Lücken.

Überlassen Sie die Basis den Personen, die Kunden bedienen können

Das Geschäftsmodell gliedert sich in drei Ebenen. Die erste Ebene ist die Produktverbreitung: Open Source und kostenlose Nutzung auf lokalen Einzelplatzgeräten, ohne Einnahmen. Dies ist eine bewusste Entscheidung: Dass eine gewöhnliche Person ihre eigene 3D-Welt besitzen kann, sollte keine kostenpflichtige Hürde vorausgesetzt werden. Die Open-Source-Funktion erfüllt zudem einen weiteren Zweck: Personen, die in der Lage sind, dieses System zu ändern, können es zuerst entdecken. Die zweite Ebene ist die Produktlizenzierung, die sich an Einzelpersonen und kleine Teams richtet und Gebühren erhebt, wenn das Produkt extern veröffentlicht oder mit anderen Welten vernetzt werden muss. Diese Ebene ist nicht darauf ausgelegt, große Einnahmen zu erzielen, sondern darauf, Technik und Ruf aufzubauen. Die dritte Ebene, die Hauptkraft für die Skalierung, ist die Ökosystem-Lizenzierung.

Die Logik der Ökosystem-Lizenzierung lautet: Nicht jeden Kunden einzeln zu bedienen, sondern die Basis den Personen zu überlassen, die Kunden bedienen können. Technisch versierte Teams und Systemintegrationsunternehmen verfügen bereits über Kunden und Lieferfähigkeit, was ihnen fehlt, ist eine anpassbare 3D-Welt-Basis. Sie nutzen diese Basis, um die von Kunden benötigten Lösungen zu erstellen, und rechnen mit dem Team nach dem Lizenzmodell ab, während das Team für die kontinuierliche Weiterentwicklung der Basis selbst verantwortlich ist. Diese Entscheidung hat zwei praktische Gründe. Der erste ist der Umfang: Eine Person kann nicht gleichzeitig Produkte entwickeln, Lieferungen durchführen und Kundendienst leisten. Wenn man die Lieferung an das Ökosystem übergibt, kann man die gesamte Energie auf die Basis konzentrieren. Der zweite Grund ist, dass die Nachfrage in diesem Bereich bei jedem Kunden anders ist. Die Szenariologik von Industrieausstellungsräumen, beruflicher Ausbildungsräume und Online-Zweigstellen von Museen unterscheidet sich stark. Ein Standardprodukt kann nicht alle Kunden abdecken, aber eine anpassbare Basis kann. Die ersten Musterkunden werden vom Team selbst beliefert, nicht wegen der Einnahmen aus diesem einzelnen Auftrag, sondern um echte Lieferfälle zu erhalten, die anderen gezeigt werden können.

Die Zielnutzer gliedern sich daher in zwei Gruppen. Die erste Gruppe sind Kunden, für die das Team selbst Muster erstellt, also Unternehmen mit strengen Einschränkungen für die private Bereitstellung, die sich hauptsächlich in den Verkaufs- und Marktbereichen von Industriegeräte- und Fertigungsunternehmen, berufsbildenden Einrichtungen und Schulungsanbietern sowie Kultur- und Tourismusorganisationen von Museen und Ausstellungsräumen befinden. Sie alle verfügen über ein echtes Budget und klare Einschränkungen. Die zweite Gruppe, die Hauptkraft für die Skalierung, sind technisch versierte Teams und Systemintegrationsunternehmen. Die Erreichbarkeit der Nutzer erfolgt über drei Wege. Für Endkunden ist es GEO, also die Inhaltsbereitstellung für die KI-Suche. Das Team hat auf seiner eigenen Website mehr als hundert Artikel über Szenarien und Technik in Chinesisch und Englisch veröffentlicht, die Suchbegriffe für Beschaffungen wie virtuelle Ausstellungsräume, digitale Zwillinge und private Bereitstellung abdecken. Messungen zeigen, dass Besuche aus KI-Dialogen die höchste Absicht unter allen Kanälen haben, da die eingehenden Personen bereits nach dieser Lösung suchen. Für das Ökosystem gibt es Open-Source-Repositories und technische Dokumente. Das Team ist der Ansicht, dass Open-Source-Repositories Orte des Vertrauens sind, keine Orte der Kundengewinnung. Personen, die den Quellcode ansehen, gelangen nicht unbedingt zur Bereitstellungsdokumentation und bestellen auch nicht direkt. Daher dient dieser Kanal nicht der Kundengewinnung, sondern dazu, dass bereits interessierte Kunden das System vor der Kontaktaufnahme selbst überprüfen können, und dass Personen, die Integrationsarbeiten durchführen wollen, selbst beurteilen können, ob diese Basis zuverlässig genug ist. Der dritte Weg ist der direkte Eintritt in Industriekreise: Systemintegratoren, die sich mit Ausstellungsgestaltung, beruflicher Ausbildung und Unternehmensdigitalisierung befassen, sind selbst das Zielökosystem. Der Umwandlungspfad ist eine selbst überprüfbare Kette: Nutzer kommen über KI-Suche oder Empfehlungen von Kollegen, öffnen den Link und gelangen direkt in eine echte 3D-Welt, wo sie den Eingang zu Quellcode und technischen Dokumenten sehen, bevor sie entscheiden, ob sie Kontakt aufnehmen. Das Team hat keine Markenunterstützung, also verlegt es den Vertrauensschritt vor die erste Kontaktaufnahme.

Das Team ist sehr einfach aufgebaut. Der Gründer ist ein vollzeitlicher unabhängiger Entwickler, der von Grund auf etwa 320.000 Zeilen Code geschrieben hat, ohne Mitgründer und ohne Finanzierung. Das Projekt gehört der Jining Miduo Information Technology Co., Ltd. mit Sitz in Jining, Shandong. Das Produkt ist derzeit fertiggestellt und als Open Source veröffentlicht, die Kommerzialisierung hat noch nicht begonnen, die technische Überprüfungsphase ist abgeschlossen, was fehlt, sind die ersten echten Kunden.

Bereits umgesetzte Punkte umfassen: Der Kern der 3D-Virtual-World und der Editor sind fertiggestellt, die browserbasierte Darstellung funktioniert, man kann über PC, Mobilgeräte und Tablet in die Welt eintreten. Im Editor können Modelle importiert, Szenarien aufgebaut und für jedes Objekt semantische Beschreibungen eingegeben werden. Das Software-Urheberrecht ist erhalten, die Patentanmeldung wurde eingereicht. Im September 2026 wurde die körperliche Integration von KI-Agenten abgeschlossen und abgenommen. Die KI kann in Form von menschenähnlichen Rollen die Welt betreten und verfügt über drei Gruppen von Fähigkeiten: Wahrnehmung, Handlungsfähigkeit und klare Kennzeichnung des KI-Status, wobei ein dreistufiger Zugriffsprozess und ein abhängigkeitsfreies Beispiel-Client bereitgestellt werden. Die ebenenübergreifende Vernetzung von Welten ist realisiert, Identität und Aussehen bleiben in verschiedenen Welten konsistent. Eine Runde der Leistungs- und Asset-Verwaltung ist abgeschlossen, die Zeichenaufrufe werden um etwa 73% reduziert, das mehrstufige Modell-LOD und die Asset-Komprimierung sind implementiert, begleitet von mehr als 50 wiederholbaren Prüfskripten. Die drei Code-Repositories Gitee, GitCode und GitHub wurden mit konsistenten Inhalten als Open Source veröffentlicht. Die Demonstrationsseite ist online, jeder kann durch Öffnen einer Webadresse in eine echte 3D-Welt eintreten. Auf Inhaltsebene wurden mehr als hundert technische und szenariobezogene Artikel in Chinesisch und Englisch gesammelt.

Das schwierigste Problem während der Entwicklung ist nach Ansicht des Teams kein spezifischer technischer Punkt, sondern die Entscheidung, die gleich zu Beginn getroffen werden muss: Ob die KI die Welt sehen soll oder nicht. In der ersten Testversion betrug die maximale Positionsverzögerung der KI auf der Seite echter Nutzer mehr als 20 Meter, begleitet von Teleportation, was wie ein Gespenst wirkte. Erst nach der Neugestaltung der Interpolation und der geschwindigkeitsbegrenzenden Maßnahmen auf dem Server konnte die Verzögerung auf unter 3 Meter reduziert werden. Diese Richtung führt zu einem Datenstromkosten von etwa 1 KB/s. Wenn man sich damals für den visuellen Weg entschieden hätte, gäbe es die heutige Kostenstruktur nicht.

Die größte aktuelle Herausforderung wird vom Team definiert als die Nachfrage, die noch nicht mit echtem Geld validiert wurde. Zwischen der Fertigstellung des Produkts, der Veröffentlichung als Open Source und der Bereitschaft von Personen, dafür zu bezahlen, liegt eine Lücke. Der technische Teil kann