Kevin Kelly führt einen Dialog mit den neuen aufstrebenden Kräften der chinesischen Technologiebranche und stellt 6 Einschätzungen vor.
Im Jahr 2026 ist KI für niemanden mehr fremd. Große Modelle haben in der digitalen Welt beeindruckende Ergebnisse erzielt, und die Technik hat der Intelligenz weiter einen physischen Körper verliehen, sodass sie in die reale physische Umgebung eintreten kann. Für die KI-Industrie ist dies ein industrieller Angriffskampf, der die Grenzen des Menschen durchbricht. Für ein breiteres Publikum ist dies eine neue industrielle Revolution, die alle historischen Erfahrungen vollständig umstürzen kann.
Auf dem Weg der Weiterentwicklung der KI gibt es jedoch noch viele praktische Probleme zu lösen:
Gibt es eine Blase in der KI-Industrie?
Kann die verkörperte Intelligenz die physische Welt wirklich verstehen?
Werden Roboter Menschen vollständig ersetzen? Können sie mit Menschen koexistieren und wo liegt die Grenze?
Können die Token-Kosten den Sieger der KI bestimmen?
Welche Haltung sollte man gegenüber den begleitenden Risiken der KI einnehmen?
Am 21. September war Kevin Kelly, Gründungsherausgeber des US-Magazins *Wired* und Technikdenker, zu Gast in der 139. Beijing Chenyuan. Er führte mit Wang He, Gründer und CTO von Galaxy General Robotics, Zheng Qingsheng, Partner von HSG, Shi Yaqiong, Vizepräsident von Jinqiu Fund, und Feng Dagang, CEO von 36Kr, einen fast zweistündigen tiefgehenden Dialog über KI. Viele praktische Probleme wie der technische Wendepunkt des Weltmodells, das Kostenverhältnis, die Grenze der Zusammenarbeit von Mensch und Roboter, Risikosteuerung und technischer Optimismus wurden in diesem Dialog diskutiert, und sechs klare Schlussfolgerungen wurden gezogen.
Veranstaltungsort
Schlussfolgerung 1: Die verkörperte Intelligenz hat den AlphaGo-Moment bereits durchbrochen
Im August 2026 hat bei den Weltspielen für humanoide Roboter ein von dem chinesischen Unternehmen Galaxy General Robotics (Galbot) entwickelter humanoider Roboter ein vollständig autonomes Tennisspiel ohne Fernsteuerung abgeschlossen. Der Roboter läuft über das gesamte Spielfeld, empfängt und schlägt Bälle, führt Gegneraktionen aus, steht nach einem Sturz schnell autonom wieder auf, schätzt die Flugbahn des Balls vor und schlägt ihn dann präzise.
Nachdem das Video des Roboters, der Tennis spielt, in sozialen Medien veröffentlicht wurde, bewertete Andrew Kang, Mitbegründer von Mechanism Capital: „Alpha Go for every sport is coming“. Auch Elon Musk veröffentlichte einen Kommentar: „Der AlphaGo-Moment der verkörperten Intelligenz“.
Als Wang He, Gründer und CTO von Galaxy General Robotics, der diesen Roboter entwickelt hat, und Kevin Kelly sich gegenüberstanden, kommentierte letzterer: „Heute ist das am heißesten diskutierte Thema das große Sprachmodell, das fast jeder nutzt. Aber das große Sprachmodell selbst weiß sehr wenig über die reale Welt. Es wird nicht in der realen Welt trainiert, sondern basierend auf Text- und Textdaten, die die reale Welt beschreiben. Jetzt beginnen die Menschen, der KI einen Körper zu verleihen und sie mithilfe von Robotern in die physische Welt einzubinden. Aber wenn man das große Sprachmodell direkt an einen Roboter anschließt, damit er in der realen Welt autonom handelt und mit der Umgebung umgeht, wird das sehr schwierig. Unser Ziel ist es also nicht mehr nur, diese Intelligenz zu schaffen, die „Buchwissen beherrscht“, sondern eine KI zu entwickeln, die die reale Welt beherrscht. Manchmal wird sie als Weltmodell bezeichnet. Ihr Trainingsmaterial besteht nicht mehr nur aus Texten der ganzen Welt, sondern aus allen physikalischen Gesetzen und massiven Daten, die beschreiben, wie die reale Welt funktioniert. Das ist der nächste große Durchbruch, und die gesamte Branche entwickelt sich in diese Richtung.“
Veranstaltungsort
Wie hat die KI ihre Evolution vollzogen, von der Fähigkeit, eine einzelne Aktion auszuführen, bis zur Beherrschung einer Fertigkeit?
Wang He enthüllte die zugrundeliegende Logik der Entwicklung von Galaxy General Robotics: „Wir haben festgestellt, dass das Gehirn einer Maus sehr klein ist und die Anzahl ihrer Neuronen im Vergleich zu uns Menschen sehr gering ist. Aber sie besitzt alle diese Intelligenzformen, wenn sie im Freien nach Nahrung sucht oder flieht, und braucht kein so großes Gehirn wie der Mensch, um zu überleben. Diese Intelligenz hat eine andere Form als die Wissensintelligenz hinter Textmodellen. Auf diesem Weg hoffen wir auch, schrittweise ein menschenähnliches, bionisches Gehirnsystem aufzubauen, das Großhirn, Kleinhirn und Brücke des Gehirns vollständig verbindet, das sowohl über hochgradige Urteilsfähigkeit als auch über niedriggradige Gleichgewichtsausführungsfähigkeit verfügt, damit unsere humanoiden Roboter wirklich Intelligenz besitzen.“
Aus globaler Sicht repräsentieren das Google VLA und das OpenAI-Weltmodell zwei gängige technische Routen, aber beide haben ihre eigenen Schwächen. Die Trainingsdaten von VLA müssen an die Aktionsetiketten des Roboters gebunden werden, und massenhaft öffentliche Videos können nicht wiederverwendet werden. Das Weltmodell ist gut an der Vorhersage der Umgebung, gibt aber nicht unbedingt Aktionsanweisungen aus, die der Roboter direkt ausführen kann.
Aus diesem Grund hat Galaxy General das World Action Model (Weltaktionsmodell, WAM) vorgeschlagen, das versucht, die beiden Paradigmen zu verschmelzen. Das Modell kann nicht nur die Entwicklung der Umgebung vorhersagen, sondern auch direkt Aktionsanweisungen für den Roboter ausgeben. Diese technische Route wurde von NVIDIA als „die Endtechnik für Roboter“ bezeichnet.
Wang He
Wang He sagte: „Früher mussten Roboter, die tanzen, die menschlichen Bewegungsbahnen im Voraus extrahieren, sie auf den Roboter übertragen, die Bahnen lernen und dann nach der Anpassung bereitstellen. Jetzt kann unser allgemeines Kleinhirnmodell erreichen, dass, wenn ein Mensch einen Tanz einmal tanzt, unser Roboter diesen Tanz sofort vor seinen Augen nachtanzt. Die Intelligenz hinter der schnellen Nachahmung der Bewegungen von Hip-Hop-Athleten übertrifft sogar die Fähigkeit des Menschen, körperliche Bewegungen zu beherrschen. Vor zwei Jahren war dieser Weg noch nicht sehr realistisch. Aber heute bauen die Optimisten unserer Branche, einschließlich Galaxy General, eine Pyramide der Daten für verkörperte Intelligenz auf: von Internetdaten über menschliche Daten, synthetische Simulationsdaten, Daten, die von ferngesteuerten Robotern erfasst werden, bis hin zu Daten, die aus der autonomen Bedienung von Robotern zurückfließen. Diese fünfschichtige Pyramide wird stufenweise in großem Maßstab umgesetzt, um das Gehirn und das Kleinhirn des Roboters intelligenter zu machen.“
Angesichts dieser neuen Durchbrüche sagte Kevin Kelly: „I think the next big breakthrough will be about actually finally getting robots to work. What we have been working on, there's a huge impact it will have. So that's where some of the excitement goes.
Schlussfolgerung 2: Die grundlegende Wahrnehmung von Robotern und Menschen ist völlig unterschiedlich
Wenn Roboter den AlphaGo-Moment durchbrechen, klüger und leistungsfähiger werden, werden sie mit Menschen um ökologische Nischen konkurrieren?
Kevin Kelly erinnerte daran: „Wenn wir der KI einen Körper verleihen, also Roboter schaffen, müssen wir verstehen: Sie sind nicht wie wir, sie sind keine Menschen.“ Er nannte Roboter „fremde Intelligenz“ oder „außerirdische Intelligenz“.
Wang He erklärte die Unterschiede der „Grundlagen“ zwischen Robotern und Menschen: „Die Intelligenz von Robotern unterscheidet sich stark von der menschlichen Intelligenz mit fortgeschrittenem Denken, Urteilsvermögen und Schlussfolgerungslogik, sie ist eine intuitive Intelligenz. Die meisten unserer menschlichen Schlussfolgerungen und Gedanken gehören zum langsamen System im Gehirn, auch System 2 genannt. Und diese menschlichen Bedienungen gehören zum schnellen System im Gehirn, System 1. Das schnelle System erfordert viel Übung, um Fähigkeiten zu einer angeborenen, unbewussten Reaktion zu machen. Das ist eine völlig andere Intelligenz als das große Modell, das sehr komplexe Gedankenketten verwendet.“
Das heißt, die kognitive Kombination, die die KI bildet, ist völlig anders als die des Menschen.
Wang He glaubt, dass Roboter genauso intelligent werden wie Menschen, aber „Roboter sind im Wesentlichen KI, keine Menschen“. Die KI wird keine grundlegende Bedrohung für die ökologische Nische des Menschen darstellen: „Hat sie den Wunsch, sich zu vermehren? Was würde ein Roboter davon haben, sich zu vermehren? Er hat nicht unsere Gene und keinen Mechanismus, um seine Gene durch Selektion zu erhalten. Ich persönlich denke, dass wir heute viele Dinge vorstellen und Roboter zu sehr als Menschen betrachten, indem wir annehmen, dass sie den Wunsch haben, den Menschen zu ersetzen. Aber ich bin relativ optimistisch in Bezug auf die Zukunft von Robotern: Unter Einschränkungen werden sie zu Partnern des Menschen.“
Kevin Kelly ergänzte, dass die Zukunft innerhalb der Roboterwelt auch vielfältig sein wird. KI-Produkte werden sich in eine Vielzahl von Kategorien differenzieren, und verschiedene Produkte werden Unterschiede bei Preisgestaltung, Kosten, Antwortverzögerung und Ausgabeleistung bilden. Schließlich wird sich die gesamte Branche zu einem hochkomplexen Ökosystem entwickeln. „Meiner Meinung nach sind diese intelligenten Träger mit physischem Körper eine wertvolle Ressource mit niedrigen Kosten. Wir werden eine Gesellschaft aufbauen, in der wir mit diesen ‚Fremden‘ zusammenarbeiten.“ Allein die KI kann nicht alle Probleme lösen, aber die Kombination aus Mensch und KI hat großen Spielraum für Vorstellungen.
Kevin Kelly
Schlussfolgerung 3: Die Token-Kosten gestalten die Überlebenslogik der KI-Industrie neu
Bei Robotern sehen Optimisten einen großen Spielraum für Vorstellungen, der durch technischen Fortschritt entsteht. Derzeit liegen jedoch noch zwei Hürden zwischen der Realität und der optimistischen Vorstellung von der Zukunft: Erstens müssen Roboter von der Fähigkeit zur kognitiven Generalisierung bis zur tatsächlichen Durchführung physischer Interaktionen in komplexen Umgebungen weiterhin beweisen, dass sie wissen, „wie man es macht“ und es „schaffen kann“. Zweitens basiert die derzeitige schnelle Entwicklung der KI auf massiven Investitionen in Daten und Rechenleistung, und sie muss noch günstiger werden.
Kevin Kelly hat eine deutliche Veränderung im Silicon Valley beobachtet: Früher haben Ingenieure, die Modelle aufrufen, selten die Token-Kosten berechnet. Erst als Konkurrenten annähernd die gleiche Wirkung zu einem Hundertstel der Kosten erreichen konnten, erwachte die gesamte Branche plötzlich. Einige komplexe Schlussfolgerungsaufgaben verbrauchen bei einer einzigen Ausführung Millionen von Token, und die Rechenkosten werden das Geschäftsmodell von Produkten direkt verändern.
„Wir treten in eine Ära mit großen Unterschieden ein, und die Kosten werden immer wichtiger“, glaubt Kevin Kelly. In vielen Szenarien ist der Preis von entscheidender Bedeutung.
Der Kostendruck hat sich bereits auf den Venture-Capital-Markt übertragen. Shi Yaqiong, Vizepräsident von Jinqiu Fund, lieferte in der Rundtischdiskussion eine Reihe von Branchenbeobachtungen: Große Modelle haben die Schwelle für die Entwicklung von Prototypen von KI-Produkten stark gesenkt, aber die Schwelle für die Nutzerakquise ist im Gegenteil stark gestiegen. Von 2022 bis 2026 ist die Zahl der KI-Anwendungen um etwa das 17-fache gestiegen, und die Kosten für die Nutzerakquise von KI-Produkten sind allgemein um mehr als 50 % gestiegen.
Wer kann im Wettbewerb vorne liegen? Sowohl die technische Fähigkeit als auch die durch Kosten und Umfang begründete Vorreiterrolle sind wichtig. Früher verbreitete sich in der Branche die Annahme des Jeans-Paradoxons: Wenn die Kosten um das Zehnfache sinken, steigt das Nutzungsvolumen um das Zehnfache. Aber Shi Yaqiong glaubt, dass die Realität viel radikaler ist als die Theorie: Die durch die KI verursachte Ausweitung des Verbrauchs ist nicht das Hundertfache, sondern im Szenario der Codegenerierung ist die Codeausbeute pro Person bereits um das Zehntausendfache gestiegen. „Das bringt viele Veränderungen mit sich und ermöglicht es uns, Geschäftslogik auf die Weise des Codierens neu zusammenzubauen.“
Shi Yaqiong
Im Bereich der verkörperten Roboter wird sich die Kostenlogik weiter verändern. Wang He erklärte, dass große Textmodelle eine gewisse Verzögerung bei der Schlussfolgerung tolerieren können, aber humanoide Roboter und autonomes Fahren gehören zu Echtzeit-Edge-Systemen. Die vollständige Abhängigkeit von der Cloud zum Aufrufen von Token ist sehr risikoreich: Wenn die Netzwerk- oder Schlussfolgerungsverzögerung den Grenzwert überschreitet, kann der Roboter stürzen oder Bedienunfälle verursachen. Die gemischte Bereitstellung von Cloud-Edge-Endgeräten wird zur unvermeidlichen Wahl der Branche.