StartseiteArtikel

KI-Hardware wartet auf die „Helden hinter den Kulissen“

具身研习社2026-10-09 17:52
Niemand kümmert sich darum, aus welcher Steckdose der Strom in den Raum gelangt.

KI-Hardware definiert ihre eigenen Wettbewerbseinheiten neu.

Brillen, Anhänger, Kopfhörer, Ringe, Desktop-Roboter, KI-Spielzeuge, Autos, Lautsprecher und sogar eine Tischlampe beginnen, intelligent vernetzt zu werden. Die Formen wachsen stetig nach außen, während das „nächste iPhone“, das die gesamte Branche in den letzten zwei Jahren ständig beschäftigt hat, allmählich in den Hintergrund rückt.

Die jüngsten neuen Maßnahmen von Apple machen diese Veränderung noch deutlicher. Ein neues Heim-Zentralgerät wird in den Vordergrund gerückt, während Geräte wie Türschlösser, Türklingeln, Temperaturregler und Kameras weiter in alle Bereiche des Raums verteilt werden. Ein Unternehmen, das sich am besten darauf versteht, Software und Hardware in einem einzigen Produkt zu vereinen, hat auch dieses Mal nicht versucht, ein einziges Gerät alle Aufgaben erledigen zu lassen.

Die Geräte wachsen weiter nach außen, und der Schwerpunkt verlagert sich vom Gerät selbst auf die Ebene über den Geräten.

Das ähnelt sehr dem aktuellen Zustand der KI-Hardware: Niemand weiß, wie das Endergebnis aussieht, also lässt man die Antworten zuerst auseinanderlaufen.

Das ist zwar nicht unbedingt das Ergebnis gründlicher Überlegungen, aber zumindest ehrlicher, als so zu tun, als kenne man die Antwort bereits.

Die ursprüngliche Annahme, die auf einem einzigen „ultimativen Gerät“ beruhte, wurde in viele kleinere, spezifischere Versuche mit geringerem Risiko aufgeteilt.

Diese Ausbreitung offenbart jedoch auch neue Lücken: Hardware kann jeweils über Wahrnehmungs-, Speicher- und Handlungsfähigkeiten verfügen, aber die Identität, der Kontext und die Berechtigungen einer Person sind immer noch in verschiedenen Systemen zersplittert. Mit jedem neuen Berührungspunkt entsteht möglicherweise ein weiterer Datensatz über dieselbe Person, ein neues Konto und eine neue ökologische Barriere.

Der Eingang verteilt sich von einem einzelnen Gerät zu einem gesamten Netzwerk. Vielleicht lag der eigentliche Fehlschuss in der Vergangenheit nicht bei der Wahl des Geräts, sondern bei der Wahl der Hierarchieebene.

Was wirklich zentralisiert werden muss, ist nicht unbedingt eine bestimmte Hardwareform, sondern die Ebene über den Geräten. Es spielt keine Rolle, ob sie schließlich Zentralgerät, Super-App oder anders genannt wird.

Das Wichtige ist, dass diese Ebene bis heute noch nicht vollständig ausgereift ist.

Das Netz wurde bereits ausgebreitet, und der nächste Wettbewerb beginnt an dem Punkt, an dem das Netz eingeholt wird.

Hallo, hier ist „KI-Trend“.

Während alle nach Antworten suchen, klären wir zuerst die Fragen.

Wenn sie sich für die „vernetzte Wette auf mehrere Bereiche“ entscheiden

Diese Ausbreitung ist kein vorab geplanter Weg, sondern das Ergebnis einer kollektiven Richtungsänderung.

Vor dieser Richtungsänderung teilte die Branche tatsächlich dieselbe Vorstellung: Eine neue Computerrevolution sollte von einem neuen persönlichen Endgerät abgeschlossen werden.

Diese Vorstellung beruht zu einem großen Teil auf den erfolgreichen Erfahrungen mit Smartphones. In den letzten zwanzig Jahren hat das iPhone Kommunikation, Karten, Bezahlung, Unterhaltung und Internetdienste nacheinander in einem einzigen Bildschirm integriert und der Hardwarebranche ein tiefes Denkmuster hinterlassen: Es sollte in jeder Ära einen zentralen Eingang geben, und der Eingang ist am besten ein Gerät.

Als die Welle großer Modelle aufkam, war die erste Reaktion fast aller Menschen dieselbe Frage: Wie wird das iPhone im KI-Zeitalter aussehen?

Humane AI Pin und Rabbit r1 sind die beiden ernsthaftesten Versuche, diese Frage zu beantworten. Beide starteten mit dem Ehrgeiz, persönliche Endgeräte neu zu erfinden, und beide zahlten einen hohen Preis dafür. Humane hat den Markt bereits verlassen, während Rabbit im September dieses Jahres eine bedeutungsvolle Wende vollzogen hat: OS3 wurde in die Cloud verlegt, sodass Benutzer über Web, Telegram und das r1-Gerät auf dasselbe Konto zugreifen und mehrere Computer verbinden können, um Aufgaben auszuführen.

Rabbit: Von r1 zu OS3

Eine Hardware, die einst die Antwort sein wollte, ist heute nur noch Teil der Antwort.

Ihre Erfahrungen haben die gesamte Branche eines klar gemacht: Neue Hardware wird nicht automatisch zu einem neuen Rechenzentrum, nur weil sie mit KI verbunden ist.

Zumindest bis heute hat niemand das Problem des einzelnen Eingangspunkts gelöst.

Aber die Branche hat Hardware deswegen nicht aufgegeben.

Meta setzt weiterhin stark auf Brillen, und OpenAI sucht immer noch nach neuen persönlichen Geräten. Was sich wirklich geändert hat, ist, dass die feste Bindung zwischen Hardware und Intelligenz allmählich lockerer wird.

Muse kann weiterhin von Mobiltelefonen, Computern und dem Web auf neue Geräte zugreifen. Qualcomm hat direkt angekündigt, dass die Zukunft stärker „agentenzentriert statt gerätezentriert“ sein wird. Alexa+ taucht auch in Fernsehern, Autos und Lautsprechern auf. Immer mehr Unternehmen akzeptieren, dass KI viele Einsatzorte haben kann, ohne ihren gesamten Wert auf ein einziges Gerätegehäuse zu setzen.

Die Herstellung von Hardware hört nicht auf, aber die Motivation, auf Hardware zu setzen, hat sich geändert.

Ausgerechnet zu diesem Zeitpunkt wird es immer günstiger, eine neue Position auszuprobieren.

Modell-, Sprach-, Multimodal- und Agentenfähigkeiten werden zu Infrastrukturen, die gekauft und kombiniert werden können. Die vorgelagerten Chips und Plattformen decken auch immer mehr Endgeräte ab. Volcano Engine gab bekannt, dass bis Juni 2025 die Auslieferungsmenge von KIot-Produkten, die mit dem großen Doubao-Modell verbunden sind, 1 Million Einheiten überschritten hat; Jingdongs JoyInside hat bereits mehr als 40 Spielzeugmarken integriert.

Wenn „KI in Hardware zu integrieren“ nicht mehr eine Entwicklungsfähigkeit ist, sondern eine einkaufbare und kombinierbare Infrastruktur, ändert sich die Strategie natürlich von „zuerst gründlich nachdenken, dann handeln“ zu „einfach alle Varianten ausprobieren“.

Daher hat sich die Methode der Branche, nach Antworten zu suchen, geändert.

Die Verlockung des „nächsten iPhones“ ist nicht verschwunden, aber es ist nicht mehr die einzige Wettmöglichkeit.

Eine Hand setzt auf mögliche zentrale Geräte, die andere verteilt Berührungspunkte auf mehr reale Standorte – diese Vorgehensweise ist heute fast die Standardpraxis aller großen Technologieunternehmen.

Der Spieltisch ist noch da, aber niemand setzt mehr alles auf dieselbe Karte.

Jedes Hardware-Gerät ist ein Fragebogen

Betrachtet man diese verstreuten Hardware-Geräte als Produkte, wirken die meisten noch recht unausgereift. Betrachtet man sie als Fragebögen, werden sie sehr interessant.

Da die ultimative Form vorübergehend keine Lösung hat, übernehmen diese Produkte eine andere Funktion: Sie teilen die große Frage „Wie sollen Menschen und KI zusammenleben“ in Dutzende kleiner Experimente auf und verteilen sie im echten Leben zum Testen. Jedes Produkt stellt der Branche eine Frage, und die Benutzer sind die Prüfer.

Das Erste, was herausgefunden wurde, sind die Grenzen der Wahrnehmung.

Damit KI mehr Kontextinformationen erhält, muss Hardware näher am Menschen sein. Erinnerungsanhänger, Aufnahme-Pendants und intelligente Brillen versuchen im Wesentlichen, Teile des Lebens zu erfassen, auf die Maschinen früher keinen Zugriff hatten. Das Problem verschiebt sich jedoch schnell von der Frage „Kann man aufnehmen?“ zu der Frage „Bis zu welchem Punkt soll man aufnehmen?“.

Limitless fügt dem Aufnahmevorgang einen „Zustimmungsmodus“ hinzu, DayoTag legt den Schwerpunkt auf lokale Speicherung. Meta entwickelt weiterhin Brillen mit Kamera, bringt aber gleichzeitig Ray-Ban Meta Audio auf den Markt, das die Kamera vollständig entfernt und nur Ton und KI behält. Obwohl die technischen Fähigkeiten weiter ausgebaut werden könnten, machen die Produkte einen aktiven Schritt zurück.

Diese Art des Zurückweichens ist wertvoller als das Hinzufügen eines neuen Sensors.

Die Perspektive aus der ersten Person ist natürlich wertvoll, und kontinuierliche Aufnahmen ermöglichen es dem Modell, mehr Kontext zu erhalten. Aber wenn ein Hardware-Gerät wirklich in das tägliche Leben eintritt, ist der Benutzer nicht der einzige Beteiligte. Fremde auf der Straße, Kollegen im Büro und Freunde gegenüber könnten versehentlich in den Datenbereich des Geräts einbezogen werden. Wie viel KI sehen und hören kann, wird letztendlich nicht nur von Sensoren bestimmt, sondern auch davon, wie viel Menschen und ihre Umgebung bereit sind, preiszugeben.

Je stärker die Wahrnehmung ist, desto wichtiger werden ihre Grenzen.

Als Nächstes stellt sich die Frage: Warum sollte ein KI-Hardware-Gerät langfristig im täglichen Leben verbleiben?

Begleitprodukte neigen dazu, „wie intelligent das Modell ist“ als Verkaufsargument zu nutzen, aber die tatsächliche Nutzung verschiebt die Bewertungsmaßstäbe ständig in andere Richtungen. Ropet gab bekannt, dass die 90-Tage-Retentionsrate 80 % bis 90 % erreicht; die Langzeitnutzungsdaten von LOVOT erstrecken sich über drei Jahre. Beide erinnern uns daran, dass die eigentliche Schwierigkeit bei Begleitprodukten nicht darin besteht, Menschen beim ersten Mal zu unterhalten, sondern auch nach Abklingen der Neuheit noch wertvoll zu sein.

Das erklärt auch, warum einige Produkte aktiv die Anzahl der Dialoge reduzieren.

LOVOT pflegt keine Beziehungen über komplexe Sprache, bibo überträgt mehr Interaktionen auf Blicke, Gesten und Berührungen, YareLampGo drückt seinen Zustand durch Drehbewegungen und Licht aus. Sie testen eine sehr konkrete Sache: Die Schnittstelle von KI muss nicht unbedingt ein Chatfenster sein.

Offizielle Websites von LOVOT und Ropet

Begleitung im echten Leben erfordert nicht immer eine hohe Informationsdichte. Eine Bewegung, eine Antwort oder sogar rechtzeitige Stille eignen sich möglicherweise besser für eine langfristige Zusammenarbeit als viele zusätzliche Sätze. Bei solchen Produkten ist Intelligenz eine Fähigkeit, aber geringe Belastung ist eher die Voraussetzung dafür, dass das Produkt funktioniert.

Das ist auch eine leicht zu übersehende Veränderung in dieser Erkundungsphase: KI-Hardware sucht nicht nur nach neuen Geräteformen, sondern auch nach einer neuen Interaktionssprache für KI.

Weiter vorne geht die Frage von der Interaktion zur Handlung über.

Die neue Nest-Kamera von Google kann bereits Fragen beantworten wie „Um wie viel Uhr ist der Müllwagen am Donnerstag gekommen?“. Alexa+ ist in BMW-Autos integriert, Muse plant, für Sie einzukaufen, Tickets zu buchen und dafür eine Provision zu erhalten.

Wenn die ersten Fragen falsch beantwortet werden, leidet die Benutzererfahrung. Wenn diese Frage falsch beantwortet wird, geben Sie den Schlüssel weiter.

Keiner dieser Fragebögen ist vollständig ausgefüllt, aber die Umrisse der Grenzen sind bereits sichtbar. Reale Szenarien lassen die Nutzungsdauer, die Nutzungshäufigkeit, die Retentionsrate und die fortlaufende Autorisierung die Antworten für die Branche auswählen.

Die Erkundung selbst erhält dadurch eine weitere Bedeutungsebene.

Viele heutige Produkte werden letztendlich keine stabile Produktkategorie bilden, aber die Erkenntnisse, die sie liefern, verschwinden nicht unbedingt mit ihnen. Wie kontinuierliche Erinnerungen erfasst und abgerufen werden sollen, wie der Zustand des Agenten für Menschen wahrnehmbar gemacht werden kann, ob Handlungen zu einer Schnittstelle werden können und bei welchem Schritt die Berechtigungen wieder an den Benutzer zurückgegeben werden sollen – diese Erfahrungen lösen sich von den spezifischen Produkten ab und werden allmählich zu Fähigkeiten, die spätere Produkte wiederverwenden können.

In der Frühzeit des mobilen Internets gab es einen ähnlichen Prozess. Viele Apps verschwanden, aber einige Interaktionsmethoden, die ursprünglich zu einzelnen Produkten gehörten, blieben erhalten und wurden schließlich zu einer Sprache, die alle standardmäßig verstehen.

KI-Hardware befindet sich jetzt möglicherweise in einer solchen Phase.

Oberflächlich betrachtet bauen alle Produkte, aber in Wirklichkeit sucht jeder nach einer Reihe von Interaktionsprimitiven für die noch nicht erschienene KI-Zentralsystem in der realen Welt.

Wenn Erinnerung, Wahrnehmung, Ausdruck und Handlung auf verschiedene Geräte verteilt sind, ist die Frage, die ein einzelnes Produkt beantworten kann, damit beantwortet.

Wer wird zur „Super-App“ hinter allen KI-Hardware-Geräten?

Bei dieser Ausbreitung hat niemand versucht, alles wieder zu sammeln.

In der abgeschlossenen Umgebung eines einzelnen Herstellers funktioniert „dieselbe KI, die geräteübergreifend arbeitet“ bereits. Der Gesprächsverlauf von Siri kann über iCloud zwischen verschiedenen Apple-Geräten fortgesetzt werden; Meta sorgt auch dafür, dass Muse über Mobiltelefone, Computer und das Web auf neue Hardware-Eingänge zugreifen kann. Die Geräte können gewechselt werden, aber Konten, Sitzungen und Teile des Kontexts bleiben auf einer höheren Ebene.

Innerhalb der abgeschlossenen Umgebung sind die Verbindungen bereits hergestellt. Der eigentliche Bruchpunkt tritt auf, wenn man die Umgebung verlässt.

Eine Person wird bald mehrere KI-Systeme haben: eins in der Brille, eins im Kopfhörer, eins in der Uhr, eins im Auto und eins zu Hause. Sie alle sammeln Informationen über Sie, behalten aber jeweils eine eigene Version davon.

Jedes Mal, wenn Sie das Gerät wechseln, müssen Sie sich erneut vorstellen.

Sie kennen Sie jeweils, aber keiner kennt den anderen.

Die fehlende Ebene kann man sich an den Super-Apps der Smartphone-Ära als Referenz vorstellen. WeChat interessiert sich nicht dafür, welche Marke von Mobiltelefon Sie verwenden, es interessiert sich dafür, ob Ihre Chats, Zahlungen und Reisen alle in seiner App stattfinden.

Jetzt tritt eine ähnliche Logik aus dem Bildschirm heraus. Das sogenannte „Zentralgerät“ der KI-Hardware entspricht dieser Kontinuität: Identität, Erinnerung und Berechtigungen bleiben auf der oberen Ebene, und je nach Aufgabe werden verschiedene Geräte und Fähigkeiten aufgerufen.

Früher aggregierten Super-Apps digitale Dienste. Personal AI geht einen Schritt weiter: Es soll Informationen, Dienste und Handlungsfähigkeiten organisieren, die in verschiedenen Szenarien verteilt sind.

Bill Gates hat vor drei Jahren dieselbe Schlussfolgerung gezogen: Android, iOS und Windows sind Plattformen, und Agenten werden die nächste Plattform sein. Als er