StartseiteArtikel

Von Siri bis Muse: Wie wir unser Leben Schritt für Schritt der KI überlassen

窄播2026-10-08 10:23
Ein Staffellauf

Siri muss die Vision einer Do-Engine einholen, die es selbst einst initiiert hat. Die neu aufkommenden Muse-Produkte müssen zudem einen Prozess der stetigen Verbesserung ihrer Zuverlässigkeit, Sicherheit und Wirtschaftlichkeit durchlaufen.

Der Technikvideo-Ersteller Matt Robb hat eine Tastatur auf Facebook Marketplace eingestellt und Muse die gesamte Kommunikation mit Käufern überlassen. Daraufhin akzeptierte Muse selbstständig ein niedrigeres Angebot, schickte die private Wohnadresse an den Käufer und vereinbarte einen Termin für den Besuch vor Ort. Erst als ein Fremder vor der Tür seiner Wohnung stand, wurde Robb klar, dass Muse eine ganze Reihe von Entscheidungen in seinem Namen getroffen hatte.

Dies war eine von KI gesteuerte Aktion, die über den Bildschirm hinausging und auf die Weise, dass ein Fremder vor der Haustür des Nutzers stand, in die reale Welt eingriff. Diese Aktion hat zwar die Aufmerksamkeit auf den Verlust der Kontrolle über die Berechtigungen von Muse gelenkt, zeigt aber gleichzeitig die verlockendste Seite dieses Produkttyps.

Weniger als einen Monat nach der Veröffentlichung nutzen bereits einige Nutzer Muse, um mit Telekommunikationsanbietern über Preise zu verhandeln, Breitbandverträge zu kündigen oder Entschädigungen für Flugausfälle zu beantragen. Andere lassen Muse Haushaltswaren einkaufen und Reinigungsdienste buchen. Viele konkrete Punkte auf der persönlichen Aufgabenliste können von Muse direkt erledigt und von der Liste gestrichen werden. Diese Art von Erlebnis hat Muse eine große Anzahl von Nutzern eingebracht. Nach Schätzungen von Sensor Tower überschritt die Anzahl der Downloads von Muse Ende September 2026 bereits 5 Millionen.

Diese Art der Popularität erinnert stark an OpenClaw zu Beginn des Jahres. Beide sind Agent-Produkte, die ein beeindruckendes Nutzererlebnis bieten und in kurzer Zeit die Aufmerksamkeit aller Seiten auf sich ziehen. Der Unterschied besteht darin, dass OpenClaw gezeigt hat, dass ein Agent mit Gedächtnis-, Dateizugriffs- und Nachrichtenschnittstellen wie ein digitaler Mitarbeiter kontinuierlich arbeiten kann. Muse hingegen hat der breiten Öffentlichkeit einen Haushaltsroboter vorgestellt, der sich besser in Einkauf, Reisen, soziale Interaktionen und das Familienleben integrieren lässt.

Die Schaffung eines solchen Haushaltsroboters ist ein technologisches Gleichnis, das die Geschichte des Internets und der Künstlichen Intelligenz durchzieht. Bereits das unabhängige Siri-Produkt von 2010 verfolgte das Ziel, eine „Do-Engine“ zu werden. In der Folge haben Generationen von persönlichen Assistenten unter unterschiedlichen technischen Voraussetzungen nacheinander Schnittstellen, Eigeninitiative, Gedächtnis, Verständnis, Schlussfolgerung, Handlungsfähigkeit und kontinuierliche Betriebsfähigkeit hinzugewonnen, um den Haushaltsroboter in die Realität zu überführen.

Erst mit dem Erscheinen von Muse wurden all diese Fähigkeiten wirklich zusammengeführt und zu einem Paradigma eines verbraucherorientierten Produkts für die breite Öffentlichkeit gemacht.

01

Eine Do-Engine, kein Chatbot

Die Idee und die Versuche, Computer wie eine Person Aufträge entgegennehmen und Aufgaben erledigen zu lassen, gehen noch vor dem Erscheinen des unabhängigen Siri-Produkts zurück.

1987 stellte Apple in seinem Konzeptvideo „Knowledge Navigator“ einen digitalen Assistenten vor. Er hatte eine eigene Darstellung, konnte für Professoren Facharbeiten suchen, Nutzer daran erinnern, Anrufe zurückzugeben und während des Telefonats weitere Informationen abrufen.

Einige Jahre später wurde diese Vorstellung zu einem konkreten Produkt. 1994 konnte der persönliche Assistent Wildfire auf dem Telefon Nachrichten verarbeiten, Anrufe tätigen und Voicemails verwalten. Das 1998 eingeführte Portico ermöglichte es bereits, das Mobiltelefon mit dem Internet zu verbinden und per Sprachsteuerung E-Mails zu lesen, Kurznachrichten zu senden und weitere Aufgaben zu erledigen.

Aber keines dieser Produkte erreichte eine breite Verbreitung. Der Grund lag darin, dass die technischen Voraussetzungen zu dieser Zeit noch nicht ausreichten, um einen wirklich zuverlässigen Assistenten zu unterstützen. Im gleichen Zeitraum brachte Microsoft auch den Assistenten Clippy in Form eines Büroklammers auf den Markt, der versuchte, Nutzern aktive Hilfe zu leisten. Da er den Nutzern jedoch immer wieder unnötige Störungen bereitete, wurde er vom Time Magazine zu einem der 50 schlechtesten Erfindungen aller Zeiten gezählt.

Erst als Apple 2008 den App Store und das SDK offiziell der Öffentlichkeit vorstellte, sahen die drei Gründer von Siri eine neue Chance, einen Haushaltsroboter zu entwickeln. Bewerber, die zu Siri kamen, wurden aufgefordert, das Buch *Das unvollendete Revolution* von Michael Dertouzos zu lesen, denn Dertouzos war der Ansicht, dass Geräte den Menschen dienen sollten – nicht umgekehrt, dass Menschen den Geräten dienen. Personen, die Dertouzos' Ansichten nicht teilten, wurden als ungeeignet für die Arbeit bei Siri eingestuft.

2010 wurde das unabhängige Siri-Produkt veröffentlicht. Was Steve Jobs daran faszinierte, war nicht nur, dass es hervorragend chatten konnte, sondern vor allem, dass es konkrete Aufgaben für Nutzer erledigen konnte. Nutzer konnten Siri direkt sagen: „Hilf mir, ein romantisches italienisches Restaurant in der Nähe meines Arbeitsplatzes zu finden“, und Siri führte Informationen von Citysearch, Gayot, Yelp, Yahoo! Local, AllMenus.com, Google Maps, BooRah und OpenTable zusammen, um eine passende Antwort zu geben.

Für normale Nutzer zu dieser Zeit war dies eine weitere Art von Suchmaschinendienst. Aber die Gründer von Siri und Steve Jobs waren fest davon überzeugt, dass Siri eine Do-Engine und keine Suchmaschine ist.

Adam Cheyer, Mitbegründer von Siri, fasste die Kernfähigkeit des Produkts später so zusammen: „Verständnis von Text und Integration von Informationen.“ Er erinnerte sich auch daran, dass das Team kurz nach der Einführung von Siri mehrere Bilder im Stil von Magazincovern erstellt hatte. Eines der Bilder zeigte, wie Siri das Logo von Google verformt und zusammendrückt – als Sinnbild dafür, dass es Google eines Tages besiegen würde.

Auf die Frage, ob die Übernahme von Siri dazu diente, in das Suchgeschäft einzusteigen, antwortete Steve Jobs klar: „Sie sind kein Suchunternehmen. Sie sind ein KI-Unternehmen. Wir haben keine Pläne, in den Suchbereich einzusteigen.“ Das heißt, Apple kaufte nicht ein weiteres Suchfeld, sondern eine intelligente Ebene, die Nutzer verstehen und die Fähigkeiten des Mobiltelefons steuern kann.

2011 wurde das übernommene Siri mit dem iPhone 4S zu einer Systemfunktion. Viele normale Nutzer erlebten zum ersten Mal, dass sie ein Aufgabenziehl direkt in das Telefon sprechen und die Operation abschließen konnten, statt zuerst eine App zu öffnen, nach Schaltflächen zu suchen und die Operation schrittweise durchzuführen. Sein personalisierter Ton machte die Kommunikation zwischen Mensch und Maschine weniger steif.

Bei Siri in den Jahren 2010 und 2010 können wir bereits den Ansatz eines Haushaltsroboters erkennen. Er konnte natürliche Sprache verstehen, Dienste von Drittanbietern aufrufen, Hardwaregeräte steuern und hatte einen personalisierten Ton. Die Gründer von Siri haben sogar ein Geschäftsmodell für ihn vorgestellt, bei dem er für Nutzer Restaurants auswählt und dafür eine Servicegebühr erhält. Dies ist keine bloße Interaktionsmethode, sondern ein potenzieller geschäftlicher Einstiegspunkt.

02

Zum Einstiegspunkt geworden – aber in einer vordefinierten Welt gefangen

Steve Jobs hat wahrscheinlich den Wert von Siri als Einstiegspunkt erkannt, aber er starb, bevor er ihn umsetzen konnte. Danach erlebte Siri im Inneren von Apple eine strategische Fehlausrichtung. Bill Stasior, der 2012 die Leitung von Siri übernahm, kam von der Suchabteilung von Amazon und tendierte dazu, Siri zu einer Suchmaschine auszubauen, um die Suchfähigkeiten von Apple mit Siri zu bündeln. Der Aufbau des Ökosystems von Drittanbietern, den Steve Jobs bei der Übernahme von Siri versprochen hatte, kam erst 2016 ans Licht.

Zu dieser Zeit hatte Amazons Alexa bereits durch den Echo-Lautsprecher einen steilen Aufstieg erlebt, den persönlichen Assistenten in das Wohnzimmer gebracht und die Position als geschäftlicher Einstiegspunkt eingenommen.

Als Amazon 2014 den Echo vorstellte, setzte das Unternehmen nicht wirklich auf einen Lautsprecher – sondern darauf, dass Alexa durch den Lautsprecher schließlich zum einheitlichen Einstiegspunkt im Haushalt wird. Fernfeld-Mikrofone, Aktivierungswörter und ständige Verfügbarkeit sorgten dafür, dass Nutzer Alexa aufrufen konnten, ohne das Mobiltelefon in die Hand zu nehmen. Danach öffnete Amazon die Skills-Plattform, um Musik, Einkauf, Kalender, intelligente Haustechnik und Dienste von Drittanbietern zu integrieren.

Nutzer konnten Alexa direkt einen Satz sagen, um Musik abzuspielen, Haushaltsgeräte zu steuern, das Wetter abzufragen oder einen Lebensservice aufzurufen. Dies war ursprünglich die eigene Vorstellung von Siri – aber Amazon hat es schneller zu einem ausgereiften Produkterlebnis gemacht.

Anschließend zog Google nach und stellte den Assistant vor, um Nutzern ein „umgebungsbezogenes Erlebnis zu bieten, das geräteübergreifend und szenarienübergreifend existiert“. Google Assistant kann auf Mobiltelefonen, Lautsprechern und Chat-Anwendungen erscheinen. Mithilfe von Suche, Karten und Wissensgraphen versteht es die Welt, in der sich Nutzer befinden, ruft Restaurants und Friseursalons an, spricht mit echten Personen, bearbeitet Terminüberschneidungen und schließt Buchungen ab.

Das Siri-Team von Apple wurde jedoch erst auf einer Konferenz im Jahr 2015 angewiesen, eng mit dem Beats-Team zusammenzuarbeiten, um den intelligenten Sprachassistenten in den HomePod zu integrieren. Im gleichen Zeitraum wurde Siri unter den Ökosystemvorteilen von Apple schnell in Mac, Apple Watch und Apple TV integriert – mit dem Ziel, das „Sprachbetriebssystem“ für Apples Hardware zu werden. Zu diesem Zeitpunkt hatte Siri aber bereits die Offenheit aus der Zeit als Startup-Unternehmen verloren.

Teams in China haben ebenfalls von Amazon gelernt, neue Einstiegspunkte aufzubauen: Wenn Sprache Menüs und App-Symbole ersetzen kann, können persönliche Assistenten die Verteilungswege von Inhalten, Haustechnik und Diensten neu ordnen. Daher verbindet Xiaomi über Xiaoai die Mobiltelefone, Fernseher, Lautsprecher und IoT-Geräte miteinander; Tmall Genie versucht, E-Commerce, Bezahlfunktionen und Inhalte in den Haushalt zu bringen; Xiaodu konkurriert um Nutzer mit preisgünstigen Lautsprechern und Geräten mit Bildschirm.

Mehr Konkurrenten bedeuten nicht, dass die persönlichen Assistenten zur Reife gelangt sind. Das frühe Siri war auf große Vokabularbibliotheken und manuelle Regeln angewiesen. Die Hinzufügung neuer Ausdrücke konnte Wochen dauern, und komplexe Funktionen erforderten sogar einen Entwicklungszyklus von fast einem Jahr. Damit Alexa Essensbestellungen, Fahrtenbuchungen oder Gerätesteuerungen durchführen kann, muss die Plattform für jeden Dienst einen separaten Skill entwickeln. Bei jeder Integration eines neuen Dienstes müssen Ingenieure Abläufe entwerfen, Autorisierungen verarbeiten und Ausnahmefälle behandeln.

Die Vordefinitionen werden immer zahlreicher, aber die Flexibilität und Freiheitsgrade der Assistenten werden trotzdem nicht erweitert. Nach dem Weggang von Apple gründeten die Siri-Gründer Adam Cheyer und Dag Kittlaus Viv Labs, um durch „dynamische Programmerzeugung“ Dienste je nach Fragestellung des Nutzers spontan zusammenzufügen, statt für jede Anforderung im Voraus Abläufe zu schreiben. Dies kommt der heutigen Vorstellung von Agenten bereits sehr nahe – aber aufgrund technischer Einschränkungen wurde kein ideales Ergebnis erreicht.

Gleichzeitig haben technische Beschränkungen die Berechtigungen verringert, die die Plattformen bereit sind freizugeben. Die Folgen eines falsch abgespielten Liedes sind begrenzt – aber wenn ein falscher Flug gebucht, eine falsche Nachricht gesendet oder eine falsche Zahlung ausgeführt wird, entsteht echte Haftung. Je schwächer die Verständnisfähigkeit ist, desto weniger trauen sich Hersteller, Berechtigungen freizugeben. Je stärker die Berechtigungen eingeschränkt sind, desto schwerer ist es für Assistenten, echte Handlungsfähigkeit zu erlangen.

Die persönlichen Assistenten in dieser Phase befinden sich in einem widersprüchlichen Entwicklungsstand: Sie sind aktiver als mobile Anwendungen, aber mechanischer als echte Haushaltsroboter. Sie besetzen immer mehr Einstiegspunkte, können aber trotzdem nur in der vordefinierten Welt handeln.

03

Generative KI durchbricht die vordefinierten Engpässe

Ende 2022 hat ChatGPT den Entwicklungsengpass der persönlichen Assistenten durchbrochen.

Es hat keine Mobiltelefone oder intelligente Haustechnik übernommen, aber es hat der breiten Öffentlichkeit zum ersten Mal gezeigt, dass KI über eine offene Frage hinweg kontinuierlich sprechen, Nachfragen entgegennehmen, Begründungen erklären und neue Inhalte generieren kann.

Alte Assistenten mussten zuerst die Ausdrucksweise des Nutzers in vordefinierte Kategorien einordnen. Große Sprachmodelle hingegen können Ziele, Einschränkungen und Kontext verstehen, Absichten erkennen und verfügen über eine Fähigkeit, die dem „Verstehen“ sehr nahe kommt. Nutzer müssen keine festen Satzformen verwenden, die das System kennt, und die Frage nicht in mehrere Standardschritte zerlegen. Die Maschine kann zuerst verstehen, was der Mensch eigentlich tun möchte, und dann entscheiden, wie sie reagiert.

Anschließend zeigte OpenAI zwei weitere Versuche der Evolution zum persönlichen Assistenten: Zum einen senkte GPT-4o die Sprachverzögerung weiter, unterstützt Unterbrechungen, visuelle Erkennung und Echtzeit-Feedback, sodass Sprache von einer Eingabemethode zu einer Schnittstelle wird, die die gemeinsame Umgebung mit dem Nutzer teilt. Zum anderen integrieren Plugins das Modell in Suchmaschinen und Dienste von Drittanbietern, sodass das Modell nach Erhalt der Autorisierung begrenzte reale Handlungen ausführen kann.

Diese Darstellung der Möglichkeiten beschleunigte auch das Absterben oder die Iteration der persönlichen Assistenten der vorherigen Generation.

2023 stellte Microsoft die Unterstützung für die eigenständige App Cortana ein und leitete Nutzer auf die Seite zu Copilot weiter. Dies ist nicht nur eine Abschaltung eines Produkts, sondern ein Paradigmenwechsel: Cortana baute auf Aktivierungswörtern und festen Fähigkeiten auf; Copilot hingegen nutzt das große Modell als Verständnisebene und integriert sich in Windows und Microsoft 365.

Auch Apple versucht, Siri