Der Wettbewerb in der zweiten Hälfte der KI-Entwicklung besteht nicht darin, wer besser im Chatten ist.
Text von Wang Yi
In den vergangenen zwei Jahren hat die KI die Kosten für die Informationserzeugung stark gesenkt, aber die Glaubwürdigkeit der Antworten nimmt auch schnell ab. Reiseführer empfehlen oft Touristenattraktionen, die bereits geschlossen sind, und die als „unbedingt zu probieren“ angepriesenen lokalen Restaurants halten nicht immer, was sie versprechen. Viele scheinbar vollständige Reisepläne können von Nutzern oft nur als Referenz betrachtet werden, ohne dass sie sie direkt umsetzen trauen.
Da die Antworten immer billiger werden, ist die Frage nach ihrer Wahrhaftigkeit zu einem neuen Problem geworden.
Das Wesen des Problems liegt nicht darin, dass die großen Modelle nicht klug genug sind, sondern dass die meisten KI-Systeme kein Verständnis für die reale Welt haben. Informationen können abgerufen und generiert werden, aber die reale Welt besteht nicht nur aus Texten. Es ist für die KI sehr schwierig, die tatsächliche Warteschlange in einem Restaurant zu beurteilen, die Unterschiede im Erlebnis eines Viertels zu unterschiedlichen Tageszeiten zu erkennen und wichtige Entscheidungsvariablen wie Vertrauen, räumliche Atmosphäre und individuelle Vorlieben zu verstehen.
Diese Fähigkeiten bauen genau auf den langjährig angesammelten raumzeitlichen Daten und der Karteninfrastruktur von Amap auf. Herkömmliche Karten lösen die Frage, wie Orte miteinander verbunden sind, und die Navigation zeigt, wie man sie erreicht. Räumliche Intelligenz geht einen Schritt weiter und beschreibt die reale Welt selbst: die dreidimensionale Raumstruktur, den sich ständig ändernden Personen- und Fahrzeugverkehr sowie die dynamischen Beziehungen zwischen Menschen und ihrer Umwelt.
Daher kann Amap heute nicht nur die Frage „Wie sieht die Welt aus“ beantworten, sondern auch verstehen, „in welchem Zustand sie sich gerade befindet, wie sie sich als Nächstes verändern wird und wie man handeln soll“. Für Amap ist räumliche Intelligenz nicht nur eine neue Technologie für Karten und Navigation, sondern auch ein Paradigmenwechsel der Fähigkeiten, der die Grenzen der Dienstleistungen von Amap für die reale Welt erweitert.
01. Verständnis der realen Welt: Die neue Barriere für KI-Anwendungen
Im Gegensatz zu anderen KI-Systemen, die auf Textableitung angewiesen sind, versucht Amap, räumliche Intelligenz in konkrete Reiseszenarien zu implementieren.
Für Nutzer erfordert ein Reiseplan mit praktischem Referenzwert, dass die Informationen ausreichend vertrauenswürdig sind, die Empfehlungen zu den individuellen ästhetischen Vorlieben passen, das Erlebnis vor Ort im Voraus wiedergegeben werden kann und gleichzeitig komplexe reale Variablen wie Zeit, Wetter, Mitreisende und Verkehrsbedingungen berücksichtigt werden.
Daher ist eine Liste, die der realen Welt entspricht, keine einfache Sortierung von Orten, sondern eine vollständige Simulation der realen Welt. Angetrieben von räumlicher Intelligenz hat die Amap Street-Sweep-Liste 2026 eine umfassende Aktualisierung im Bereich der Weltsimulation erreicht.
Bisher war das Internet-Bewertungsökosystem lange Zeit durch Störfaktoren wie Marketingverkehr beeinträchtigt. Die Amap Street-Sweep-Liste nutzt die nicht fälschbaren echten Navigationsbesuche von Geschäften, um die direkteste Beurteilung der Nutzer für ein Geschäft zu bilden, was der Vertrauenswürdigkeit der Liste eine Grundlage gibt. Auf dieser Grundlage wurde der Algorithmus der Amap Street-Sweep-Liste weiter unterteilt, um zu erkennen, ob jeder Besuch gezielt erfolgte oder zufällig vorbeiging, ob es sich um einen Stammkunden oder einen neuen Kunden handelte und ob der Besucher ein Einheimischer oder ein Tourist war.
Die Logik ist offensichtlich: Der Verkehr ist nicht das Ziel, sondern der Wert des Verkehrs ist es. Ein Geschäft, das es wert ist, dass Kunden mehrere Kilometer zurücklegen, um es gezielt zu besuchen, ist nicht gleichwertig mit einem Geschäft, das man nur zufällig passiert, wenn es um die Empfehlungswürdigkeit geht.
Darüber hinaus können Verhaltensdaten den tatsächlichen Besuch nachweisen, aber die Besucher unterscheiden sich voneinander. Wenn alle Nutzer das gleiche Gewicht bei der Bewertung haben, werden viele professionelle Beurteilungen leicht durch Durchschnittswerte überdeckt.
Die Lösung der Street-Sweep-Liste besteht darin, professionelle Bewertungen einzuführen. Für Listen mit hohem Professionalitätsgrad wie Cafés erhalten die Bewertungen von Experten ein höheres Gewicht. In einer Zeit, in der KI-Empfehlungen allgemein homogen sind, können nur höhere Gewichte für subjektive Variablen wie Geschmack die einzigartig qualitativ hochwertigen Orte aus den Empfehlungen herausfiltern, die dem durchschnittlichen Geschmack der Masse entsprechen.
Die Liste kann Nutzern sagen, wohin sie gehen sollen, aber sie kann nicht beantworten, wie ein Geschäft tatsächlich aussieht. Früher konnten Nutzer nur anhand von Text- und Bildbewertungen die Szene vor Ort erahnen, und der Informationsunterschied zwischen Online- und Offline-Welt führte zu einer Enttäuschung der Erwartungen der Nutzer, nachdem sie tatsächlich vor Ort angekommen waren.
Die Flug-Panoramaansicht 2.0 versucht, diesen Informationsunterschied zu beseitigen. Basierend auf dem Amap ABot-Earth 0.7-Weltmodell verwandelt es das Ziel in einen frei erkundbaren dreidimensionalen Raum, sodass Nutzer vor der Abreise in den realen Raum eintreten, den Betrachtungswinkel und die Position frei anpassen und auf dem Bildschirm ein immersives Gefühl vor Ort erhalten können.
Dieses Erlebnis, zuerst die Szene anzusehen und dann loszufahren, verwandelt die Entscheidung von abstrakten Punkten in konkrete Szenarien und reagiert auf die Angst der Nutzer vor dem Unbekannten.
Neben der Flug-Panoramaansicht 2.0 nutzt der neu eingeführte Leitfaden zur Vermeidung von Fallstricken der Amap Street-Sweep-Liste auch die deterministische raumzeitliche Berechnung, um die unkontrollierbaren Unsicherheiten auf Reisen zu bekämpfen. Der Leitfaden zur Vermeidung von Fallstricken kombiniert die Echtzeit-Wahrnehmung und die raumzeitliche Ableitung, um die gesamte Reise zu überprüfen. Aus 15 Dimensionen wie Öffnungszeiten, Reisegeschwindigkeit, Parkhinweisen und Überfüllungsprognose erkennt er im Voraus Risiken wie Zeitkonflikte, Staus und geschlossene Geschäfte und teilt den Nutzern im Voraus die zu erwartenden Probleme und umsetzbare Vorschläge mit.
Nach der tatsächlichen Abreise und Ankunft kann die Navigation Live nicht nur die Sprache der Nutzer verstehen, sondern auch in Echtzeit die Position, die Richtung und die Umgebung der Nutzer wahrnehmen und durch die Kamera die Straßenansichten erfassen, um Vorschläge zu geben, die stark mit der aktuellen Situation zusammenhängen.
Das Wesen der Navigation Live ist ein verkörperter intelligenter Agent mit der Fähigkeit „raumzeitlicher Kontext + Wahrnehmung vor Ort + end-to-end Handlungsfähigkeit“. Wenn Sie beispielsweise in einem komplexen alten Viertel einer fremden Stadt fahren oder zu Fuß gehen und drei sehr nahe, enge Gassen vor Ihnen liegen, wird die herkömmliche Navigation nur anzeigen „Biegen Sie 50 Meter voraus rechts ab“, und Sie werden höchstwahrscheinlich falsch abbiegen. Die Navigation Live kann die Szene direkt verstehen: „Biegen Sie in die Gasse rechts von dem Lebensmittelgeschäft mit roten Laternen ein und vermeiden Sie den Lieferwagen, der links Waren entlädt“.
02. Räumliche Intelligenz: Die Grundlage für das Verständnis der realen Welt
Von den realistischen Konsumentscheidungen, die die Street-Sweep-Liste bietet, über die Flug-Panoramaansicht, mit der Nutzer das Ziel im Voraus klar sehen können, bis hin zum Leitfaden zur Vermeidung von Fallstricken, der die Reise im Voraus ableitet, und der Navigation Live, die Nutzer beim Eintritt in die reale Welt begleitet, hat Amap die Fähigkeit, die reale Welt zu verstehen, von einer einzelnen Liste auf die vollständige Reisekette eines ganzen Tages ausgedehnt.
Dahinter stehen die Fähigkeiten von Amaps räumlicher Intelligenz zur dreidimensionalen Raumdarstellung, Echtzeit-dynamischen Wahrnehmung und raumzeitlichen Ableitung.
Zunächst ist der Ausgangspunkt aller Erkenntnisse der Aufbau eines dreidimensionalen Raums, der von Maschinen verstanden werden kann. Herkömmliche Navigationsanwendungen markieren Orte normalerweise mit Punkten, Tags, Text- und Bildinformationen. Aber die reale Welt, wie die Breite von Straßen, die Ausrichtung von Geschäften und die Erreichbarkeit zu Fuß, basiert auf räumlichen Beziehungen. Amap digitalisiert diese physischen Eigenschaften vollständig durch das 3D-native Stadtweltmodell ABot-Earth 0.7, teilt den Nutzern das räumliche Gefühl mit, wenn sie sich darin befinden, und legt die Grundlage für nachfolgende Simulationen und Vorhersagen.
Nachdem der statische dreidimensionale Weltraum erstellt wurde, werden verschiedene plötzliche Veränderungen in der realen Welt, wie temporäre Straßenarbeiten oder vorübergehende Schließungen von Geschäften, nicht im Voraus in die Datenbank aufgenommen. Die dynamische Wahrnehmung fungiert als Sinnesystem dieses Weltmodells, das ständig die neuesten Signale der realen Welt empfängt und zurückmeldet.
Darüber hinaus ist die reale Welt ständig in Bewegung. Der Personen- und Fahrzeugverkehr bildet ein riesiges dynamisches Flusssystem. Die raumzeitliche Ableitung ermöglicht es der KI, zu sehen, wie diese Welt funktioniert.
Die Navigation Live ist ein typisches Produkt, das das Zusammenspiel dieser drei Fähigkeiten veranschaulicht.
Stellen Sie sich ein alltägliches Szenario vor, in dem Sie mit dem Auto durch die Stadt fahren: Während der Fahrt scannt die Endseite die Umgebung kontinuierlich mit millisekundengenauer dynamischer Wahrnehmung, liest die reale Welt sofort ein, erkennt die blinkenden Bremslichter voraus, die Straßensperren auf der Fahrbahn und auch das neu eröffnete Café am Straßenrand und übermittelt dem System vollständig, „was gerade passiert“.
Die raumzeitliche Ableitung in der Cloud übernimmt die in Echtzeit erfassten Signale und trifft eine globale Vorhersage über die Sichtweite hinaus. Beispielsweise wird vorhergesagt, ob ein Fahrzeug aus der Gegenrichtung aus dem Kurvenblindbereich fährt, und bewertet, wie stark eine Straßenbauarbeiten den Fahrzeugverkehr auf den folgenden Kilometern behindern wird, sodass potenzielle Risiken, die noch nicht im Sichtbereich liegen, im Voraus offengelegt werden.
Die dreidimensionale Raumdarstellung übernimmt die Verankerung und Fusion zwischen digitalen Informationen und physischen Szenen. In realen Szenarien fährt das Fahrzeug ständig über Unebenheiten, und die Perspektive des Geräts bewegt sich ständig. Basierend auf dem angesammelten dreidimensionalen Raumfundament kann die Navigation Live alle Hinweise fest in der realen Straßenansicht verankern, sodass die Bilder nicht driften und die Informationen nicht wackeln, und Routenhinweise, Risikowarnungen und Einführungen zu umliegenden Orten nahtlos in das reale Sichtfeld überlagern.
03. Im KI-Zeitalter: Die unterschätzte Amap
Seit diesem Jahr weisen Branchenforen und Forschungsinstitute darauf hin, dass die KI-Branche die Phase des Wettbewerbs um Parameter und Textgenerierungseffekte hinter sich gelassen hat. Da die Konversationsfähigkeiten großer Modelle immer ausgereifter werden, hat sich die neue Aufgabe der Branche gewandelt: KI darf nicht nur in Dialogfenstern existieren. Um ihren Wert wirklich zu entfalten, muss sie in die physische Welt eintreten.
Li Fei-Fei, bekannt als „die Patentante der KI“, hat früh vorgeschlagen, dass große Modelle über umfassende Sprachkenntnisse verfügen, aber keine persönliche Wahrnehmung der physischen Welt haben. In ihrem neuesten Interview sagte sie erneut: Meiner Meinung nach ist die künstliche allgemeine Intelligenz ohne räumliche Intelligenz unvollständig.
Die echten Kapitalinvestitionen der Industrie bestätigen diese Beurteilung. World Labs, das von Li Fei-Fei gegründet wurde, erhielt eine Investition von 230 Millionen US-Dollar und konzentriert sich auf die Entwicklung von KI mit „räumlicher Intelligenz“; Yann LeCun, ehemaliger Chef-KI-Wissenschaftler von Meta, verließ Meta letztes Jahr, gründete AMI Labs und sammelte mehr als 1 Milliarde US-Dollar für den Aufbau von Weltmodellsystemen; Wang Xingxing, Gründer von Unitree Robotics, erklärte auch auf der diesjährigen Weltroboterkonferenz, dass der größte Engpass der verkörperten Intelligenz derzeit die unzureichende Generalisierungsfähigkeit ist. Daher arbeitet das Unternehmen intensiv an der Entwicklung von Modellen für physische KI-Roboter, um die Schwächen des verkörperten „Gehirns“ schnell zu beheben.
Autohersteller beginnen, über physische KI zu sprechen. Intelligentes Fahren verfolgt nicht mehr nur die flüssige Konversation im Fahrgastraum, sondern konzentriert sich auf die Entwicklung von Weltmodellen, sodass Fahrzeuge den Straßenraum verstehen können. Praktiker im Bereich der verkörperten Intelligenz erkennen auch, dass die Engpässe von Robotern nicht vollständig in der Dialoginteraktion liegen. Das Verständnis dreidimensionaler Umgebungen, räumlicher Beziehungen und die Vorhersage von Bewegungen von Objekten sind unvermeidbare Schritte bei der praktischen Umsetzung.
Dies zeigt, dass alle KI-Anwendungen, die mit der realen physischen Welt verbunden werden müssen – ob autonomes Fahren, humanoide Roboter, digitale Stadtverwaltung oder lokale Lebensdienste – nicht auf die Unterstützung durch räumliche Intelligenz verzichten können.
Große Modelle können unzählige schöne Antworten in Massen generieren, aber die reale Welt ist die ultimative Prüfung für den Wert der KI. Früher wurde KI danach beurteilt, ob sie flüssig hervorragende Inhalte ausgeben kann. Der Schlüssel zur Unterscheidung der Fähigkeiten von KI in der Zukunft liegt darin, in welchem Ausmaß sie die sich ständig verändernde reale Welt verstehen kann.
Vor diesem Branchenhintergrund tritt der Wert von Amap erneut hervor. Die reale Welt zu verstehen bedeutet nicht, mehr Informationen über Orte zu kennen, sondern beurteilen zu können, was eine bestimmte Person zu einer bestimmten Zeit an einem bestimmten Ort mit Mitreisenden, unter bestimmten Wetterbedingungen und mit bestimmten Vorlieben sehen wird, ob es überfüllt ist, wie lange sie bleiben wird und wohin sie als Nächstes natürlich gehen wird. Letztendlich muss es nicht nur die Fragen „Wo ist es? Wie kommt man dorthin?“ beantworten, sondern auch „Was wird passieren? Wie fühlt es sich an? Für wen ist es geeignet? Und warum?“.
Ohne die Anhäufung