StartseiteArtikel

AI-Kopfhörer bauen Momentum auf, Chiphersteller stehen bereit zum Loslegen.

半导体产业纵横2026-10-04 15:55
AI-Kopfhörer haben sich noch nicht zu einer klar abgegrenzten Produktkategorie entwickelt, doch Chiphersteller beginnen bereits, die nächste Generation von Plattformen für sie vorzubereiten.

Sind die klassischen Kopfhörer am Ende?

AI-Kopfhörer werden zum Mainstream auf dem Markt für drahtlose Kopfhörer. Nach Berechnungen von Research and Markets belief sich der globale Marktumfang für AI-Kopfhörer im Jahr 2025 auf etwa 5,99 Milliarden US-Dollar, es wird erwartet, dass er bis 2026 auf 7,42 Milliarden US-Dollar ansteigt und bis 2030 17,34 Milliarden US-Dollar erreicht.

Ein Urteil, das in der Unterhaltungselektronikbranche am häufigsten wiederholt wird, lautet: Alle Hardware verdient es, mit KI neu entwickelt zu werden.

Seit diesem Jahr nehmen die KI-bezogenen Funktionen in Kopfhörerprodukten immer mehr zu: Spracherkennung, Anrufrauschunterdrückung, Aufnahmeumschreibung, Echtzeitübersetzung und intelligente Assistenten werden alle in die Erzählung von „KI-Kopfhörern“ aufgenommen. KI-Kopfhörer sind noch keine Kategorie mit klar definierten Grenzen, aber Chiphersteller haben bereits damit begonnen, die nächste Generation von Plattformen dafür vorzubereiten.

KI-Kopfhörer: Was für eine neue Spezies ist das? 

Betrachtet man nur die Neuerscheinungen des letzten Jahres, wird KI zu einer wichtigen Stütze, damit Kopfhörer in die Preisklasse von 1000 Yuan eintreten können.

Im September 2025 veröffentlichte Huawei die offenen Kopfhörer FreeClip 2 zu einem Preis von 1299 Yuan. Im Vergleich zur Vorgängerversion ist dieses Produkt erstmals mit einem unabhängigen NPU-KI-Prozessor ausgestattet, die KI-Rechenleistung ist etwa 10-mal höher als bei der Vorgängerversion und wird hauptsächlich für Aufgaben wie Sprachverbesserung, Anrufe und Interaktion verwendet.

Dieses Jahr im August brachte Shokz das OpenFit 2 AI zum Preis von 1398 Yuan auf den Markt, das an das große Sprachmodell Tongyi von Alibaba angeschlossen ist und auf Langzeitaufzeichnung, Sprachumschreibung, Sitzungszusammenfassung und Mehrsprachenübersetzung setzt. Dadurch verwandeln sich Kopfhörer von „Wiedergabegeräten“ zu tragbaren Spracheingängen.

Der Ansatz von iFlytek nähert sich eher aufgabenorientierten Endgeräten. Seine KI-Übersetzungskopfhörer begannen im November 2025 mit dem Vorverkauf zum Preis von 2499 Yuan und deckten Szenarien wie persönliche Übersetzung, Anrufübersetzung, Online-Simultanübersetzung und Nebenhör-Simultanübersetzung ab. Eine Demontage im Mai 2026 zeigte, dass solche Produkte in Bezug auf Hauptsteuerung, Mikrofonarray und lokalen Speicher komplexer sind als gewöhnliche TWS-Kopfhörer. Ähnlich dazu tauchten 2026 auf dem globalen Markt Lösungen für KI-Kopfhörer mit Ladeetui mit eSIM-Netzwerk auf, Plaud verbindet Kopfhörer mit KI-Agenten, um die Abhängigkeit vom Smartphone zu verringern.

OpenAI hat das Designunternehmen LoveFrom, das gemeinsam von Apples ehemaligem Chefdesigner Jony Ive gegründet wurde, für etwa 6,5 Milliarden US-Dollar übernommen. Nach mehreren Nachrichten aus der Lieferkette lautet der Codename des gemeinsam entwickelten Produkts „Sweet Pea“, es handelt sich höchstwahrscheinlich um einen intelligenten Kopfhörer, der auf KI-Interaktion setzt, mit einem kundenspezifischen Chip im 2-nm-Verfahren, dessen Ziel die lokale Verarbeitung von KI-Aufgaben am Kopfhörer selbst ist und der für die zweite Jahreshälfte 2026 geplant ist.

Kameras bringen KI-Kopfhörer zu Geräten mit „vollständiger Wahrnehmung“. Guangfan Technology stellte im Frühjahr 2026 den Lightwear Kamera-KI-Kopfhörer vor, der in öffentlichen Berichten zu einem Startpreis ab 1799 Yuan angeboten wird, einige Versionen kosten 1999 Yuan; das Produkt fügt eine Kamera am Kopfhörer hinzu und erledigt die kooperative Verarbeitung von Bildern, Ton und Position über die Mobilfunknetz- und Ortungsfunktion des Ladeetuis. Er versteht nicht mehr nur, was der Nutzer sagt, sondern versucht auch zu verstehen, was der Nutzer sieht. Die AirPods mit Kamera von Apple befinden sich noch in der Phase von Gerüchten und Vorbereitungen der Lieferkette, mehrere Medien erwarten, dass der Veröffentlichungszeitpunkt möglicherweise auf 2027 verschoben wird.

Derzeit lassen sich KI-Kopfhörer grob in drei Kategorien einteilen.

Die erste Kategorie ist die smartphone-kooperative Variante. Der Kopfhörer ist für die Tonaufnahme, die Wiedergabe von Ergebnissen und das Auslösen von Befehlen verantwortlich, komplexe Berechnungen wie Spracherkennung, Echtzeitübersetzung und offene Fragenbeantwortung werden vom Smartphone oder der Cloud erledigt. Die Echtzeitübersetzung von AirPods Pro 3 ist ein typisches Beispiel, diese Funktion erfordert die Verbindung mit einem iPhone, das mit Apple Intelligence kompatibel ist. Ihr Vorteil ist, dass die Hardwareänderungen am Kopfhörer begrenzt sind und die Funktionen mit dem Smartphone-System aktualisiert werden können; die Einschränkung besteht darin, dass der Kopfhörer ohne Smartphone kaum über unabhängige KI-Fähigkeiten verfügt.

Die zweite Kategorie ist die seiten-seitig erweiterte Variante. Aufgaben mit niedriger Latenz wie Spracherkennung, Schlüsselwortaktivierung, Echounterdrückung, Anrufrauschunterdrückung, Sprachtrennung und Umgebungserkennung werden auf der Kopfhörerseite ausgeführt, komplexe Erkennung und Fragenbeantwortung durch große Modelle werden weiterhin an das Smartphone oder die Cloud übergeben. „KI-freihändige Gesprächsführung“ bei Samsung Galaxy Buds3 Pro und Huawei FreeBuds Pro 5 gehört zu dieser Richtung. Ob der Kopfhörer in lauter Umgebung stabil Ton aufnehmen und den Transparenzmodus rechtzeitig umschalten kann, hängt von den seiten-seitigen Algorithmen und dem Hauptsteuerungschip ab, nicht nur von der Fähigkeit des Cloud-Modells.

Die dritte Kategorie sind aufgabenorientierte KI-Endgeräte. Sie gestalten die Hard- und Softwareaufteilung von Kopfhörern rund um Aufnahme, Umschreibung, Übersetzung und Sitzungsprotokolle neu, erfordern eine längere Überwachungszeit, größere Datenpuffer und stabilere Verbindungen. Kopfhörer, Smartphones und Cloud bilden dadurch ein verteiltes Rechensystem: Aktivierung und Rauschunterdrückung werden in Echtzeit direkt am Ohr erledigt, die Umschreibung kann auf dem Kopfhörer oder Smartphone ausgeführt werden, Übersetzung, Zusammenfassung und offene Fragenbeantwortung hängen stärker von der Cloud ab.

Sobald Rechenaufgaben auf die Kopfhörerseite verlagert werden, verwandelt sich das Problem von „dem Hinzufügen einer Softwarefunktion“ in ein Systemprojekt für Hauptsteuerung, Arbeitsspeicher, Speicher und Energieverwaltung. Mit einem Gewicht von wenigen Gramm und einer Batteriekapazität von mehreren Dutzend Milliamperestunden müssen gleichzeitig Bluetooth-Verbindung, Audiowiedergabe, aktive Geräuschunterdrückung, Sensorerfassung und neuronale Netzinferenz aufrechterhalten werden, Chips sind zu einem Problem geworden, das die gesamte Industriekette beantworten muss.

Bei KI-Kopfhörern gehen Chips voran 

Der Wettbewerb um KI-Kopfhörer beginnt nicht zuerst bei großen Modellen, sondern bei den Hauptsteuerungschips.

Der Hauptsteuerungs-SoC herkömmlicher Bluetooth-Kopfhörer ist hauptsächlich für Bluetooth-Verbindung, Audiocodecs, aktive Geräuschunterdrückung, Mikrofonerfassung, Berührungsinteraktion und Niedrigenergieverwaltung verantwortlich. Nach dem Hinzufügen von KI-Fähigkeiten muss der Chip auch Spracherkennung, Schlüsselwortaktivierung, Sprachtrennung, Umgebungserkennung und Teile der neuronalen Netzinferenz übernehmen. Daher gibt es normalerweise zwei Richtungen für die Hauptsteuerungschips von KI-Kopfhörern: Die eine besteht darin, einen NPU oder eine KI-Beschleunigungseinheit in den herkömmlichen Audio-SoC einzufügen; die andere besteht darin, einen unabhängigen KI-Audiochip hinzuzufügen, der mit dem ursprünglichen Bluetooth-Hauptsteuerungschip zusammenarbeitet.

Hengxuan BES2800 ist eines der repräsentativsten Modelle unter den aktuellen Hauptsteuerungschips für KI-Kopfhörer. Als die Samsung Galaxy Buds3-Serie zuvor veröffentlicht wurde, bestätigte Hengxuan, dass diese Serie erstmals mit BES2800 ausgestattet ist. Dieser Chip wird im 6-nm-FinFET-Verfahren hergestellt, integriert Mehrkern-CPU, GPU, NPU, RAM, Niedrigenergie-WLAN und Dualmodus-Bluetooth und ist kein reiner Bluetooth-Audiochip mehr. Im Vergleich zur Vorgängerversion BES2700 ist die CPU-Leistung von BES2800 etwa doppelt so hoch, die NPU-Leistung ist bis zu viermal höher. Funktionen wie die von Samsung Galaxy Buds3 Pro unterstützte Echtzeitübersetzung mit Galaxy AI erfordern immer noch die Beteiligung von Galaxy-Smartphones, aber die Mikrofonerfassung, Rauschunterdrückung, Spracherkennung und Audioübertragung auf der Kopfhörerseite müssen vom Hauptsteuerungschip erledigt werden.

Qualcomm hat KI, WLAN und High-End-Audio zusammengeführt und die Snapdragon S7 und S7 Pro Sound Platform auf den Markt gebracht. Die Xiaomi Buds 5 Pro Wi-Fi-Version verwendet die Qualcomm S7-Serie Audio-Plattform, die S7-Plattform integriert Mehrkern-DSP, Sensorzentrum, Mikroenergie-KI-Engine und Bluetooth-Verbindungsfähigkeit, die S7 Pro fügt zusätzlich Mikroenergie-WLAN und XPAN-Technologie hinzu.

Die Google Pixel Buds Pro 2 verwenden den von Google selbst entwickelten Tensor A1-Chip. Tensor A1 ist ein kundenspezifischer Chip, der speziell für die Audiobearbeitung von Kopfhörern entwickelt wurde und Umgebungsgeräusche mit einer Frequenz von etwa 3 Millionen Mal pro Sekunde verarbeiten kann, um aktive Geräuschunterdrückung und Sprachverbesserung zu realisieren. Die Pixel Buds Pro 2 sind auch das erste Kopfhörerprodukt von Google, das rund um Gemini entwickelt wurde. Die 2025 vorgestellten Pixel Buds 2a verwenden ebenfalls Tensor A1 und brachten erstmals aktive Geräuschunterdrückung in die Pixel A-Serie von Kopfhörern.

Wuhan WQ7036AX ist ein Hochleistungs- und Niedrigenergie-Bluetooth-Audio-SoC, das von Wuhan Microelectronics entwickelt wurde und hauptsächlich als Audiosteuerung für intelligente Audio-Brillen und High-End-Drahtlosaudiogeräte positioniert ist. Es verwendet eine Dualkernarchitektur aus „RISC-V + Hochleistungs-DSP“. Demontageberichte der ersten Generation von Huawei FreeClip zeigen, dass dieser Kopfhörer den Audiosteuerungschip Wuhan WQ7036AX verwendet. Die Demontage des iFlytek KI-Übersetzungskopfhörers zeigt ebenfalls, dass er die Hauptsteuerung derselben Serie verwendet, die für drahtlose Verbindung, Audiodatenverarbeitung, komplexe Audioalgorithmen, KI-Rauschunterdrückung und Mehrmikrofon-ENC zuständig ist.

Der Thus A1, der von Anke und Zhicun Technology über drei Jahre gemeinsam entwickelt wurde, wird von beiden Seiten als erster neuronaler Netzwerk-Speicher-Rechen-integrierter KI-Audiochip bezeichnet. Nach den veröffentlichten Angaben beträgt die gesamte Rechenleistung herkömmlicher Bluetooth-Audiochips etwa 30M FLOPS, Thus A1 erreicht 5G FLOPS, die theoretische Rechenleistung steigt um etwa das 150-fache; gleichzeitig erhöht der Chip den Stromverbrauch nicht merklich.

Speicher ist eine weitere Hürde für KI-Kopfhörer

Die nächste Hürde für KI-Kopfhörer betrifft nicht nur den Hauptsteuerungschip, sondern auch den Speicher. Schließlich ist jeder gewöhnliche TWS-Kopfhörer mit einem 32M- oder 64M-NOR-Flash-Chip ausgestattet, während am Beispiel des Doubao KI-Kopfhörers in der Preisklasse von 1000 Yuan jeder einzelne Kopfhörer mit 2 Stück und ein Paar mit 4 Stück großkapazitärem 128M-NOR-Flash ausgestattet ist, der durch KI-Kopfhörer erzielte ASP-Anstieg kann das 3- bis 5-fache erreichen.

Aus Sicht der Produktlinien von Speicherunternehmen gibt es vier Hauptrichtungen für die Speicheraktualisierung von KI-Kopfhörern.

Erstens: Die Kapazität steigt weiter an. NOR Flash wird von 32Mbit, 64Mbit auf 128Mbit, 256Mbit und 512Mbit erweitert, SPI NAND übernimmt die Speicherung von größeren Daten wie Aufnahmen, Sitzungsdateien und Sprachpuffern.

Zweitens: Der Abstand zwischen Speicher und Hauptsteuerung wird verringert. Modellinferenz ist empfindlicher gegenüber Bandbreite und Latenz, On-Chip-SRAM, externes PSRAM und hochintegriertes ePOP können den Datentransport reduzieren und die Verarbeitungseffizienz auf der Geräteseite verbessern.

Drittens: Die Gehäuseentwicklung geht in Richtung Miniaturisierung. BGA, WLCSP, KGD, ultradünne Gehäuse und Multi-Chip-Packaging werden zu wichtigen Richtungen für Kopfhörer und andere tragbare Endgeräte. Bei Speichern zählt nicht nur die Kapazität, sie müssen auch die Anforderungen der Kopfhörerplatine an Dicke, Fläche und Wärmeabfuhr erfüllen.

Viertens: Die Bedeutung von Niedrigenergieverbrauch und Datensicherheit steigt. KI-Modelle müssen langfristig resident bleiben, Aufnahmedaten betreffen auch die Privatsphäre, Speicher müssen sowohl den Standby- und Lese-Schreib-Stromverbrauch senken als auch sicheren Start, Firmware-Schutz, Datenverschlüsselung und zuverlässige OTA-Aktualisierung unterstützen.

Die Produktlayout von Speicherherstellern ändert sich entsprechend. Die P25Q-Serie von Puyuan deckt Niederspannungs-NOR-Flash ab, die Kapazität von P25Q128SN beträgt 128Mbit, die Betriebsspannung liegt bei 1,1—2,0V; das Unternehmen listet KI-Kopfhörer, KI-Brillen und AR/VR als Schlüsselrichtungen für Unterhaltungselektronik auf und gab bekannt, dass die entsprechenden NOR-Produkte bereits in Massenauslieferung gegangen sind. Hengshuo Semiconductor hat 256Mbit NOR auf den Markt gebracht und treibt die 512Mbit-Produkte voran, deren Anwendungsbereiche intelligente Wearables und IoT-Endgeräte abdecken. Die XM25Q-Serie von Wuhan Xinxin deckt 16—256Mbit ab und richtet sich an tragbare Geräte, die mehr Platz für Firmware und Algorithmen benötigen.

Wenn Modellgewichte und Audiopuffer höhere Bandbreiten erfordern, wird PSRAM zu einer weiteren Richtung. Unigroup Guoxin Micro hat 2025 32Mbit-, 64Mbit- und 128Mbit-PSRAM-Produkte auf den Markt gebracht, die mit dem Xccela-kompatibel sind, im ultradünnen BGA24L-Gehäuse ausgeführt werden und das KGD-Format unterstützen. APS6404L von AP Memory bietet 64Mbit QSPI PSRAM, Winbond bietet ebenfalls PSRAM und HyperRAM für Niedrigenergie-Endgeräte an. Der Vorteil von PSRAM liegt in der hohen Lese-Schreib-Geschwindigkeit und dem hohen Effizienz des zufälligen Zugriffs, was sich für Laufzeitpuffer eignet, aber es erfordert zusätzliches Gehäuse und Stromversorgung, Designer müssen zwischen Bandbreite, Standby-Stromverbrauch und Platinenfläche abwägen.

Die Richtung von B