Meta hat ein wahres Wunderwerk der Sprachtranskription vorgestellt: Es erkennt exakt die Mischung aus Chinesisch und Englisch und unterstützt einstündige ausgedehnte Gespräche mit mehr als 20 Teilnehmern.
Bericht von Zhidx.com am 2. September: Heute hat Meta das erste Echtzeit-Audiowahrnehmungsmodell Muse Voice Transcribe vorgestellt, das von Meta Superintelligence Lab entwickelt wurde.
Dieses Modell bietet Echtzeit-Stream-Automatische Spracherkennung (ASR), unterstützt die Sprachsegmentierung für mehr als 20 Sprecher und Endpunktsteuerungsfunktionen, ist mehrsprachig, kann lange Audiodateien von über einer Stunde verarbeiten, ermöglicht nahtlosen Code-Switching und verbessert die Erkennungsgenauigkeit durch Sprach-, Stichwort- und Kontextpräferenzen.
Aus den Beispielen geht hervor, dass die Transkriptionsgeschwindigkeit und das Ergebnis dieses Modells sowohl bei Chinesisch, chinesisch-englischem Akzent als auch bei gemischten chinesisch-englischen Ausdrücken recht gut sind.
Muse Voice Transcribe belegt den ersten Platz in den Benchmark-Tests für Stream-Sprache-zu-Text und öffentliche Sprachsegmentierung von Artificial Analysis. (Die Modellaufnahme und Rangfolge gelten Stand 1. September 2026.)
Dieses Modell kann über die Meta Model API, Meta AI für Mac und Muse Code verwendet werden.
Die API-Preise betragen 3 US-Dollar pro 1000 Minuten (ca. 20 RMB) bzw. 0,18 US-Dollar pro Stunde (ca. 1,21 RMB).
01. Erkennung von langen Audiodateien über eine Stunde, gemischtem Chinesisch und Englisch sowie gleichzeitiger Sprache von mehr als 20 Personen
Muse Voice Transcribe wurde mit über 70 Sprachen trainiert, von denen 25 Sprachen umfassend validiert wurden.
In der ersten Version empfiehlt Meta den Nutzern, die 25 validierten Sprachen auszuprobieren, und bietet gleichzeitig Unterstützung für weitere Sprachen.
In Bezug auf den Sprachwechsel unterstützt Muse Voice Transcribe nativ beliebigen Code-Switching, sowohl innerhalb als auch zwischen Sätzen, und nutzt Kontextinformationen, um die Erkennungsgenauigkeit weiter zu verbessern.
Das Modell unterstützt nativ die Eingabe von langen Audiodateien von über einer Stunde und mehr als 20 Sprechern ohne Nachbearbeitung.
Mit nur einem Klick kann die Sprachdiktierfunktion von Meta AI und Muse Code von Muse Voice Transcribe bereitgestellt werden.
Es kann mit jeder Anwendung zusammenarbeiten und mit Meta AI sowie jedem Fenster auf dem Bildschirm verwendet werden, um verschiedene Aufgaben zu erledigen – halten Sie einfach die Taste „Fn“ gedrückt, um es auszuprobieren.
02. Auf der Grundlage von Stream-Automatischer Spracherkennung, dynamische Anpassung der Latenz zur Berücksichtigung von Geschwindigkeit und Genauigkeit
Muse Voice Transcribe ist ein autoregressives multimodales Modell in der Muse Spark-Serie.
Audio wird in Einheiten von 80 ms (12,5 Hz) verarbeitet, und jedes Audiosegment wird in ein Soft-Token umgewandelt. Für jedes Audiosegment entscheidet das Modell, ob es das nächste Audiosegment weiter abhören oder ein Text-Token ausgeben soll.
Wenn das Modell beschließt, weiter zuzuhören, prognostiziert es das spezielle Token <|next_audio|> und ersetzt <|next_audio|> durch das tatsächliche Audiosegment der nächsten Eingabe.
Wenn der Audiostream stoppt, fügt Meta ein spezielles Token <|empty_audio|> ein, um dem Modell mitzuteilen, dass keine weiteren Audiosegmente mehr vorhanden sind. Nachdem das Modell das Signal <|empty_audio|> erhalten hat, das bedeutet „keine weiteren Audioeingaben mehr“, gibt es direkt alle verbleibenden Text-Token aus, ohne weitere <|next_audio|>-Token zu generieren.
Da das Modell vollständig steuern kann, wann es zuhört, entscheidet es, wie viele Audiokontextinformationen (genannt „Latenz“) es benötigt, bevor es Wörter transkribiert. Es gibt einen Kompromiss zwischen Genauigkeit und Latenz.
Je länger das Modell auf die Vorhersage wartet, desto genauer ist das Transkriptionsergebnis, aber desto höher ist auch die Latenz.
Muse Voice Transcribe verfügt über die Funktion der „adaptiven Latenz“, die die Latenz dynamisch entsprechend der Schwierigkeit jedes Wortes anpasst. Dies wird durch Reinforcement Learning (RL) realisiert, bei dem die Belohnung für die Wortfehlerrate (WER) und die Latenzbelohnung multiplikativ kombiniert werden.
Durch adaptive Latenz erreicht das Modell die Pareto-Grenze im Kompromiss zwischen Geschwindigkeit und Genauigkeit, gemessen an der endgültigen Transkriptionszeit.
03. Auf ASR aufbauende Segmentierungs- und Endpunktfunktionen
Auf der Grundlage von Stream-ASR können weitere Audiowahrnehmungsaufgaben einfach durch die Einführung zusätzlicher spezieller Token unterstützt werden.
Um die Sprechersegmentierung zu realisieren, führt Meta ein Token <|start_of_turn|> ein, um einen potenziellen Sprecherwechsel anzuzeigen, und ein Tag <|speaker_{A-Z}|>, um verschiedene Sprecher zu unterscheiden.
Wenn der Sprecher wechselt, wird <|start_of_turn|> sofort prognostiziert, während die Vorhersage des Sprecher-Tags bis zum Ende des Audioblocks verzögert wird.
Aus demselben Sprecher stammendes Audio kann auf diese Weise auch durch <|start_of_turn|> in mehrere Segmente unterteilt werden, und die Sprecher-Tags dieser unterteilten Segmente sind alle gleich.
Im Folgenden finden Sie ein Beispiel für eine Token-Sequenz der Sprechertrennung (zur Vereinfachung der Demonstration wurde <|next_audio|> weggelassen):
<|start_of_turn|>Hello, how are you doing?<|speaker_A|><|start_of_turn|> Did anything fun over the weekend?<|speaker_A|><|start_of_turn|> Hey I'm good!<|speaker_B|>
Für die Sprach-Endpunkterkennung führt Meta ein Token <|speech_onset|> ein, um den Beginn der Sprache zu markieren, und ein Token <|speech_endpoint|>, um das Ende der Äußerung des Nutzers zu markieren.
Im Folgenden finden Sie ein Beispiel für eine Token-Sequenz der Sprach-Endpunkterkennung (zur Vereinfachung der Demonstration wurde <|next_audio|> weggelassen):
<|speech_onset|>Hey Meta, what's the weather in Menlo Park?<|speech_endpoint|> [silence] <|speech_onset|>What should I wear today?<|speech_endpoint|>
Meta trainiert diese beiden Aufgaben gleichzeitig mit Stream-ASR und fügt zusätzliche Belohnungen für die Sprechertrennung bzw. die Sprach-Endpunkterkennung auf der Grundlage des ASR-Belohnungssignals hinzu.
04. Schlussfolgerung: Spracherkennung entwickelt sich zu einem ständig online befindlichen „Ohr“
In realen Szenarien sind die Kommunikationssituationen der Menschen sehr komplex, z. B. gemischte Mehrsprachigkeit, gelegentliches Unterbrechen durch andere Personen, überlappende Stimmen mehrerer Sprecher usw., sowie mögliche fortlaufende Gespräche über Dutzende von Minuten oder sogar mehrere Stunden. Die Fähigkeiten, die Muse Voice Transcribe dieses Mal vor allem demonstriert, sind sehr hilfreich für die Optimierung der Transkriptionsqualität in diesen realen Szenarien.
Sprachtranskription entwickelt sich von einem eigenständigen „Sprache-zu-Text“-Tool zu einer Echtzeit-Wahrnehmungsschicht von KI-Systemen. Der Kern des Wettbewerbs in der nächsten Phase wird gleichzeitig auf niedriger Latenz, langem Kontext, mehreren Sprechern, Mehrsprachigkeit und Kontextverständnis liegen und schließlich mit der Inferenz, dem Gedächtnis und dem Toolaufruf von großen Modellen verschmelzen. Zu diesem Zeitpunkt ist das „Hören“ nur der Eingang – das System muss auch wissen, wer spricht, wann die Äußerung endet, welche Beziehung diese Äußerung zu den vorherigen hat und was als Nächstes zu tun ist.
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Zhidx.com“ (ID: zhidxcom), Autor: ZeR0, Redakteur: Mo Ying, veröffentlicht mit Genehmigung von 36kr.