Drei "Voice-First"-KI-Unternehmen im Bildungssektor haben nacheinander Finanzierungsrunden abgeschlossen. Warum beginnen alle damit, die KI dazu zu bringen, den Unterricht mit ihrer Stimme durchzuführen?
In letzter Zeit zeigt sich im Bereich der Bildungs-KI ein interessanter gemeinsamer Trend: Immer mehr Startups legen den Schwerpunkt auf „voice-first“ (sprachgesteuert) und stellen das „Sprechen“ in den Mittelpunkt ihrer KI-Nachhilfeprodukte.
Ende September schloss das niederländische KI-Sprachlernunternehmen Eevi mit Sitz in Amsterdam eine Pre-Seed-Finanzierungsrunde unter der Leitung von Rockstart ab, deren genauer Betrag nicht offengelegt wurde. Das Produkt richtet sich an internationale Berufstätige und positioniert sich als „sprachgesteuerter“ KI-Sprachlehrer, der ein typisches Problem beim Sprachenlernen lösen möchte: Nutzer haben möglicherweise bereits eine große Anzahl von Wörtern verstanden und viele Übungen absolviert, geraten aber dennoch ins Stocken, wenn sie tatsächlich sprechen müssen.
Eevi nennt dieses Phänomen „Fluency Illusion“, also „Illusion der Sprachgewandtheit“ – man scheint die Sprache zu beherrschen, was aber nicht bedeutet, dass man sie tatsächlich anwenden kann. Sein Produkt lässt Nutzer von Anfang an in Echtzeit-Sprachdialog mit der KI treten, statt dass Nutzer ständig Multiple-Choice-Aufgaben lösen, Vokabeln lernen oder Text eingeben müssen.
Zufälligerweise verfolgen fast zur gleichen Zeit zwei weitere KI-Nachhilfeprodukte einen ähnlichen Ansatz.
Das US-Unternehmen Aristotle kündigte im September dieses Jahres ebenfalls an, eine Seed-Finanzierung in Höhe von 5 Millionen US-Dollar unter der Leitung von True Ventures erhalten zu haben. Es richtet sich an Schüler im Alter von 13 bis 18 Jahren und definiert sich selbst als voice-first KI-Tutoring-Plattform. Vor der offiziellen Markteinführung hat Aristotle bereits mehr als 1000 Schüler mehr als 1500 Stunden individuelle KI-Nachhilfe absolvieren lassen.
Das indische KI-Bildungsunternehmen YoLearn.ai erhielt Anfang September dieses Jahres eine Seed-Finanzierung in nicht genanntem Betrag, die von der Bildungsinstitution ABP Education unter der bekannten indischen Mediengruppe ABP Group angeführt wurde. Es kombiniert Echtzeit-Sprachdialog mit einem interaktiven Whiteboard, sodass der KI-Lehrer nicht nur „sprechen“, sondern auch auf dem Bildschirm zeichnen und Aufgaben herleiten kann. Derzeit deckt es indische Schüler sowie Prüfungsszenarien wie JEE und NEET ab und unterstützt 22 Sprachen einschließlich Hindi und Hinglish.
Die drei Produkte – eines für Sprachenlernen, eines für indische K12-Nachhilfe und eines für US-amerikanische Jugendbildung – stellen alle das „Voice-First“-Konzept in den Vordergrund ihres Produktdesigns.
Dies könnte eine laufende Interaktionsveränderung im Bereich der KI-Bildung sein.
Allgemeine große Modelle verfügen möglicherweise auch über Sprachfunktionen, fügen diese aber nur als zusätzliche Funktion hinzu. Produkte wie Eevi, YoLearn und Aristotle hingegen gestalten den gesamten Lernprozess von Anfang an um die Sprachinteraktion herum.
Der in der Bildungs-Technologiebranche tätige TCOH teilte der Plattform Duozhi mit: „Sprachinteraktion ist die am häufigsten genutzte und effizienteste Interaktionsform zwischen Menschen und zugleich die häufigste und natürlichste Interaktionsform im Bildungsbereich.“
Echter Unterricht funktioniert von Natur aus nicht nach dem Muster einer einfachen Frage und Antwort. Lehrer stellen Nachfragen, unterbrechen, beurteilen anhand des Tonfalls der Äußerungen der Schüler, ob sie den Inhalt wirklich verstanden haben; Schüler zeigen durch Sprechen auch ihre Wissenslücken auf. Oft sind die Fähigkeit, etwas „schreiben zu können“, und die Fähigkeit, etwas „sprechen zu können“, zwei völlig unterschiedliche Kompetenzen.
Beim Sprachenlernen gilt dies in besonderem Maße.
Ein Schüler kennt möglicherweise Wörter wie „restaurant“, „reservation“ und „available“ und kann sie in einer App zu korrekten Sätzen anordnen, gerät aber dennoch ins Stocken, wenn er tatsächlich ein Restaurant betritt und spontan „I'd like to make a reservation“ aussprechen muss.
Das ist auch die Produktchance hinter der sogenannten „Illusion der Sprachgewandtheit“ von Eevi.
Daher liegt der eigentliche Mehrwert der Sprachinteraktion darin, die KI am Prozess der „Wissensanwendung“ teilhaben zu lassen, statt sich nur auf die Ebene der Wissensabfrage zu beschränken.
Das ist der bemerkenswerteste Aspekt von Sprache als Interaktionsform im Bildungsbereich.
Für das Sprachenlernen ist Sprache fast von Natur aus die angestrebte Fähigkeit selbst: Letztendlich müssen Nutzer andere verstehen, Sätze formulieren und sofort antworten können.
Für Fächer wie Mathematik oder Naturwissenschaften sieht die Situation etwas anders aus.
Der Ansatz von YoLearn ist typisch: Die KI kommuniziert mit Schülern über Sprache und zeigt gleichzeitig Formeln, Grafiken und Herleitungsprozesse auf einem interaktiven Whiteboard an. Die Stimme übernimmt die Echtzeit-Interaktion, die visuelle Oberfläche übernimmt die Wissensdarstellung – gemeinsam bilden Stimme und Bild die Interaktionsschnittstelle des KI-Unterrichts.
Aristotle verfolgt einen ähnlichen Ansatz. Es positioniert sich als KI-Tutor, der den Schwerpunkt darauf legt, Erklärungen, Rhythmus und Unterstützungsmaßnahmen dynamisch an das Verständnisniveau der Schüler anzupassen, sodass der Sprachdialog wirklich dem individuellen Unterricht dient.
Das bedeutet, dass hinter dem Konzept „voice-first“ der eigentlich beachtenswerte Punkt steckt: Bildungs-KI-Produkte entwickeln sich von „Inhaltsprodukten“ zu „Interaktionsprodukten“.
Aktuelle Echtzeit-Sprachmodelle ermöglichen es der KI nun, kontinuierlich zuzuhören, zu sprechen und mehrstufige Gespräche unter Berücksichtigung des Kontexts zu führen. Für Bildungsprodukte bedeutet dies, dass KI zum ersten Mal der Form eines „individuellen Übungspartners“ immer näher kommt.
Das ist auch der Grund, warum frühe Investoren bereit sind, in solche Produkte zu investieren.
Es ist aber zu beachten, dass „Voice-First“ derzeit eher eine zu prüfende Produkthypothese ist als ein bereits nachgewiesenes pädagogisches Konzept.
Eine im September dieses Jahres veröffentlichte Preprint-Studie führte ein randomisiertes Experiment in einem Unternehmensfinanzierungskurs des Online-MBA-Programms der Boston University durch. Die Studie ergab, dass die Dialogdichte der Schüler im Sprachmodell etwa das 1,8-fache des Textmodells und die Anzahl der Fragen etwa das 2,4-fache des Textmodells beträgt; Schüler bevorzugen zudem die Sprachform. In diesem fünfwöchigen Experiment gab es jedoch statistisch keinen signifikanten Unterschied im wöchentlichen Lernerfolgsgrad zwischen der Sprach- und der Textform. Außerdem sind die Kosten für die Sprachinteraktion etwa das 2,8-fache der Textinteraktion.
(Die Daten zeigen, dass Schüler die Sprachinteraktion bevorzugen)
(Die Daten zeigen, dass die Auswirkungen von Sprach- und Textinteraktion auf die Leistungen der Schüler kaum Unterschiede aufweisen)
Dieses Ergebnis ist sehr bedeutsam. Man erkennt, dass Sprache die Art und Weise, „wie Schüler mit KI lernen“, deutlich verändert, es aber bisher keine Belege dafür gibt, dass sie „wie viel Schüler lernen“ signifikant beeinflusst.
Zwischen einer KI, die fließend mit Ihnen chatten kann, und einer KI, die Ihnen tatsächlich Wissen vermitteln kann, liegt noch ein umfassendes pädagogisches Konzept.
Aus dieser Sicht besteht die eigentliche Prüfaufgabe von Eevi, YoLearn und Aristotle nicht darin, „ob KI mit Schülern chatten kann“. Diese Frage ist weitgehend gelöst.
Sie müssen drei schwierigere Fragen beantworten.
Erstens: Kann der sprachliche Übungspartner zu einer Verbesserung der Fähigkeiten führen?
Beispielsweise darf Eevi Nutzern nicht nur mitteilen „Du hast heute 20 Minuten gesprochen“, sondern muss nachweisen, dass sich die mündliche Sprachgewandtheit, die Vokabelanwendung, das Hörverständnis oder die Fähigkeit zur Kommunikation in realen Situationen tatsächlich verbessert haben.
Zweitens: Kann KI den Unterrichtsprozess im Gespräch tatsächlich erfüllen?
Ein menschlicher Lehrer beurteilt, wann er korrigieren, wann er nicht unterbrechen soll; wann er nachfragen und wann er die Schwierigkeit verringern soll. Wenn KI nur die Textantworten von ChatGPT in Sprache umwandelt, ist sie im Grunde immer noch nur ein Chatbot.
Drittens: Ist Sprache die endgültige Form der Bildungs-KI?
Das ist möglicherweise die am meisten zu beobachtende Frage. Es ist sehr wahrscheinlich, dass die Antwort nicht lautet „Alle Bildungs-KI-Systeme der Zukunft funktionieren ausschließlich über Sprache“.
Zukünftige Bildungs-KI wird zunehmend einem multimodalen privaten Lehrer ähneln: Sie kommuniziert über Sprache, stellt Inhalte visuell dar, leitet Zusammenhänge auf dem Whiteboard her, unterstützt das Wiederholen von Inhalten über Text und passt den Kurs dynamisch an die Leistungen der Schüler an.
Die Produkte von Eevi, YoLearn und Aristotle entwickeln sich bereits in diese Richtung.
In China ist „Voice-First“ noch kein allgemein verbreitetes Merkmal, das von Bildungs-KI-Produkten hervorgehoben wird, aber Sprache ist bereits in das Interaktionssystem der gängigen KI-Lehrprodukte integriert. Sowohl die KI-Lehrer in Lernmaschinen als auch die KI-Lehrer von Doubao Aixue interagieren in Echtzeit mit Schülern über verschiedene Wege wie Sprache, Text und Bilder.
Letztendlich ist Sprache nur der Eingang, das Ziel bleibt immer der „Unterricht“.
Der eigentliche beachtenswerte Punkt ist: Bildungs-KI entwickelt sich zu einer Echtzeit-Unterrichtsinteraktion: Die KI hört die Antwort der Schüler, versteht ihr Feedback, stellt jederzeit Nachfragen, korrigiert Fehler und passt den Unterrichtsrhythmus an. Sprache ist derzeit nur die natürlichste Umsetzungsform, in Zukunft können noch bessere Interaktionsformen entstehen.
Für Eevi, YoLearn und Aristotle gilt es derzeit zu prüfen: Ob natürlichere und häufigere Echtzeit-Interaktionen letztendlich zu quantifizierbaren Lernerfolgen führen können.
Quellenangabe:
《When AI Tutors Speak: Evidence from a Randomized Field Experiment》https://arxiv.org/abs/2609.23958?utm_source=chatgpt.com
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Duozhiwang“ (ID: duozhiwang), Autor: Wang Shang, veröffentlicht mit Genehmigung von 36Kr.