首页文章详情

三家“语音优先”的教育AI公司接连融资,为什么都开始让AI“开口教学”?

多知网2026-10-08 13:24
语音只是目前最自然的一种实现方式,未来也可能出现更好的交互形态。

最近,教育AI领域出现了一个有意思的共同点:越来越多的创业公司,开始强调“voice-first”(语音优先),把“说话”放在AI辅导产品的核心位置。

9月下旬,荷兰阿姆斯特丹AI语言学习公司Eevi完成了一轮由Rockstart领投的Pre-seed融资,具体金额没有披露。它面向国际职场人士,定位是一名“语音优先”的AI语言导师,希望解决语言学习中一个很典型的问题:用户可能已经看懂了大量单词、完成了很多练习,却依然在真正开口时卡住。

Eevi把这种现象称为“Fluency Illusion”,即“流利错觉”——看起来掌握了语言,但并不意味着能够真正使用它。其产品从一开始就让用户和AI进行实时语音对话,而不是让用户不断点击选择题、背单词或者输入文字。

巧合的是,几乎在同一时间,另外两个AI辅导产品也在走类似的路线。

美国的Aristotle亦在今年9月宣布获得500万美元种子轮融资,由True Ventures领投。它面向13—18岁的学生,将自己定义为voice-first AI tutoring platform。正式推出前,Aristotle已经让1000多名学生完成了超过1500小时的一对一AI辅导。

印度AI教育公司YoLearn.ai在今年9月初已获得一笔未披露金额的种子轮融资,本轮融资由印度知名传媒集团ABP集团旗下的教育机构ABP Education领投。它将实时语音对话与互动白板结合,让AI老师不仅能“说”,还能在屏幕上画图、推导题目,目前覆盖印度学生以及JEE、NEET等考试场景,并支持包括Hindi、Hinglish在内的22种语言。

三个产品,一个做语言学习,一个做印度K12辅导,一个做美国青少年教育,却都把“语音优先”摆到了产品设计的前面。

这可能是AI教育正在发生的一次交互变化。

通用大模型或许也有语音,但只是增加了“语音”功能。Eevi、YoLearn、Aristotle这些产品则是从一开始就围绕“语音”交互来设计学习流程。

教育科技行业从业者TCOH向多知分享称:“语音交互是人与人之间最常用且最高效的交互方式,也是在教育场景下,最高频最自然的交互方式。”

真实的教学,本来就不是一问一答的方式。老师会追问,会打断,会根据学生刚才说话的语气判断他到底懂没懂;学生也会通过说话暴露自己的知识漏洞。很多时候,一个人“写得出来”和“说得出来”,根本是两种不同的能力。

语言学习尤其如此。

一个学生可能认识“restaurant”“reservation”“available”这些词,也能够在App里把它们排列成正确句子,但当他真正走进餐厅,需要临时说出“I'd like to make a reservation”时,仍然可能陷入停顿。

这也是Eevi所谓“流利错觉”背后的产品机会。

因此,语音交互真正打开的空间,在于让AI参与到“调用知识”的过程,而不仅停留在知识问答层面。

这正是语音作为教育交互方式最值得关注的地方。

对语言学习来说,语音几乎天然就是目标能力本身:最终用户需要的是听懂别人、组织语言、即时回应。

对数学、科学等学科来说,情况稍有不同。

YoLearn的做法就很典型:AI通过声音和学生交流,同时用互动白板展示公式、图形和推导过程。声音承担实时互动,视觉界面承担知识呈现,语音和视觉由此共同构成AI教学的交互界面。

Aristotle也是类似思路。它将自己定位为AI tutor,重点放在根据学生的理解程度动态调整解释、节奏和支持方式,让语音对话真正服务于一对一教学。

这意味着,voice-first背后真正值得关注的是:AI教育产品正在从“内容产品”走向“交互产品”。

现在的实时语音模型则开始允许AI持续听、持续说,并结合上下文进行多轮交流。对于教育产品来说,这意味着AI第一次越来越接近“一对一陪练”的形态。

这也是为什么早期资本开始愿意为这种产品下注。

不过,值得注意的是,“语音优先”现在仍然更像一个值得验证的产品假设,而不是已经被证明的教育结论。

一项今年9月发表的预印本研究,在波士顿大学Online MBA的一门企业金融课程中进行了随机实验。研究发现,语音模式下,学生的对话密度大约是文字模式的1.8倍,提问次数约为文字模式的2.4倍;学生也更偏好语音。但在这个五周实验中,voice(声音)和text(文本)的周度学习掌握程度在统计上没有显著差异。而且语音的成本大约是文字的 2.8倍。

(数据显示学生更偏好语音交互)

(数据显示语音交互和文本交互对学生成绩影响几乎没有差异)

这个结果其实非常重要。可以看到,语音显著改变了“学生怎么和AI学习”,但目前没有证据证明它显著改变了“学生学到了多少”。

一个会流畅跟你聊天的AI,和一个真正能让你学会东西的AI,中间依然隔着一整套教育学设计。

所以,从这个角度看,Eevi、YoLearn和Aristotle现在真正要验证的,并不是“AI能不能和学生聊天”。这个问题已经基本解决。

它们需要回答的是三个更困难的问题。

第一,语音陪练能不能带来能力提升?

比如Eevi最终不能只告诉用户“你今天说了20分钟”,而需要证明用户的口语流利度、词汇使用、听力理解或者真实场景交流能力确实提高了。

第二,AI能不能在对话过程中真正完成教学?

一个真人老师会判断什么时候应该纠正,什么时候不应该打断;什么时候继续追问,什么时候降低难度。AI如果只是把ChatGPT的文字回答变成声音,本质上仍然只是聊天机器人。

第三,语音是不是教育AI的最终形态?

这可能也是最值得观察的问题。很可能答案并不是“以后所有教育AI都只靠说话”。

未来的教育AI可能越来越像一个多模态的私人老师:用声音交流,用视觉展示,用白板推导,用文字帮助复习,再根据学生的表现动态调整课程。

Eevi、YoLearn和Aristotle的产品已经在往这个方向发展。

在中国,“语音优先”还没有成为教育AI产品普遍强调的标签,但语音已经融入主流AI教学产品的交互体系。无论是学习机中的AI老师,还是豆包爱学的AI老师,都在通过语音、文字、图像等多种方式与学生进行实时互动。

无论如何,语音只是入口,终点仍然是“教学”。

真正值得关注的是:教育AI走向实时教学交互:AI听见学生的回答,理解他的反馈,随时追问、纠正和调整教学节奏。语音只是目前最自然的一种实现方式,未来也可能出现更好的交互形态。

对Eevi、YoLearn和Aristotle而言,现在要验证的是:更自然、更高频的实时互动,能否最终转化为可量化的学习效果。

参考资料:

《When AI Tutors Speak: Evidence from a Randomized Field Experiment》https://arxiv.org/abs/2609.23958?utm_source=chatgpt.com

本文来自微信公众号“多知网”(ID:duozhiwang),作者:王上,36氪经授权发布。