思想领袖
儿童人工智能平台Buddy.ai:在孩子们的语音识别中超越谷歌

儿童语言学习应用市场日益拥挤,受到越来越多的审查。上周,非营利组织Common Sense Media 推出了 青年人工智能安全研究所,这是一个首屈一指的独立实验室,每年获得2000万美元的资金,用于测试儿童人工智能产品的安全性——这种压力正好在人工智能已经占据了 33.5% 数字语言学习产品收入的同时到来。
同时,仅在这个领域内,儿童市场预计将从2026年的23.8亿美元增长到2035年的51.7亿美元。很明显,资金的流动与人工智能的整合是并行的——但监管也在增加。
研究 表明,儿童的语音识别准确率远低于成人,因为大多数商用系统都是在成人清晰音频的基础上训练的——通常是成年人在读剧本。
2024年的 论文 强调了儿童语音的快速、不可预测的变化,使得成人训练模型难以应对。
在实践中,这意味着一个六岁的儿童在学习英语时,系统可能会误听他们,无法响应,或者更糟糕的是——完全不响应。儿童失去了学习的兴趣;父母也损失了金钱。
这是Ivan Crewkov在2018年开始解决的问题,比大型语言模型成为主流话题的时间还要早四年。
熟悉的起点
Crewkov进入教育技术领域的起点是个人原因。2014年,他的家从西伯利亚搬到加利福尼亚,他的女儿Sofia四岁,正在幼儿园努力学习英语。他尝试了所有可用的工具,发现它们都存在相同的缺陷。
“它们通常涉及阅读,而她还不能读;它们感觉太像工作,并且没有提供口语练习——对于学习新语言的儿童来说,这是至关重要的,”他告诉Unite.AI。
他随后转向在线导师,开始录制课程,并注意到了一件他没有预料到的事情。“导师们几乎都是在读屏幕,”他说,并且很多导师并不是认证的教育者;每节课的费用在15美元到20美元之间。
作为人工智能背景的他,很清楚地认识到这种情况:“很明显,大约80%的工作可以使用虚拟的、会说话的人工智能角色和语音识别来完成。这也将极大地民主化市场,因为它非常昂贵,”
“想法是提供一个月的学习,相当于一节导师课的费用,”他补充说。这个想法变成了 Buddy.ai。
几乎有1080万年幼儿童——美国九岁以下儿童的32%——是双语学习者(DLLs),至少有一位父母在家说一种非英语语言,如 移民政策研究所 所述。事实上,自2000年以来,这个人群已经增长了24%,双语学习者现在占年轻儿童人口的20%以上,分布在24个州和华盛顿特区。
这些家庭可能是最有可能寻找Buddy.ai等平台的家庭——同时也是最不可能拥有高质量早期儿童教育项目的家庭, 43% 的双语学习儿童生活在低收入家庭中,相比非双语学习儿童的33%。
商业逻辑很明显。更难的问题是技术是否真正有效——而这里,Buddy.ai的方法与大多数竞争对手有着显著的不同。
专门为儿童设计,而非改造
Crewkov在为儿童构建人工智能和为成人构建人工智能之间的区别是架构上的,而不是表面上的。“为儿童构建人工智能意味着我们要在每一层上都围绕儿童的语音、行为、调节和注意力构建——而不是试图将成人聊天机器人改造成‘儿童模式’。”
核心问题是声学问题。“成人大语言模型栈假设成人文本和语音:长的语法句子,稳定的发音,安静的环境。六岁的儿童则给你相反的东西:片段化的语句,发音不正确,大声喊叫,强烈的口音和背景噪音。”
Buddy的语音识别器已经在成千上万小时的真实儿童语音中训练和不断重新训练,涵盖了不同年龄、口音和嘈杂的家庭环境。该公司声称它现在在儿童语音识别方面已经超越了谷歌的通用语音识别,这比初看起来更有可信度:专门针对目标人群的训练始终优于针对成人数据的训练。
对话层也是专门为儿童设计的。每次会话都在一个“管理层”中进行,这是一个课程感知系统,具有会话计划、定义主题和目标跟踪。语言模型在这个结构中运行,而不是产品本身。
如果儿童偏离了轨道,系统会将其重定向;没有开放式的漂移进入一般目的语言模型可能产生的任何内容。 “有一个会话计划,允许的主题,目标跟踪,并且有代码来引导、重定向或在需要时结束对话——所以六岁的儿童永远不会只是无限制地进入开放式互联网聊天。”
隐私也是一个架构约束和政策——但它也已经悄悄地成为一个竞争优势。由于《儿童在线隐私保护法案》(COPPA)禁止在未经父母同意的情况下收集儿童语音数据,因此最大的公开儿童语音数据集仅包含几百个小时的数据。
Buddy.ai已经积累了成千上万小时的真实儿童语音数据,涵盖了不同年龄、口音和嘈杂的家庭环境。大多数公司选择了更简单的方法,将成人语言模型改造为儿童用,但这种捷径现在已经成为一种负担。
在Buddy.ai的情况下,所有干扰都在平台自己的基础设施上运行,儿童语音在实时处理,并在父母甚至考虑删除之前就被丢弃,而且不会通过商业人工智能API路由对话,如Crewkov所说。
“我们非常明确地告诉父母我们收集什么,为什么收集,以及如何删除——透明度与技术本身一样重要,”Crewkov强调。
自从在美国市场推出ChitChat——其最新的主要更新,引入了更先进的自由流畅对话——以来,公司报告称美国学生在同一时间内完成了7.7倍的练习。
在全球范围内,每月完成的练习数量已增长3.5倍。
Crewkov坦率地承认这些数字的局限性。“设计研究以量化衡量学生学习是我们希望在不久的将来做的事情,”他说。然而,目前,证据基础依赖于用户反馈、产品参与数据和行业奖项。
无人预料的用例
也许Buddy.ai故事中最有启发性的时刻是那次意外的到来:在没有任何有针对性的营销的情况下,患有自闭症和语音延迟的儿童的父母开始出现在调查数据中,成为该平台最活跃的用户之一。
“我们最初非常惊讶。它绝对凸显了Buddy.ai可以以其他方式为全球学生服务,”Crewkov回忆说。
对于创始人来说,这不仅仅是一个有趣的异常——它指出了产品没有设计来填补的缺口,但显然可以填补。公司通过构建一个专门的应用行为分析(ABA)课程做出了回应。
这个缺口很宽,也很有据可查。2025年的一份 市场报告 发现,美国的自闭症发病率高达每31个儿童中就有1个,相比2000年的每150个儿童中就有1个——在持久的背景下,认证治疗师短缺。对于没有充分保险覆盖的家庭,年度ABA治疗费用可以 达到 25万美元。
国家卫生研究院(NIH) 研究 发现,家庭没有接受ABA的原因包括长时间的等待名单(34%)、地区没有ABA提供者(10%)以及保险不涵盖治疗(10%)。调查数据还显示,超过一半的美国县没有认证的行为分析师。
人工智能角色是否构成一种有意义的临床干预仍然是一个开放的问题——但作为一种一致的、低成本的、按需的练习工具,用于长时间等待名单上的儿童,其价值更容易被辩护。
“这仍然是一个正在进行的工作,但我们真的为这个项目的进展感到自豪,”Crewkov说。
更大的问题
更广泛的教育技术市场现在充满了公司做出相邻的声明;人工智能专门为此而设计,具有强大的架构;真正的学习诱导产品。事实上,全球教育人工智能市场预计将达到 2030年322.7亿美元,每个主要玩家都有针对儿童的策略。
区别于Buddy.ai的声明不是声明本身,而是时间线。Crewkov在当前投资热潮之前很久就开始从事儿童语音识别的工作,并且在大型语言模型使得构建一个令人信服的语言导师变得容易之前就开始了这项工作。
技术基础——在儿童语音上训练的声学模型、课程感知架构、专有头像系统——反映了近十年来对特定问题的迭代,而不是对热门市场的快速转向。
“在两年内,Buddy.ai将能够为英语学习者提供他们需要的练习,以便从第一句话到流利。我们不着急,因为我们优先考虑安全和隐私,”Crewkov解释说。
并且支撑这一切的是一种设计哲学,它违背了大多数人工智能产品思维的惯例。“六岁的儿童不会因为人工智能而回来,他们会因为一个角色和一个他们感觉自己是其中一部分的世界而回来。”
这比一个具有友好名称的聊天机器人更难复制。而现在,Buddy.ai最有防御力的优势就在这里。












