Lãnh đạo tư tưởng

Trẻ Em AI Tiền body ChatGPT – Giờ Đánh Bại Google Trong Nhận Dạng Giọng Nói Trẻ Em

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Thị trường ứng dụng học ngôn ngữ cho trẻ em đang trở nên đông đúc và ngày càng được kiểm tra kỹ lưỡng. Tuần trước, tổ chức phi lợi nhuận Common Sense Media ra mắt Viện An toàn Trẻ em AI, một phòng thí nghiệm độc lập đầu tiên được hỗ trợ bởi 20 triệu USD mỗi năm để kiểm tra các sản phẩm AI cho trẻ em – áp lực này đang đến vào thời điểm AI đã chiếm 33,5% doanh thu trên các sản phẩm học ngôn ngữ kỹ thuật số.

Đồng thời, phân khúc trẻ em trong thị trường này dự kiến sẽ tăng vọt từ 2,38 tỷ USD vào năm 2026 lên 5,17 tỷ USD vào năm 2035. Rõ ràng, tiền đang di chuyển song song với tích hợp AI – nhưng cũng như sự giám sát.

Nghiên cứu từ Viện AI của Đại học Colorado đã ghi lại khoảng cách một cách rõ ràng: độ chính xác nhận dạng giọng nói thấp hơn đáng kể đối với trẻ em so với người lớn vì hầu hết các hệ thống thương mại được đào tạo trên âm thanh sạch từ người nói lớn tuổi – thường đọc từ kịch bản.

Một bài báo năm 2024 củng cố lý do tại sao: giọng nói của trẻ em liên quan đến những thay đổi nhanh chóng, khó dự đoán trong âm cao, phát âm và phát triển từ vựng khiến các mô hình được đào tạo cho người lớn gặp khó khăn.

Và, trên thực tế, điều này có nghĩa là một đứa trẻ sáu tuổi học tiếng Anh sẽ nhận được một hệ thống nghe sai, không phản hồi hoặc thậm chí phản hồi sai. Đứa trẻ mất hứng thú với việc học; phụ huynh mất tiền.

Đây là vấn đề mà Ivan Crewkov bắt đầu giải quyết vào năm 2018, bốn năm trước khi các mô hình ngôn ngữ lớn trở thành một chủ đề nóng.

Điểm Khởi Đầu Quen Thuộc

Sự tham gia của Crewkov vào không gian edtech là cá nhân. Khi gia đình anh chuyển từ Siberia đến California vào năm 2014, con gái của anh, Sofia, bốn tuổi và đang gặp khó khăn khi học tiếng Anh tại trường mẫu giáo. Anh đã thử mọi công cụ có sẵn và tìm thấy những khoảng trống giống nhau trên tất cả chúng.

“Chúng thường liên quan đến việc đọc, điều mà cô ấy chưa thể làm được, chúng cảm thấy quá giống như công việc và chúng không cung cấp thực hành nói – điều quan trọng đối với trẻ em học một ngôn ngữ mới,” anh nói với Unite AI.

Sau đó, anh chuyển sang các gia sư trực tuyến, bắt đầu ghi lại các phiên và nhận thấy điều gì đó anh không ngờ đến. “Giáo viên đang đọc từ màn hình của họ,” anh nói, và nhiều người trong số họ không phải là giáo viên được chứng nhận; mỗi phiên cost 15 đến 20 đô la.

Đến từ một nền tảng AI, đọc của Crewkov về tình huống là thẳng thắn: “Rõ ràng với tôi rằng có lẽ 80% công việc này có thể được thực hiện bằng một nhân vật AI ảo và nhận dạng giọng nói. Điều này cũng sẽ dân chủ hóa thị trường một cách đáng kể vì nó cực kỳ tốn kém,”

“Ý tưởng là cung cấp một tháng học tập với chi phí của một phiên học,” anh thêm. Ý tưởng đó trở thành Buddy.ai.

Gần 10,8 triệu trẻ em – 32% tất cả trẻ em dưới chín tuổi ở Mỹ – là những người học ngôn ngữ kép (DLLs), với ít nhất một phụ huynh nói một ngôn ngữ khác ngoài tiếng Anh tại nhà, theo Migration Policy Institute. Kể từ năm 2000, thực tế, dân số này đã tăng 24%, và DLLs hiện chiếm hơn 20% dân số trẻ em ở 24 tiểu bang và Washington D.C.

Đây có lẽ là những gia đình có khả năng tìm kiếm những gì các nền tảng như Buddy.ai cung cấp – và ít có khả năng tiếp cận các chương trình giáo dục sớm chất lượng cao, với 43% sống trong các hộ gia đình thu nhập thấp so với 33% trẻ em không phải DLL.

Logic thương mại, thì, là rõ ràng. Câu hỏi khó hơn là liệu công nghệ thực sự mang lại hiệu quả – và ở đây, phương pháp của Buddy.ai khác biệt đáng kể so với hầu hết các đối thủ.

Được Xây Dựng Cho Mục Đích, Không Phải Là Cải Tiến

Sự khác biệt mà Crewkov nêu giữa xây dựng cho trẻ em và cải tiến cho chúng là kiến trúc, không phải là thẩm mỹ. “Xây dựng AI từ đầu cho trẻ em có nghĩa là chúng tôi hạn chế và tái kiến trúc mọi lớp của ngăn xếp xung quanh giọng nói của trẻ em, hành vi, quy định và khoảng chú ý – thay vì cố gắng ‘kid-mode’ một rô-bốt trò chuyện cho người lớn.”

Vấn đề cốt lõi là âm thanh. “Các ngăn xếp LLM của người lớn giả định văn bản và giọng nói của người lớn: câu dài ngữ pháp, phát âm ổn định và môi trường yên tĩnh. Một đứa trẻ sáu tuổi cho bạn điều ngược lại: phát biểu không đầy đủ, phát âm sai, la hét, giọng mạnh và tiếng ồn nền.”

Nhận dạng giọng nói của Buddy đã được đào tạo và liên tục đào tạo lại trên hàng chục nghìn giờ giọng nói thực của trẻ em trên các độ tuổi, giọng và môi trường ồn ào. Startup này tuyên bố rằng nó hiện vượt trội so với nhận dạng giọng nói chung của Google trên giọng nói của trẻ em, điều này mang lại tính hợp lý hơn nó có thể ban đầu: đào tạo cụ thể trên dân số mục tiêu nhất quán vượt trội so với đào tạo trên dữ liệu người lớn.

Lớp hội thoại cũng được xây dựng cho mục đích. Mỗi phiên hoạt động bên trong những gì Crekov mô tả là một “lớp quản lý” – một hệ thống nhận thức về chương trình đào tạo với kế hoạch phiên, chủ đề và theo dõi mục tiêu. Mô hình ngôn ngữ hoạt động như một thành phần trong cấu trúc đó, không phải là sản phẩm chính.

Nếu một đứa trẻ đi chệch hướng, hệ thống sẽ chuyển hướng; không có sự trôi dạt không giới hạn vào bất cứ điều gì mà một LLM chung chung có thể tạo ra. “Có một kế hoạch phiên, chủ đề được phép, theo dõi mục tiêu và mã chuyển hướng, chuyển hướng hoặc kết thúc cuộc trò chuyện khi cần – vì vậy một đứa trẻ sáu tuổi không bao giờ chỉ rơi vào trò chuyện internet không giới hạn.”

Riêng tư, quá, được coi là một hạn chế kiến trúc cũng như một chính sách – nhưng nó cũng im lặng trở thành một cạnh tranh. Bởi vì Quy tắc Bảo vệ Trẻ em Trực tuyến (COPPA) cấm thu thập dữ liệu giọng nói của trẻ em mà không có sự đồng ý của phụ huynh, tập dữ liệu công khai lớn nhất về giọng nói của trẻ em chỉ bao gồm vài trăm giờ.

Buddy.ai đã tích lũy được hàng chục nghìn giờ giọng nói thực của trẻ em trên các độ tuổi, giọng và điều kiện ồn ào. Hầu hết đã chọn con đường dễ dàng hơn bằng cách cải tiến LLM của người lớn cho trẻ em thay vì xây dựng từ đầu, nhưng lối tắt này hiện là một trách nhiệm.

Trong trường hợp của Buddy, tất cả các can thiệp đều chạy trên cơ sở hạ tầng của nền tảng, giọng nói của trẻ em được xử lý theo thời gian thực và bị loại bỏ trước khi phụ huynh thậm chí nghĩ về nó, và không có cuộc trò chuyện nào được định tuyến qua các API AI thương mại, theo Crewkov.

“Chúng tôi rất rõ ràng với phụ huynh về những gì chúng tôi thu thập, tại sao và làm thế nào họ có thể xóa nó – minh bạch là quan trọng như công nghệ chính nó,” Crewkov nhấn mạnh.

Kể từ khi ra mắt ChitChat, bản cập nhật chính mới nhất trên thị trường Mỹ giới thiệu cuộc trò chuyện tự do tiên tiến hơn, công ty báo cáo rằng học sinh Mỹ đã hoàn thành 7,7 lần nhiều bài tập hơn trong cùng một khoảng thời gian so với năm trước.

Toàn cầu, số bài tập trung bình được hoàn thành mỗi tháng đã tăng 3,5 lần hàng năm.

Crewkov là người thẳng thắn về những hạn chế của những con số này. “Thiết kế các nghiên cứu để có thể đo lường học tập của học sinh một cách định lượng là điều chúng tôi hy vọng sẽ làm trong tương lai gần,” anh nói. Tuy nhiên, hiện tại, cơ sở bằng chứng dựa trên phản hồi của người dùng, dữ liệu tương tác sản phẩm và công nhận giải thưởng ngành.

Trường Hợp Sử Dụng Không Ai Dự Định

Có lẽ khoảnh khắc thú vị nhất trong câu chuyện của Buddy.ai là khoảnh khắc mà không được mời: mà không có bất kỳ tiếp thị nhắm mục tiêu nào, phụ huynh của trẻ em tự kỷ và chậm nói bắt đầu xuất hiện trong dữ liệu khảo sát như những người dùng tham gia nhất của nền tảng.

“Chúng tôi ban đầu khá ngạc nhiên. Điều đó chắc chắn nhấn mạnh rằng có những cách khác mà Buddy có thể phục vụ các sinh viên trên toàn thế giới,” Crewkov nhớ lại.

Đối với người sáng lập, đó không chỉ là một dị thường thú vị – nó chỉ ra một khoảng trống mà sản phẩm không được thiết kế để lấp đầy nhưng rõ ràng có thể. Công ty đã phản ứng bằng cách xây dựng một khóa học Phân tích Hành vi Ứng dụng (ABA) chuyên dụng.

Khoảng trống là rộng, và được ghi lại, quá. Một báo cáo thị trường năm 2025 cho thấy tỷ lệ tự kỷ ở Mỹ là 1 trong 31 trẻ em ngày nay, tăng từ 1 trong 150 vào năm 2000 – trong bối cảnh liên tục về sự thiếu hụt nhà trị liệu. Đối với các gia đình không có bảo hiểm đầy đủ, chi phí trị liệu ABA hàng năm có thể đạt 250.000 đô la.

Nghiên cứu của Viện Y tế Quốc gia (NIH) về lý do tại sao các gia đình không nhận được ABA cho thấy các rào cản là thực tế đáng chú ý: lý do phổ biến nhất được trích dẫn bao gồm thời gian chờ đợi dài (34%), thiếu nhà cung cấp ABA trong khu vực (10%) và bảo hiểm không bao gồm liệu pháp (10%). Dữ liệu khảo sát cũng cho thấy rằng hơn một nửa tất cả các quận của Mỹ không có nhà phân tích hành vi được chứng nhận.

Liệu một nhân vật AI có thể cấu thành một can thiệp có ý nghĩa ở mức lâm sàng vẫn còn là một câu hỏi mở – nhưng như một công cụ thực hành nhất quán, thấp, theo yêu cầu cho trẻ em trên danh sách chờ đợi, giá trị của nó dễ bảo vệ hơn.

“Điều này vẫn còn là một công việc đang tiến hành, nhưng chúng tôi thực sự tự hào về nơi mà sáng kiến này đang đi,” Crewkov nói.

Câu Hỏi Lớn Hơn

Thị trường edtech rộng lớn hơn hiện đang đầy rẫy các công ty đưa ra các tuyên bố liền kề; AI được xây dựng cho mục đích, kiến trúc mạnh mẽ; sản phẩm thực sự mang lại học tập. Trên thực tế, thị trường AI trong giáo dục toàn cầu được ước tính sẽ đạt 32,27 tỷ đô la vào năm 2030, và mọi người chơi lớn đều có một chiến lược cho trẻ em.

Điều phân biệt vị trí của Buddy.ai là không phải là các tuyên bố chính nó, mà là thời gian biểu. Crewkov bắt đầu làm việc về nhận dạng giọng nói của trẻ em từ lâu trước khi làn sóng đầu tư hiện tại làm cho nó trở nên thời trang, và trước khi các LLM làm cho nó dễ dàng xây dựng một gia sư ngôn ngữ nghe có vẻ thuyết phục trong một buổi chiều.

Cơ sở hạ tầng kỹ thuật – các mô hình âm thanh được đào tạo trên giọng nói của trẻ em, kiến trúc nhận thức về chương trình đào tạo, hệ thống hình đại diện độc quyền – phản ánh gần một thập kỷ lặp lại về vấn đề cụ thể, không phải là một bước ngoặt nhanh chóng hướng tới một thị trường nóng.

“Trong hai năm, Buddy sẽ có thể cung cấp cho người học tiếng Anh thực hành họ cần để tiến bộ từ những từ tiếng Anh đầu tiên đến trình độ thông thạo. Chúng tôi không vội vàng, vì chúng tôi ưu tiên an toàn và riêng tư,” Crewkov giải thích.

Và dưới tất cả là một triết lý thiết kế đi ngược lại với hầu hết suy nghĩ về sản phẩm AI. “Trẻ em sáu tuổi không quay lại vì AI. Họ quay lại vì một nhân vật và một thế giới họ cảm thấy mình là một phần của nó.”

Điều đó là một điều khó khăn hơn để sao chép hơn là một rô-bốt trò chuyện với một cái tên thân thiện. Và, hiện tại, đây là lợi thế dễ bảo vệ nhất của Buddy.ai.

Salomé là một nhà báo sinh tại Medellín và là Senior Reporter tại Espacio Media Incubator. Với nền tảng về Lịch sử và Chính trị, công việc của Salomé nhấn mạnh sự liên quan xã hội của các công nghệ mới nổi. Cô đã được giới thiệu trên Al Jazeera, Latin America Reports, và The Sociable, cùng với một số khác