ผู้นำทางความคิด

AI สำหรับเด็กที่มีเทคโนโลยีก่อน ChatGPT – ชนะ Google ในการรับรู้เสียงพูดของเด็ก

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ตลาดแอปการเรียนรู้ภาษาสำหรับเด็กกำลังเติบโตและถูกตรวจสอบอย่างเข้มงวด ในสัปดาห์ที่แล้ว องค์กรไม่แสวงหาผลกำไร Common Sense Media เปิดตัว สถาบันความปลอดภัย AI สำหรับเยาวชน ซึ่งเป็นห้องปฏิบัติการอิสระที่ได้รับการสนับสนุนจากเงิน 20 ล้านเหรียญสหรัฐต่อปี เพื่อทดสอบผลิตภัณฑ์ AI สำหรับเด็ก – ความกดดันที่มาถึงในขณะที่ AI คิดเป็น 33.5% ของรายได้จากผลิตภัณฑ์การเรียนรู้ภาษาดิจิทัล

ในเวลาเดียวกัน ส่วนของเด็กภายในตลาดนี้คาดว่าจะ เพิ่มขึ้น จาก 2.38 พันล้านเหรียญสหรัฐในปี 2026 เป็น 5.17 พันล้านเหรียญสหรัฐในปี 2035 เห็นได้ชัดว่าเงินกำลังเคลื่อนไปพร้อมกับการรวม AI – แต่การกำกับดูแลก็เช่นกัน

การวิจัย จากสถาบัน AI ของมหาวิทยาลัยโคโลราโดได้บันทึกช่องว่างอย่างชัดเจน: ความแม่นยำในการรับรู้เสียงพูดมีค่าต่ำกว่าสำหรับเด็กมากกว่าสำหรับผู้ใหญ่ เนื่องจากระบบเชิงพาณิชย์ส่วนใหญ่ถูกฝึกอบรมด้วยเสียงออดิโอจากผู้พูดที่โตแล้ว – ซึ่งมักจะอ่านจากบท

เอกสารในปี 2024 ยืนยัน ว่าทำไม: เสียงของเด็กเกี่ยวข้องกับการเปลี่ยนแปลงที่รวดเร็วและไม่คาดคิดในระดับเสียง การออกเสียง และพัฒนาการคำศัพท์ที่ทำให้โมเดลที่ฝึกอบรมสำหรับผู้ใหญ่ล้มเหลว

และในทางปฏิบัติ สิ่งนี้หมายความว่าเด็กอายุ 6 ขวบที่เรียนรู้ภาษาอังกฤษจะได้รับระบบที่ไม่ได้ยินพวกเขา ล้มเหลวในการตอบสนอง หรือแย่กว่านั้น: ตอบสนองต่อสิ่งที่ไม่ถูกต้องเลย เด็กสูญเสียความสนใจในการเรียนรู้; พ่อแม่สูญเสียเงิน

นี่คือปัญหาที่ Ivan Crewkov เริ่มทำงานในปี 2018 สี่ปีก่อนที่โมเดลภาษาขนาดใหญ่จะกลายเป็นหัวข้อสนทนาหลัก

จุดเริ่มต้นที่คุ้นเคย

การเข้าสู่พื้นที่ edtech ของ Crewkov เป็นส่วนตัว เมื่อครอบครัวของเขา chuyểnจากไซบีเรียไปยังแคลิฟอร์เนียในปี 2014 ลูกสาวของเขา Sofia อายุ 4 ขวบ และกำลังดิ้นรนในการเรียนรู้ภาษาอังกฤษที่โรงเรียนอนุบาล เขาลองใช้เครื่องมือที่มีอยู่ทั้งหมดและพบช่องว่างเดียวกันทั่วทั้งพวกมัน

“มันเกี่ยวข้องกับการอ่าน ซึ่งเธอไม่สามารถทำได้ในขณะนั้น มันรู้สึกเหมือนงานมาก และไม่มีการฝึกพูด – สิ่งสำคัญสำหรับเด็กที่เรียนรู้ภาษาใหม่” เขาบอกกับ Unite AI

จากนั้นเขาหันไปใช้ครูสอนภาษาออนไลน์สด เริ่มบันทึกเซสชัน และสังเกตเห็นสิ่งที่เขาไม่คาดคิด “ครูอ่านจากหน้าจอของพวกเขา” เขากล่าว และหลายคนไม่ใช่ครูผู้เชี่ยวชาญ; แต่ละเซสชันราคา 15 ถึง 20 ดอลลาร์

มาจากพื้นหลัง AI ของ Crewkov การอ่านสถานการณ์นั้นตรงไปตรงมา: “มันชัดเจนสำหรับฉันว่าอาจจะ 80% ของงานนี้สามารถทำได้โดยใช้ตัวละคร AI พูดและรับรู้เสียงพูด นี่จะทำให้ตลาดเป็นประชาธิปไตยมากขึ้นเพราะมันแพงมาก”

“ความคิดคือการให้เดือนแห่งการเรียนรู้ในราคาหนึ่งเซสชันสอนภาษา” เขาเพิ่ม นั่นกลายเป็น Buddy.ai

ใกล้ 10.8 ล้านเด็ก – 32% ของเด็กทั้งหมดในสหรัฐอเมริกาที่มีอายุต่ำกว่า 9 ปี – เป็นเด็กที่เรียนรู้ภาษาหลายภาษา (DLLs) โดยมีพ่อแม่至少หนึ่งคนพูดภาษาอื่นที่บ้าน นอกเหนือจากภาษาอังกฤษ ตาม Migration Policy Institute ตั้งแต่ปี 2000 จริงๆ แล้วประชากรนี้เติบโตขึ้น 24% และ DLLs คิดเป็นมากกว่า 20% ของประชากรเด็กใน 24 รัฐและวอชิงตัน ดี.ซี.

นี่อาจเป็นครอบครัวที่มีแนวโน้มที่จะค้นหาแพลตฟอร์มอย่าง Buddy.ai – และไม่น่าจะมีการเข้าถึงโปรแกรมการเรียนรู้ในช่วงต้นวัยเด็กที่มีคุณภาพสูง โดยมี 43% อาศัยอยู่ในครัวเรือนที่มีรายได้น้อยเมื่อเทียบกับเด็กที่ไม่ใช่ DLL 33%

สร้างขึ้นสำหรับเด็ก ไม่ใช่การปรับเปลี่ยน

ความแตกต่างที่ Crewkov วาดระหว่างการสร้างสำหรับเด็กและการปรับเปลี่ยนสำหรับเด็กเป็นสถาปัตยกรรม ไม่ใช่สิ่งบำบัด “การสร้าง AI จากพื้นฐานสำหรับเด็กหมายความว่าเราจะจำกัดและปรับโครงสร้างทุกชั้นของสแต็กให้เหมาะสมกับเสียง พฤติกรรม การควบคุม และความสนใจของเด็ก – แทนที่จะพยายาม ‘โหมดเด็ก’ ให้กับแชทบอทสำหรับผู้ใหญ่”

ปัญหาหลักคือการรับรู้เสียงพูด “สแต็ก LLM สำหรับผู้ใหญ่สมมติว่าข้อความและเสียงพูดสำหรับผู้ใหญ่: วाकยสัมพันธ์ที่ยาวและเสถียร การออกเสียงที่มั่นคง และสภาพแวดล้อมที่เงียบสงบ เด็กอายุ 6 ขวบให้ผลตรงกันข้าม: การพูดที่ไม่สมบูรณ์ การออกเสียงที่ไม่ถูกต้อง การตะโกน และเสียงพื้นหลัง”

การรับรู้เสียงพูดของ Buddy ได้รับการฝึกอบรมและฝึกอบรมซ้ำอย่างต่อเนื่องด้วยชั่วโมงการบันทึกเสียงเด็กที่แท้จริงหลายหมื่นชั่วโมงในช่วงอายุ การออกเสียง และสภาพแวดล้อมที่มีเสียงรบกวนในบ้าน แสตอร์ทอัพอ้างว่าตอนนี้มันทำงานได้ดีกว่าการรับรู้เสียงพูดทั่วไปของ Google สำหรับเสียงพูดของเด็ก ซึ่งมีความน่าเชื่อถือมากกว่าที่คิดไว้: การฝึกอบรมโดยเฉพาะบนประชากรเป้าหมายจะทำงานได้ดีกว่าการฝึกอบรมบนข้อมูลสำหรับผู้ใหญ่

ชั้นการสนทนาก็สร้างขึ้นเช่นกัน ทุกเซสชันทำงานภายในสิ่งที่ Crekov อธิบายว่าเป็น “ชั้นการควบคุม” – ระบบที่ตระหนักหลักสูตร มีแผนการเรียน หัวข้อและติดตามเป้าหมาย โมเดลภาษาทำงานเป็นส่วนหนึ่งของโครงสร้างนั้น ไม่ใช่ผลิตภัณฑ์เอง

หากเด็กเบี่ยงเบนออกจากหลักสูตร ระบบจะเปลี่ยนเส้นทาง; ไม่มีการลอยออกไปในเรื่องที่ไม่มีที่สิ้นสุดเหมือน LLM ทั่วไป “มีแผนการเรียน หัวข้อที่อนุญาต ติดตามเป้าหมาย และโค้ดที่ควบคุม การเปลี่ยนหรือสิ้นสุดการสนทนาเมื่อจำเป็น – ดังนั้นเด็กอายุ 6 ขวบจึงไม่เคยหลุดออกไปในแชทอินเทอร์เน็ตที่ไม่มีการควบคุม”

ความเป็นส่วนตัวถือเป็นข้อจำกัดทางสถาปัตยกรรมเช่นกัน แต่ก็กลายเป็นการแข่งขันเช่นกัน เนื่องจากกฎการคุ้มครองความเป็นส่วนตัวของเด็กออนไลน์ (COPPA) ห้ามการรวบรวมข้อมูลเสียงเด็กโดยไม่ได้รับความยินยอมจากผู้ปกครอง ชุดข้อมูลเสียงเด็กที่มีอยู่มากที่สุดมีเพียงไม่กี่ร้อยชั่วโมง

Buddy.ai ได้รวบรวมชั่วโมงการบันทึกเสียงเด็กที่แท้จริงหลายหมื่นชั่วโมงในช่วงอายุ การออกเสียง และสภาพแวดล้อมที่มีเสียงรบกวนในบ้าน ส่วนใหญ่เลือกเส้นทางที่ง่ายกว่าโดยปรับเปลี่ยน LLM สำหรับผู้ใหญ่ให้เหมาะกับเด็ก แทนที่จะสร้างจากพื้นฐาน แต่ทางลัดนี้กลายเป็นความรับผิดชอบในขณะนี้

ในกรณีของ Buddy การรบกวนทั้งหมดทำงานบนโครงสร้างพื้นฐานของแพลตฟอร์ม เสียงเด็กจะถูกประมวลผลในเวลาจริงและทิ้งไปก่อนที่พ่อแม่จะคิดถึงมัน และไม่มีการสนทนาที่ส่งผ่าน API AI พาณิชย์ ตามที่ Crewkov

“เรามีความชัดเจนมากกับพ่อแม่เกี่ยวกับสิ่งที่เรารวบรวม ทำไม และวิธีการลบ – ความโปร่งใส่เป็นสิ่งสำคัญเท่ากับเทคโนโลยีเอง” Crewkov เน้น

ตั้งแต่การเปิดตัว ChitChat ซึ่งเป็นการอัปเดตหลักๆ ล่าสุดในสหรัฐอเมริกาที่แนะนำการสนทนาที่มีการไหลเวียนมากขึ้น บริษัทรายงานว่านักเรียนอเมริกันเสร็จสิ้นการทำแบบฝึกหัด 7.7 เท่าในระยะเวลาเดียวกันกับปีก่อน

ทั่วโลก การทำแบบฝึกหัดที่เสร็จสิ้นโดยเฉลี่ยต่อเดือนเพิ่มขึ้น 3.5 เท่าเมื่อเทียบกับปีก่อน

Crewkov เปิดเผยถึงข้อจำกัดของตัวเลขเหล่านั้น “การออกแบบการศึกษาที่สามารถวัดการเรียนรู้ของนักเรียนได้อย่างมีปริมาณเป็นเรื่องที่เราหวังว่าจะทำได้ในอนาคต” เขากล่าว ในขณะนี้ อย่างไรก็ตาม ฐานหลักฐานขึ้นอยู่กับการรับฟังของผู้ใช้ ข้อมูลการมีส่วนร่วมของผลิตภัณฑ์ และการยอมรับจากอุตสาหกรรม

กรณีการใช้งานที่ไม่มีใครวางแผน

อาจเป็นช่วงเวลาที่น่าสนใจที่สุดในเรื่องราวของ Buddy.ai คือช่วงที่มาถึงโดยไม่ได้ตั้งใจ: โดยไม่มีการตลาดที่มุ่งเป้าไปที่พ่อแม่ของเด็กที่มีออทิสติกและความล่าช้าในการพูดเริ่มปรากฏในข้อมูลการสำรวจในฐานะผู้ใช้ที่มีส่วนร่วมมากที่สุดของแพลตฟอร์ม

“เราตกใจมาก มันเน้นให้เห็นว่ามีทางอื่นที่ Buddy สามารถให้บริการนักเรียนทั่วโลกได้อย่างมีประสิทธิภาพ” Crewkov กล่าว

สำหรับผู้ก่อตั้ง มันไม่ใช่เพียงความผิดปกติที่น่าสนใจเท่านั้น – แต่มันชี้ให้เห็นถึงช่องว่างที่ผลิตภัณฑ์ไม่ได้ออกแบบมาเพื่อเติม แต่ดูเหมือนว่าจะสามารถทำได้ บริษัทตอบสนองโดยสร้างหลักสูตรการวิเคราะห์พฤติกรรมที่ใช้การประยุกต์ (ABA) ที่อุทิศให้

ช่องว่างนั้นกว้างและได้รับการบันทึกไว้อย่างดี เช่นกัน รายงานการตลาดในปี 2025 พบว่า ความชุกของออทิสติกในสหรัฐอเมริกาคือ 1 ใน 31 เด็กในปัจจุบัน เพิ่มขึ้นจาก 1 ใน 150 ในปี 2000 – ภายใต้ฉากหลังที่ยังคงยืดเยื้อของการขาดแคลนครูผู้เชี่ยวชาญ สำหรับครอบครัวที่ไม่มีการประกันภัยที่เพียงพอ ค่าใช้จ่ายในการรักษาออทิสติก ABA ต่อปีสามารถ สูงถึง 250,000 ดอลลาร์

การวิจัยของสถาบันสุขภาพแห่งชาติ (NIH) เกี่ยวกับ เหตุผลที่ครอบครัวไม่ได้รับการรักษา ABA พบว่าข้อจำกัดที่กล่าวถึงนั้นเป็นเรื่องปฏิบัติ: สาเหตุที่พบบ่อยที่สุด ได้แก่ เวลารอ (34%) ไม่มีผู้ให้บริการ ABA ในพื้นที่ (10%) และการรักษาไม่ได้รับการคุ้มครองจากประกัน (10%) ข้อมูลการสำรวจยังแสดงให้เห็นว่ามากกว่าครึ่งหนึ่งของเคาน์ตีทั้งหมดในสหรัฐอเมริกามีไม่มีนักวิเคราะห์พฤติกรรมที่ได้รับการรับรอง

ไม่ว่า AI ตัวละครจะประกอบเป็นการทดลองทางคลินิกที่มีความหมายหรือไม่นั้นยังคงเป็นคำถามที่เปิดกว้าง – แต่ในฐานะเครื่องมือฝึกหัดที่มีต้นทุนต่ำและพร้อมใช้งานสำหรับเด็กที่อยู่ในรายชื่อรอการรักษา มูลค่าของมันง่ายต่อการป้องกัน

“ยังคงเป็นงานที่กำลังดำเนินอยู่ แต่เรารู้สึกภูมิใจมากกับจุดที่เรากำลังไป” Crewkov กล่าว

คำถามที่ใหญ่กว่า

ตลาด edtech ที่กว้างขึ้นในปัจจุบันเต็มไปด้วยบริษัทที่ทำการอ้างสิทธิ์ที่อยู่ข้างๆ; AI ที่สร้างขึ้นโดยเฉพาะ โครงสร้างที่มั่นคง; ผลิตภัณฑ์ที่กระตุ้นการเรียนรู้ที่แท้จริง ในความเป็นจริง ตลาด AI ในการศึกษาทั่วโลกคาดว่าจะ ถึง 32.27 พันล้านดอลลาร์สหรัฐฯ ภายในปี 2030 และผู้เล่นหลักๆ ทุกคนมีกลยุทธ์สำหรับเด็ก

สิ่งที่ทำให้ Buddy.ai แตกต่างคือไม่ใช่การอ้างสิทธิ์เหล่านั้น แต่เป็นเส้นเวลา Crewkov เริ่มทำงานเกี่ยวกับการรับรู้เสียงพูดของเด็กก่อนที่การลงทุนที่จะทำให้มันกลายเป็นเรื่องนิยม และก่อนที่ LLMs จะทำให้การสร้างตัวสอนภาษาที่ดูเหมือนจริงในบ่าย

โครงสร้างพื้นฐานทางเทคนิค – โมเดลการรับรู้เสียงที่ฝึกอบรมด้วยเสียงเด็ก โครงสร้างที่ตระหนักหลักสูตร ระบบอาวาตาร์ที่เป็นเอกลักษณ์ – สะท้อนถึงการวนซ้ำเกือบหนึ่งทศวรรษเกี่ยวกับปัญหาที่เฉพาะเจาะจง ไม่ใช่การเปลี่ยนไปสู่ตลาดที่ร้อนแรง

“ในสองปี Buddy จะสามารถให้ผู้เรียนภาษาอังกฤษได้ฝึกฝนให้เพียงพอที่จะพัฒนาจากคำภาษาอังกฤษแรกๆ ไปจนถึงความชำนาญ เราไม่รีบเพราะเราตั้งความสำคัญกับความปลอดภัยและความเป็นส่วนตัว” Crewkov อธิบาย

และที่เป็นพื้นฐานของทุกสิ่งคือปรัชญาการออกแบบที่ตัดกันไปในทางตรงกันข้ามกับการคิดผลิตภัณฑ์ AI ส่วนใหญ่ “เด็กอายุ 6 ขวบไม่กลับมาเพราะ AI พวกเขากลับมาเพราะตัวละครและโลกที่พวกเขารู้สึกเป็นส่วนหนึ่ง”

นั่นเป็นสิ่งที่ยากกว่าการทำซ้ำมากกว่าแชทบอทที่มีชื่อที่เป็นมิตร และสำหรับตอนนี้ มันเป็นขอบเขตที่ป้องกันได้มากที่สุดของ Buddy.ai

ซาโลเมเป็นนักข่าวที่เกิดในเมเดยิน และเป็น Senior Reporter ที่ Espacio Media Incubator โดยมีภูมิหลังด้านประวัติศาสตร์และการเมือง ผลงานของซาโลเมเน้นย้ำถึงความเกี่ยวข้องทางสังคมของเทคโนโลยีที่เกิดขึ้นใหม่ เธอได้รับการกล่าวถึงใน Al Jazeera, Latin America Reports, และ The Sociable เป็นต้น