Ηγέτες σκέψης

Το Παιδικό AI που Προηγήθηκε του ChatGPT – Τώρα Νικά το Google στη Αναγνώριση Ομιλίας Παιδιών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η αγορά εφαρμογών μάθησης γλωσσών για παιδιά γίνεται ολοένα και πιο πυκνή και αυστηρά ελεγχόμενη. Την περασμένη εβδομάδα, ο μη κερδοσκοπικός οργανισμός Common Sense Media έκανε την έναρξη του Youth AI Safety Institute, ένα πρώτο-του-ειδους ανεξάρτητο εργαστήριο που υποστηρίζεται από 20 εκατομμύρια δολάρια ΗΠΑ το χρόνο για να δοκιμάσει AI προϊόντα για παιδιά – πίεση που έρχεται ακριβώς όταν το AI ήδη αντιστοιχεί σε 33.5% των εσόδων σε ψηφιακές γλώσσες μάθησης.

Την ίδια στιγμή, το τμήμα παιδιών μόνο μέσα σε αυτό προβλέπεται να αυξηθεί από 2,38 δισεκατομμύρια δολάρια ΗΠΑ το 2026 σε 5,17 δισεκατομμύρια μέχρι το 2035. Είναι σαφές ότι τα χρήματα κινούνται παράλληλα με την ενσωμάτωση του AI – αλλά και η επιτήρηση.

Ερευνες από το Πανεπιστήμιο του Κολοράντο έχουν τεκμηριώσει το χάσμα σαφώς: η ακρίβεια αναγνώρισης ομιλίας είναι σημαντικά χαμηλότερη για παιδιά από ότι για ενήλικες επειδή τα περισσότερα εμπορικά συστήματα εκπαιδεύονται σε καθαρή ήχο από ενήλικες ομιλητές – συχνά διαβάζοντας από σενάρια.

Μια έρευνα του 2024 ενισχύει το γιατί: οι φωνές των παιδιών περιλαμβάνουν ταχεία, απρόβλεπτες αλλαγές σε τόνο, άρθρωση και ανάπτυξη λεξιλογίου που προκαλούν τα μοντέλα εκπαιδευμένα σε ενήλικες να σφάλλουν.

Και, στην πράξη, αυτό σημαίνει ότι ένα εξαχρόνιο παιδί που μαθαίνει αγγλικά παίρνει ένα σύστημα που δεν ακούει σωστά, αποτυγχάνει να απαντήσει, ή χειρότερα: απαντάει σε κάτι完全 διαφορετικό. Το παιδί χάνει το ενδιαφέρον για μάθηση· ο γονέας χάνει χρήματα.

Αυτό είναι το πρόβλημα που ο Ivan Crewkov άρχισε να δουλεύει πάνω του το 2018, τέσσερα χρόνια πριν τα μεγάλα μοντέλα γλωσσών γίνουν μια mainstream συζήτηση.

Μια Οικεία Αρχική Σημείο

Η είσοδος του Crewkov στο χώρο της edtech ήταν προσωπική. Όταν η οικογένειά του μετακόμισε από τη Σιβηρία στην Καλιφόρνια το 2014, η κόρη του Sofia ήταν четырех ετών και δυσκολευόταν να μάθει αγγλικά στο νηπιαγωγείο. Δοκίμασε κάθε διαθέσιμο εργαλείο και βρήκε τα ίδια κενά σε όλα αυτά.

«Συχνά περιελάμβαναν ανάγνωση, την οποία δεν μπορούσε ακόμη να κάνει, ένιωθαν πολύ σαν δουλειά και δεν πρόσφεραν πρακτική ομιλίας – κρίσιμη για τα παιδιά που μαθαίνουν μια νέα γλώσσα», είπε στον Unite AI.

Τότε στράφηκε σε ζωντανούς διαδικτυακούς δασκάλους, άρχισε να ηχογραφεί τις συνεδρίες και παρατήρησε κάτι που δεν είχε αναμενθεί. «Οι δάσκαλοι διάβαζαν κυριολεκτικά από τις οθόνες τους», είπε, και πολλοί δεν ήταν πιστοποιημένοι εκπαιδευτικοί· κάθε συνεδρία κοστίζει 15 έως 20 δολάρια.

Ερχόμενος από ένα υπόβαθρο AI, η ανάγνωση της κατάστασης από τον Crewkov ήταν απλή: «Ήταν σαφές ότι πιθανώς το 80% αυτού του έργου θα μπορούσε να γίνει χρησιμοποιώντας einen εικονικό, ομιλώντα χαρακτήρα AI και αναγνώριση ομιλίας. Αυτό θα δημοκρατίσει επίσης την αγορά επειδή ήταν εξαιρετικά ακριβό»,

«Η ιδέα ήταν να παρέχει ένα μήνα μάθησης στο κόστος μιας συνεδρίας διδασκαλίας», πρόσθεσε. Αυτή η ιδέα έγινε Buddy.ai.

Κοντά στα 10,8 εκατομμύρια μικρά παιδιά – 32% όλων των παιδιών κάτω των εννέα ετών στις ΗΠΑ – είναι δίγλωσσα μαθητές (DLLs), με τουλάχιστον einen γονέα που μιλάει μια γλώσσα άλλη παρά την αγγλική στο σπίτι, όπως παρατηρεί το Migration Policy Institute. Από το 2000, στην πραγματικότητα, αυτό το πληθυσμός έχει αυξηθεί κατά 24%, και οι DLLs αποτελούν τώρα περισσότερο από 20% του πληθυσμού των μικρών παιδιών σε 24 πολιτείες και στην Ουάσινγκτον DC.

Αυτές είναι πιθανότατα οι οικογένειες που είναι πιο πιθανό να αναζητήσουν τι προσφέρουν πλατφόρμες όπως η Buddy.ai – και λιγότερο πιθανό να έχουν συνεχή πρόσβαση σε υψηλής ποιότητας προγράμματα πρώιμης παιδικής ηλικίας, με 43% που ζουν σε νοικοκυριά με χαμηλό εισόδημα σε σύγκριση με 33% των μη-DLL παιδιών.

Η εμπορική λογική, λοιπόν, είναι σαφής. Το πιο δύσκολο ερώτημα είναι αν η τεχνολογία πραγματικά παραδίδει – και εδώ, η προσέγγιση της Buddy.ai διαφοροποιείται σημαντικά από την περισσότερη ανταγωνιστική.

Σχεδιασμένο με Σκοπό, Όχι Ανακατασκευασμένο

Η διάκριση που κάνει ο Crewkov μεταξύ της κατασκευής για παιδιά και της προσαρμογής για αυτά είναι αρχιτεκτονική, όχι αισθητική. «Η κατασκευή του AI από το έδαφος για παιδιά σημαίνει ότι περιορίζουμε και ξανασχεδιάζουμε κάθε στρώμα του στοίβας γύρω από τις φωνές των παιδιών, τη συμπεριφορά, την ρύθμιση και το χρονικό διάστημα προσοχής – αντί να προσπαθούμε να «παιδεύουμε» einen ενηλικό chatbot».

Το βασικό πρόβλημα είναι ακουστικό. «Οι στοίβες LLM για ενήλικες υποθέτουν κείμενο και ομιλία για ενήλικες: μακρές γραμματικές προτάσεις, σταθερή προφορά και ήρεμες περιβάλλοντες. Ένα εξαχρόνιο παιδί σας δίνει το αντίθετο: θραύσματα προτάσεων, λανθασμένες προφορές, φωνές, ισχυρές προφορές και θόρυβους στο υπόβαθρο».

Ο αναγνώστης ομιλίας της Buddy έχει εκπαιδευτεί και συνεχώς επανεκπαιδευτεί σε δεκάδες χιλιάδες ώρες πραγματικών φωνών παιδιών σε όλες τις ηλικίες, προφορές και θορυβώδεις οικιακές περιβάλλοντες. Η εταιρεία ισχυρίζεται ότι τώρα υπερβαίνει την γενική αναγνώριση ομιλίας του Google για τις φωνές των παιδιών, το οποίο έχει περισσότερη αξιοπιστία από ότι μπορεί να φανεί αρχικά: η εκπαίδευση ειδικά στο στόχο πληθυσμό υπερβαίνει συνεχώς την εκπαίδευση σε δεδομένα ενηλίκων.

Το συζητητικό στρώμα είναι επίσης σχεδιασμένο με σκοπό. Κάθε συνεδρία λειτουργεί μέσα σε αυτό που ο Crekov περιγράφει ως «κυβερνώ στρώμα» – ένα σύστημα που είναι συνειδητό του προγράμματος, με σχέδιο συνεδρίας, ορισμένα θέματα και παρακολούθηση στόχων. Το μοντέλο γλώσσας λειτουργεί ως ένα συστατικό μέσα σε αυτή τη δομή, όχι ως το προϊόν selbst.

Αν ένα παιδί απομακρύνεται από το δρόμο, το σύστημα ανακατευθύνει· δεν υπάρχει ανοιχτή οδηγία στο τίποτα που θα μπορούσε να παράγει ένα γενικό-σκοπό LLM. «Υπάρχει ένα σχέδιο συνεδρίας, επιτρεπόμενα θέματα, παρακολούθηση στόχων και κώδικας που κατευθύνει, ανακατευθύνει ή τερματίζει τη συζήτηση όταν χρειάζεται – ώστε ένα εξαχρόνιο παιδί να μην πέσει ποτέ σε ανοιχτή διαδικτυακή συζήτηση».

Η ιδιωτικότητα, επίσης, αντιμετωπίζεται ως αρχιτεκτονική περιορισμός καθώς και ως πολιτική – αλλά έχει επίσης σιωπηλά γίνει ανταγωνιστική. Επειδή ο κανόνας Online Privacy Protection για παιδιά απαγορεύει τη συλλογή δεδομένων φωνής παιδιών χωρίς τη συναίνεση των γονέων, το μεγαλύτερο δημόσια διαθέσιμο σύνολο φωνών παιδιών ανέρχεται σε μόνο quelques εκατοντάδες ώρες.

Η Buddy.ai έχει συλλέξει δεκάδες χιλιάδες ώρες πραγματικών φωνών παιδιών σε όλες τις ηλικίες, προφορές και θορυβώδεις οικιακές περιβάλλοντες. Οι περισσότεροι πήραν τον εύκολο δρόμο της προσαρμογής των LLM για παιδιά αντί να χτίσουν από το μηδέν· αλλά το σπάσιμο είναι τώρα ένα μειονέκτημα.

Στην περίπτωση της Buddy, όλα τα εμπόδια λειτουργούν στην υποδομή της πλατφόρμας, η φωνή του παιδιού επεξεργάζεται σε πραγματικό χρόνο και απορρίπτεται πριν οι γονείς σκεφτούν γι’ αυτό, και καμία συζήτηση δεν διέρχεται από εμπορικές API AI, όπως ανέφερε ο Crewkov.

«Είμαστε πολύ σαφείς με τους γονείς σχετικά με τι συλλέγουμε, γιατί και πώς μπορούν να το διαγράψουν – η διαφάνεια είναι τόσο σημαντική όσο και η τεχνολογία», τόνισε ο Crewkov.

Από την έναρξη του ChitChat, της πιο πρόσφατης σημαντικής ενημέρωσης στις ΗΠΑ που εισάγει πιο προηγμένες ελεύθερες συζητήσεις, η εταιρεία αναφέρει ότι οι αμερικανικοί μαθητές ολοκλήρωσαν 7,7 φορές περισσότερες ασκήσεις στην ίδια χρονική περίοδο σε σύγκριση με το προηγούμενο έτος.

Παγκοσμίως, οι μέσες ασκήσεις που ολοκληρώνονται ανά μήνα έχουν αυξηθεί 3,5 φορές ετησίως.

Ο Crewkov είναι ειλικρινής σχετικά με τα όρια του τι αυτά τα νούμερα αποδεικνύουν. «Η σχεδίαση ερευνών που θα μπορούσαν να μετρήσουν ποσοτικά την μάθηση των μαθητών είναι κάτι που ελπίζουμε να κάνουμε στο προσεχές μέλλον», είπε. Για τώρα, όμως, η βάση αποδείξεων βασίζεται σε ανατροφοδότηση χρηστών, δεδομένα συμμετοχής προϊόντων και αναγνώριση βραβείων βιομηχανίας.

Η Περίπτωση Χρήσης που Κανείς Δεν Σχεδίασε

Πιθανότατα η πιο αποκαλυπτική στιγμή στην ιστορία της Buddy.ai είναι αυτή που ήρθε χωρίς πρόσκληση: χωρίς καμία στόχευση marketing, γονείς παιδιών με αυτισμό και καθυστερήσεις ομιλίας άρχισαν να εμφανίζονται στα δεδομένα της έρευνας ως οι πιο ενεργοί χρήστες της πλατφόρμας.

«Ήμασταν αρχικά khá έκπληκτοι. Αυτό σίγουρα υπογράμμισε ότι υπήρχαν άλλες τρόποι με τους οποίους η Buddy θα μπορούσε να εξυπηρετεί οικονομικά τους μαθητές σε όλο τον κόσμο», θυμάται ο Crewkov.

Για τον ιδρυτή, δεν ήταν μόνο μια ενδιαφέρουσα ανωμαλία – έδειξε ένα κενό που το προϊόν δεν είχε σχεδιαστεί να καλύψει αλλά φαινόταν ότι θα μπορούσε. Η εταιρεία ανταποκρίθηκε κατασκευάζοντας ένα αφιερωμένο Πρόγραμμα Applied Behavior Analysis (ABA).

Το κενό είναι ευρύ και καλά τεκμηριωμένο, επίσης. Μια ερεύνηση αγοράς του 2025 βρήκε ότι η συχνότητα αυτισμού στις ΗΠΑ είναι τόσο υψηλή όσο 1 σε 31 παιδιά σήμερα, από 1 σε 150 το 2000 – μέσα σε μια σταθερή υπόβαθρο ελλείψεων πιστοποιημένων θεραπευτών. Για οικογένειες χωρίς επαρκή κάλυψη ασφάλισης, τα ετήσια έξοδα θεραπείας ABA μπορούν να φτάσουν 250.000 δολάρια.

Ερευνες του Εθνικού Ινστιτούτου Υγείας (NIH) για το γιατί οι οικογένειες δεν έλαβαν ABA βρήκαν τα εμπόδια να είναι εντυπωσιακά πρακτικά: τα πιο συχνά αναφερόμενα λόγους περιελάμβαναν μακρές λίστες αναμονής (34%), έλλειψη παρόχων ABA στην περιοχή τους (10%) και ασφάλιση που δεν καλύπτει τη θεραπεία (10%). Τα δεδομένα της έρευνας έδειξαν επίσης ότι περισσότερα από το μισό των κομητειών των ΗΠΑ δεν έχουν πιστοποιημένους αναλυτές συμπεριφοράς.

Αν ένα χαρακτήρας AI συνιστά μια σημαντική παρέμβαση στο κλινικό επίπεδο παραμένει ένα ανοιχτό ερώτημα – αλλά ως ένα σταθερό, χαμηλού κόστους, on-demand εργαλείο πρακτικής για παιδιά σε μακρές λίστες αναμονής, η αξία του είναι πιο εύκολο να υπερασπιστεί.

«Αυτό παραμένει ένα έργο σε εξέλιξη, αλλά είμαστε πραγματικά υπερήφανοι για το πού πάει η πρωτοβουλία», είπε ο Crewkov.

Το Μεγαλύτερο Ερώτημα

Η ευρύτερη αγορά edtech είναι τώρα γεμάτη εταιρείες που κάνουν γειτονικές αξιώσεις· AI που είναι σχεδιασμένο με σκοπό, robust αρχιτεκτονική· πραγματικά προϊόντα που προκαλούν μάθηση. Στην πραγματικότητα, η παγκόσμια αγορά AI στην εκπαίδευση εκτιμάται να φτάσει 32,27 δισεκατομμύρια δολάρια μέχρι το 2030, και κάθε μεγάλος παίκτης έχει μια στρατηγική για παιδιά.

Τι διαφοροποιεί τη θέση της Buddy.ai δεν είναι οι αξιώσεις οι ίδιες, αλλά η χρονολογία. Ο Crewkov άρχισε να δουλεύει στην αναγνώριση ομιλίας παιδιών πολύ πριν η τρέχουσα κύμα επένδυσης έκανε τη μόδα, και πριν τα LLMs έκαναν εύκολο να χτίσουν einen πειστικό ήχο διδάσκαλο σε μια μέρα.

Η τεχνική υποδομή – τα ακουστικά μοντέλα εκπαιδευμένα στις φωνές των παιδιών, η αρχιτεκτονική που είναι συνειδητή του προγράμματος, το ιδιόκτητο σύστημα avatar – αντανακλά σχεδόν μια δεκαετία επανάληψης στο συγκεκριμένο πρόβλημα, όχι μια γρήγορη στροφή προς μια καυτή αγορά.

«Σε δύο χρόνια, η Buddy θα μπορεί να δώσει στους μαθητές τις ασκήσεις που χρειάζονται για να προχωρήσουν από τις πρώτες αγγλικές λέξεις μέχρι την ικανότητα. Δεν βιαζόμαστε, επειδή προτεραιότητα μας είναι η ασφάλεια και η ιδιωτικότητα», εξήγησε ο Crewkov.

Και κάτω από όλα αυτά είναι μια φιλοσοφία σχεδιασμού που κόβει ενάντια στη τάση της περισσότερης σκέψης προϊόντων AI. «Εξαχρόνια παιδιά δεν επιστρέφουν για AI. Επιστρέφουν για einen χαρακτήρα και έναν κόσμο που αισθάνονται μέρος του».

Αυτό είναι ένα πιο δύσκολο πράγμα να αναπαραχθεί από einen chatbot με einen φιλικό όνομα. Και, για τώρα, η πιο αμυντική άκρη της Buddy.ai.

Η Salomé είναι μια δημοσιογράφος γεννημένη στο Medellín και Senior Reporter στο Espacio Media Incubator. Με υπόβαθρο στην Ιστορία και την Πολιτική, το έργο της Salomé τονίζει τη κοινωνική επικαιρότητα των αναδυόμενων τεχνολογιών. Έχει παρουσιαστεί στο Al Jazeera, Latin America Reports, και The Sociable, μεταξύ άλλων