Vordenker

Die Kinder-KI, die ChatGPT vorherschlug – Jetzt schlägt sie Google bei der Spracherkennung von Kindern

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Der Markt für Sprachlern-Apps für Kinder wird immer voller und wird zunehmend unter die Lupe genommen. Letzte Woche startete die Non-Profit-Organisation Common Sense Media die Youth AI Safety Institute, ein unabhängiges Labor, das von 20 Millionen US-Dollar pro Jahr unterstützt wird, um AI-Produkte für Kinder zu testen – ein Druck, der gerade dann eintritt, als AI bereits 33,5% der Einnahmen im Bereich der digitalen Sprachlern-Produkte ausmacht.

Zugleich wird der Segment der Kinder allein innerhalb dieses Marktes von 2,38 Milliarden US-Dollar im Jahr 2026 auf 5,17 Milliarden US-Dollar im Jahr 2035 ansteigen. Offensichtlich bewegt sich das Geld parallel zur AI-Integration – aber auch die Aufsicht.

Forschung des AI-Instituts der University of Colorado hat die Lücke deutlich dokumentiert: Die Genauigkeit der Spracherkennung ist für Kinder erheblich niedriger als für Erwachsene, da die meisten kommerziellen Systeme auf sauberem Audio von erwachsenen Sprechern trainiert werden – oft aus Skripten.

Ein Bericht aus dem Jahr 2024 unterstreicht, warum: Kinderstimmen umfassen schnelle, unvorhersehbare Veränderungen in Tonhöhe, Artikulation und Vokabular, die adulten Trainingsmodelle zum Straucheln bringen.

Und in der Praxis bedeutet dies, dass ein sechs Jahre altes Kind, das Englisch lernt, ein System erhält, das es falsch versteht, nicht reagiert oder schlimmer noch: auf das Falsche reagiert. Das Kind verliert das Interesse am Lernen; der Elternteil verliert Geld.

Dies ist das Problem, an dem Ivan Crewkov 2018 begann zu arbeiten, vier Jahre bevor große Sprachmodelle zu einem Mainstream-Thema wurden.

Ein vertrauter Ausgangspunkt

Crewkovs Einstieg in den EdTech-Bereich war persönlich. Als seine Familie 2014 von Sibirien nach Kalifornien zog, war seine Tochter Sofia vier Jahre alt und hatte Schwierigkeiten, Englisch in der Vorschule zu lernen. Er probierte jedes verfügbare Werkzeug aus und fand die gleichen Lücken bei allen.

„Sie beinhalteten oft Lesen, was sie noch nicht konnten, sie fühlten sich zu sehr wie Arbeit an und boten keine Sprechübung – was für Kinder, die eine neue Sprache lernen, entscheidend ist“, erzählte er Unite AI.

Er wandte sich dann an Online-Tutoren, begann, die Sitzungen aufzuzeichnen, und bemerkte etwas, was er nicht erwartet hatte. „Die Lehrer lasen buchstäblich von ihren Bildschirmen“, sagte er, und viele von ihnen waren keine zertifizierten Pädagogen; jede Sitzung kostete 15 bis 20 US-Dollar.

Als jemand, der aus einem AI-Hintergrund kam, war Crewkovs Einschätzung der Situation einfach: „Es war mir klar, dass wahrscheinlich 80% dieser Arbeit mit einem virtuellen, sprechenden AI-Charakter und Spracherkennung erledigt werden konnte. Dies würde auch den Markt dramatisch demokratisieren, da es extrem teuer war“,

„Die Idee war, einen Monat des Lernens zum Preis einer Tutoring-Sitzung anzubieten“, fügte er hinzu. Diese Idee wurde zu Buddy.ai.

Fast 10,8 Millionen junge Kinder – 32% aller US-amerikanischen Kinder unter neun Jahren – sind Zwei-Sprachen-Lerner (DLLs), mit mindestens einem Elternteil, der zu Hause eine andere Sprache als Englisch spricht, wie die Migration Policy Institute angibt. Seit 2000 ist diese Bevölkerung um 24% gewachsen, und DLLs machen nun mehr als 20% der jungen Bevölkerung in 24 Bundesstaaten und Washington D.C. aus.

Das sind wahrscheinlich die Familien, die am wahrscheinlichsten nach Plattformen wie Buddy.ai suchen – und am wenigsten Zugang zu qualitativ hochwertigen frühkindlichen Programmen haben, wobei 43% in Haushalten mit niedrigem Einkommen leben im Vergleich zu 33% der Nicht-DLL-Kinder.

Die kommerzielle Logik ist daher klar. Die schwierigere Frage ist, ob die Technologie tatsächlich funktioniert – und hier weicht Buddy.ai’s Ansatz deutlich von den meisten Wettbewerbern ab.

Zweckgebaut, nicht nachgerüstet

Der Unterschied, den Crewkov zwischen dem Bau für Kinder und der Anpassung für sie zieht, ist architektonisch, nicht kosmetisch. „AI von Grund auf für Kinder zu bauen bedeutet, dass wir jeden Layer des Stacks um Kinderstimmen, Verhalten, Regulierung und Aufmerksamkeitsspanne herum konstruieren und reorganisieren – anstatt zu versuchen, einen adulten Chatbot zu ‚kid-modifizieren‘.“

Das Kernproblem ist akustisch. „Adult-LLM-Stacks gehen von adulten Texten und Sprache aus: langen grammatischen Sätzen, stabiler Aussprache und ruhigen Umgebungen. Ein Sechsjähriger gibt Ihnen das Gegenteil: fragmentarische Äußerungen, Falschaussprachen, Schreien, starke Akzente und Hintergrundgeräusche.“

Buddys Spracherkenner wurde auf Zehntausende von Stunden realer Kinderstimmen in verschiedenen Altersgruppen, Akzenten und lärmigen Heimumgebungen trainiert und kontinuierlich weiter trainiert. Das Startup behauptet, es übertrifft nun Googles allgemeine Spracherkennung bei Kinderstimmen, was mehr Glaubwürdigkeit hat, als es auf den ersten Blick scheinen mag: spezifisches Training auf der Zielgruppe übertrifft konsistent das Training auf adulten Daten.

Die konversationale Ebene ist ähnlich zweckgebaut. Jede Sitzung läuft innerhalb einer sogenannten „Regierungsebene“ – einem curriculum-bewussten System mit einem Sitzungsplan, definierten Themen und Zielverfolgung. Das Sprachmodell fungiert als ein Bestandteil innerhalb dieser Struktur, nicht als Produkt selbst.

Wenn ein Kind vom Kurs abweicht, lenkt das System um; es gibt keine offene Drift in irgendetwas, was ein allgemeiner LLM produzieren könnte. „Es gibt einen Sitzungsplan, erlaubte Themen, Zielverfolgung und Code, der steuert, umlenkt oder die Konversation beendet, wenn nötig – damit ein Sechsjähriger nie einfach in offene Internet-Unterhaltung abrutscht.“

Auch die Privatsphäre wird als architektonische Einschränkung und nicht nur als Richtlinie behandelt – ist aber auch stillschweigend zu einem Wettbewerbsfaktor geworden. Da die Children’s Online Privacy Protection Rule (COPPA) das Sammeln von Kinderstimmen ohne elterliche Zustimmung verbietet, beträgt die größte öffentlich verfügbare Datenmenge von Kinderstimmen nur einige hundert Stunden.

Buddy.ai hat Zehntausende von Stunden realer Kinderstimmen in verschiedenen Altersgruppen, Akzenten und lärmigen Heimumgebungen gesammelt. Die meisten nahmen den einfacheren Weg und passten adulten LLMs für Kinder an, anstatt von Grund auf zu bauen – aber der Shortcut ist jetzt ein Nachteil.

Bei Buddy läuft alle Interferenz auf der Plattform-Infrastruktur, Kinderstimmen werden in Echtzeit verarbeitet und vor dem Gedanken der Eltern weggeworfen, und keine Konversationen werden durch kommerzielle AI-APIs geleitet, wie Crewkov angibt.

„Wir sind sehr explizit mit den Eltern darüber, was wir sammeln, warum und wie sie es löschen können – Transparenz ist genauso wichtig wie die Technik selbst“, betonte Crewkov.

Seit dem Start von ChitChat, dem letzten großen Update auf dem US-Markt, das fortschrittlichere, freie Konversationen einführt, berichtet das Unternehmen, dass amerikanische Schüler 7,7-mal mehr Übungen in demselben Zeitraum wie im Vorjahr abgeschlossen haben.

Weltweit sind die durchschnittlich abgeschlossenen Übungen pro Monat um das 3,5-fache im Vergleich zum Vorjahr gestiegen.

Crewkov ist ehrlich über die Grenzen dessen, was diese Zahlen beweisen. „Die Entwicklung von Forschungsstudien, die den Lernerfolg der Schüler quantifizierbar messen, ist etwas, das wir in naher Zukunft hoffen zu tun“, sagte er. Für den Moment basiert die Beweisgrundlage jedoch auf Nutzerfeedback, Produktengagement-Daten und Branchen-Auszeichnungen.

Der Anwendungsfall, den niemand geplant hatte

Vielleicht der aussagekräftigste Moment in Buddy.ai’s Geschichte ist der, der ungeladen kam: ohne gezielte Werbung begannen Eltern von Kindern mit Autismus und Sprachverzögerungen in Umfragedaten als die engagiertesten Nutzer der Plattform aufzutauchen.

„Wir waren anfangs ziemlich überrascht. Es hob definitiv hervor, dass es andere Möglichkeiten gab, wie Buddy kostengünstig Studenten auf der ganzen Welt bedienen konnte“, erinnerte sich Crewkov.

Für den Gründer war es nicht nur eine interessante Anomalie – es wies auf eine Lücke hin, die das Produkt nicht beabsichtigt hatte zu füllen, aber offensichtlich konnte. Das Unternehmen reagierte, indem es einen speziellen Applied Behavior Analysis (ABA)-Kurs aufbaute.

Die Lücke ist breit und gut dokumentiert. Ein Marktbericht aus dem Jahr 2025 fand heraus, dass die Autismus-Prävalenz in den USA bei 1 von 31 Kindern liegt – im Vergleich zu 1 von 150 im Jahr 2000 – vor dem Hintergrund anhaltender Therapeuten-Engpässe. Für Familien ohne ausreichende Versicherungsabdeckung können die jährlichen Kosten für ABA-Therapie 250.000 US-Dollar erreichen.

Nationale Gesundheitsinstitut (NIH) Forschung über die Gründe, warum Familien keine ABA erhielten, fand die Barrieren als bemerkenswert praktisch: die häufigsten Gründe, die genannt wurden, umfassten lange Wartezeiten (34%), mangelnde ABA-Anbieter in ihrem Gebiet (10%) und fehlende Abdeckung durch die Versicherung (10%). Umfragedaten zeigten auch, dass mehr als die Hälfte aller US-Grafschaften überhaupt keine zertifizierten Verhaltensanalysten haben.

Ob ein AI-Charakter eine sinnvolle Intervention auf klinischer Ebene darstellt, bleibt eine offene Frage – aber als konsistenter, kostengünstiger, bedarfsorientierter Übungs-Tool für Kinder auf langen Wartelisten ist sein Wert einfacher zu verteidigen.

„Dies ist ein laufendes Projekt, aber wir sind wirklich stolz darauf, wohin die Initiative geht“, sagte Crewkov.

Die größere Frage

Der breitere EdTech-Markt ist jetzt voller Unternehmen, die angrenzende Behauptungen machen; AI, die zweckgebaut ist, robuste Architektur; echte lerninduzierende Produkte. Tatsächlich wird der globale AI-Bildungsmarkt voraussichtlich 32,27 Milliarden US-Dollar im Jahr 2030 erreichen, und jeder große Spieler hat eine Kinderstrategie.

Was Buddy.ai’s Position unterscheidet, ist nicht die Behauptung selbst, sondern die Zeitleiste. Crewkov begann vor der aktuellen InvestitionsWelle, die es fashionable machte, und vor LLMs, die es einfach machten, einen überzeugenden Sprachlehrer in einem Nachmittag zu bauen, an der Spracherkennung für Kinder zu arbeiten.

Die technische Infrastruktur – die akustischen Modelle, die auf Kinderstimmen trainiert wurden, die curriculum-bewusste Architektur, das proprietäre Avatarsystem – spiegelt fast ein Jahrzehnt der Iteration über das spezifische Problem wider, nicht eine schnelle Wendung in Richtung eines heißen Marktes.

„In zwei Jahren wird Buddy in der Lage sein, Englischlernenden die Übung zu bieten, die sie benötigen, um von den ersten englischen Wörtern bis zur Sprachbeherrschung zu gelangen. Wir sind nicht in Eile, weil wir Sicherheit und Privatsphäre priorisieren“, erklärte Crewkov.

Und unter all dem liegt eine Design-Philosophie, die gegen den Strich der meisten AI-Produkt-Gedanken geht. „Sechsjährige kommen nicht wegen AI zurück. Sie kommen zurück für einen Charakter und eine Welt, der sie sich zugehörig fühlen.“

Das ist ein schwierigeres Ding, als ein Chatbot mit einem freundlichen Namen zu replizieren. Und für den Moment ist dies Buddy.ai’s am besten verteidigbare Vorteil.

Salomé ist eine in Medellín geborene Journalistin und Senior-Reporterin bei Espacio Media Incubator. Mit einem Hintergrund in Geschichte und Politik betont Salomés Arbeit die gesellschaftliche Relevanz von aufkommenden Technologien. Sie wurde in Al Jazeera, Latin America Reports und The Sociable unter anderen vorgestellt.