Лидеры мнений

Почему общее назначение речевого ИИ не справляется с детьми

mm
Добавьте Unite.AI в избранные источники в Google

Знаете ли вы, что речевые расстройства у детей более чем удвоились с момента пандемии? В то же время Национальная оценка образовательного прогресса показала, что очки чтения снизились на два балла, несмотря на вливание различных инициатив для борьбы с потерей знаний, финансируемых федеральным бюджетом. В результате спрос на раннее вмешательство никогда не был так высок, и многие обращаются к ИИ и технологиям за помощью. Ведь инструменты распознавания речи есть повсюду – от виртуальных помощников до программного обеспечения для классов. Но вот проблема: многие из этих инструментов были созданы только для взрослых голосов.

Системы автоматического распознавания речи (ASR) сегодня обычно обучаются на данных взрослых дикторов, часто англоязычных с четкими и последовательными речевыми паттернами. Итак, когда ребенок говорит, эти модели часто неправильно интерпретируют его слова или вообще не реагируют. Это не просто техническая ошибка. Когда ИИ не понимает, что говорит ребенок, это упущенная возможность поддержать обучение, выявить потенциальные проблемы развития или предоставить своевременные вмешательства.

Хорошая новость? Эта проблема решаема. Но сначала нам нужно понять, почему эти пробелы существуют и что потребуется, чтобы их закрыть.

Речь детей фундаментально отличается от речи взрослых, учитывая, что манеры ребенка могут быть менее предсказуемыми и часто наполнены грамматическими несоответствиями или неправильной артикуляцией. В отличие от взрослых, дети также часто затихают в середине предложения или используют словарный запас, который еще развивается – создавая вариативность, которую ИИ труднее обрабатывать. Согласно Национальной библиотеке медицины, системы распознавания речи производят ошибки слов, которые в 2-5 раз выше у детей, чем у взрослых, ссылаясь на различия тона, вариативность артикуляции и несоответствия вокального тракта.

И это не только как дети говорят, но и где они говорят. Записи голоса детей часто происходят в подавляющих средах, таких как классы или детские сады, где множество голосов перекрываются и фоновый шум постоянный. Стандартные модели ASR борются с изоляцией одного диктора в таких условиях, не говоря уже об точной транскрипции их слов. Даже продвинутые методы, такие как диаризация диктора, которая является способностью определить, какой голос принадлежит ребенку, учителю или репетитору, часто не справляются, когда применяются к многоspeaker, высокошумным сценариям. Без этого системы рискует неправильно присвоить речь, еще больше снижая точность и удобство использования.

Другой ключевой проблемой является отсутствие транскрипции на уровне фонем во многих системах ASR. Разделение речи на отдельные звуки позволяет моделям отслеживать неправильную артикуляцию, колебания и поток с гораздо большей точностью. Этот детальный подход особенно ценен в образовательных и терапевтических условиях, где понимание тонких различий в речи может информировать вмешательства.

Эти функции работают лучше всего, когда используются вместе. Они не заменяют общие модели речи, а скорее дообучают их с помощью этически полученных, детских данных для точной работы в ситуациях, где это наиболее важно.

Дефицит данных и почему большая технология не решает эту проблему

Корень проблемы лежит в данных – или их отсутствии. Поскольку большинство моделей речи обучаются на наборах данных, доминируемых взрослыми голосами, детские голоса, особенно те, которые из различных лингвистических и культурных сред, в значительной степени забыты. Сбор высококачественных, представительных голосовых данных детей, необходимых для обучения моделей ИИ, также является внутренне сложным, и по хорошей причине. Регуляции, такие как COPPA (Закон о защите конфиденциальности детей в Интернете), налагают строгие ограничения на компании, стремящиеся собрать и проанализировать данные детей младше 13 лет. Хотя эти регуляции имеют решающее значение для защиты конфиденциальности детей, они непреднамеренно создают барьеры для разработки ИИ.

Для многих технологических компаний анализ затрат и выгод и воспринимаемая рыночная возможность не оправдывают инвестиции. Поддержка распознавания речи для детей часто рассматривается как высокоинтенсивное, низкодоходное мероприятие. Рынок меньше по сравнению с корпоративными и ориентированными на взрослых решениями, и регуляторные барьеры делают его еще менее привлекательным. В результате улучшение ASR для детей редко попадает в верхнюю часть списка приоритетов.

Почему точный и этический ИИ имеет значение для равных результатов грамотности

Несмотря на эти проблемы, речевой ИИ все еще играет важную роль в классах и терапевтических сессиях – для оценок чтения, ранних программ грамотности и даже скрининга на наличие нарушений обучения. Но точность имеет значение. В одном исследовании лучшая система ASR транскрибировала только 18% слов 5-летних детей правильно. Ошибки распознавания могут исказить данные, на которые опираются педагоги и специалисты. Это может потенциально привести к занижению уровня чтения ребенка или задержке выявления возможных речевых или проблем обучения.

Когда речевой ИИ не справляется, это влияет не только на результаты обучения. Это расширяет разрыв в равенстве. Дети с разными акцентами, нейроразнообразными учениками и многolingvalными студентами непропорционально затронуты неточностями ASR. Эти группы уже находятся в группе повышенного риска быть неправильно понятыми общими моделями, и когда речевой ИИ не справляется с ними, это может усугубить существующие различия в образовании и здравоохранении. Для практиков ИИ это подчеркивает необходимость проектировать системы, которые не только точны, но и справедливы.

Этические соображения также имеют решающее значение. Данные детей чрезвычайно чувствительны и должны обрабатываться с осторожностью и прозрачными намерениями. Многие существующие инструменты полагаются на сторонние серверы для обработки речевых данных – практика, которая может быть достаточной для чат-бота обслуживания клиентов, но совершенно неуместна для молодых учеников. К счастью, местная и локальная обработка данных становится лучшей практикой, поскольку она гарантирует, что данные никогда не покидают устройство, соответствуя законам, ограничивающим сбор, целевую рекламу и хранение данных.

Закрытие разрыва с помощью специально разработанных инструментов

Чтобы真正 поддержать детей, речевой ИИ должен выйти за рамки базовой транскрипции и быть разработан специально для реальных сложностей классов, клиник и других динамических сред обучения. Его роль должна заключаться в том, чтобы улучшить, а не заменить, человеческую экспертизу. Наиболее эффективные системы не просто присваивают оценки или метки; они предоставляют подробные, действенные идеи через функции, такие как временные метки, транскрипции на уровне фонем и индикаторы колебаний.

Оборудовав педагогов и терапевтов нюансированными, надежными данными, ИИ может расширить возможности профессионалов для принятия обоснованных решений, адаптированных к каждому ребенку. Когда речевой ИИ разработан вдумчиво и этично, он становится больше, чем просто инструментом. Он становится надежным партнером в содействии грамотности, равенству и значимым результатам обучения для каждого ребенка.

Богдан Хомич является директором по исследованиям и разработке продуктов в компании SoftServe, ведущем провайдере IT-консалтинга и цифровых услуг. Он тесно сотрудничает с учеными для исследования, разработки и коммерциализации новых технологий, направленных на продвижение человеческого прогресса. Его внимание сосредоточено на агентах ИИ, генеративном ИИ, квантовых вычислениях, био-инновациях и высокопроизводительных вычислениях. Богдан имеет степени в области управления технологиями от Украинского католического университета и киберинженерии от Киевского национального университета.