사상 리더

일반적인 음성 인식 AI가 어린이에게 부족한 이유

mm
Unite.AI를 Google의 선호 소스에 추가

코로나19 팬데믹 이후 어린이의 언어 장애가 두 배 이상 증가한 것으로 나타났습니다.同時에, 국가 교육 평가에서 읽기 점수가 2점 낮아졌으며, 연방 자금을 통한 학습 손실을 방지하기 위한 다양한 계획에도 불구하고, 읽기 점수가 낮아졌습니다. 따라서 초기 개입의需求이 이전보다 높아졌으며, 많은 사람들이 AI와 기술을 도움으로 여겨지고 있습니다. 실제로, 음성 인식 도구는 가상 보조자에서부터 교실 소프트웨어에 이르기까지 모든 곳에 존재합니다. 그러나 이러한 도구 대부분은 성인의 목소리를 위해 설계되었습니다.

오늘날의 자동 음성 인식 시스템은 일반적으로 성인의 목소리를 기반으로 학습되며, 영어를 구사하는 성인들의 명확하고 일관된 발화 패턴을 따릅니다. 따라서, 어린이의 목소리를 인식할 때 이러한 모델은 자주 오해하거나 전혀 반응하지 않습니다. 이것은 단순한 기술적인 문제가 아닙니다. AI가 어린이의 말을 이해하지 못할 때, 이는 학습을 지원하거나 발달 문제를 신호하는 기회를 놓치는 것입니다.

幸い, 이 문제는 해결할 수 있습니다. 그러나 먼저, 이러한 격차가 존재하는 이유와 이를 메우기 위해 필요한 것을 이해해야 합니다.

어린이의 음성이 AI를 혼동시키는 이유

어린이의 음성은 성인의 음성과 근본적으로 다릅니다. 어린이의 발화는 예측하기 어렵고, 문법적 일관성이 부족하거나 발음이 부정확할 수 있습니다. 또한, 어린이들은 종종 문장을 중간에 끊거나 아직 발달 중인 어휘를 사용하여, AI가 처리하기 더 어려운 변동성을 생성합니다. 국립 의학 도서관에 따르면, 음성 인식 시스템은 어린이의 경우 성인보다 2~5배 더 높은 단어 오류率을 나타냅니다. 이는 음고 차이, 발음 변동성, 성대 불일치 등이 이유입니다.

어린이들이 말하는 곳도 중요합니다. 어린이들의 음성 녹음은 교실이나 유치원과 같은 환경에서 자주 발생하며, 여러 목소리가 겹치고 배경 소음이 지속됩니다. 표준 음성 인식 모델은 이러한 조건에서 단일 발화를 분리하거나 정확하게 전사하기에 어려움을 겪습니다. 심지어 발화자 식별과 같은 고급 기술도, 다중 발화자와 높은 소음 환경에서 부족합니다. 이러한 기술이 부족하면, 시스템은 발화를 잘못 귀속시킬 수 있으며, 이는 정확도와 사용성을 낮춥니다.

또 다른 핵심적인 도전은 많은 음성 인식 시스템에서 음소 수준의 전사가 부족하다는 것입니다. 음성을 개별 음소로 분해하면, 모델은 발음 오류, 주저함, 유창성을 더 정밀하게 추적할 수 있습니다. 이러한 세부적인 접근법은 교육 및 치료 환경에서 특히 유용하며, 음성의 미묘한 차이를 이해하는 데 도움이 됩니다.

이러한 기능은 함께 사용할 때 가장 효과적입니다. 일반적인 음성 모델을 대체하는 것이 아니라, эти적으로 수집된 어린이의 음성 데이터로 미세 조정하여, 가장 중요한 상황에서 정확하게 작동하도록 합니다.

데이터 부족과 빅테크가 이를 해결하지 않는 이유

문제의 근본은 데이터에 있습니다. 대부분의 음성 모델이 성인의 목소리로 학습되기 때문에, 어린이의 목소리, 특히 다양한 언어와 문화적 배경의 어린이들의 목소리는 대체로 무시됩니다. 높은 품질의 대표적인 어린이의 음성 데이터를 수집하여 AI 모델을 학습시키는 것은 본질적으로 복잡하며, 이유는 있습니다. 13세 미만의 어린이들의 데이터를 수집하고 분석하는 데 대한 규제인 COPPA(어린이의 온라인 개인정보 보호법)가 기업들에게 엄격한 제한을課합니다. 이러한 규제는 어린이들의 개인정보를 보호하기 위해 필수적이지만, 어린이들의 음성 인식을 위한 강력한 AI 개발을 방해하는 장벽을 만들어냅니다.

많은 기술 회사에서는, 비용-효과 분석과 시장 기회를 고려할 때, 어린이의 음성 인식을 지원하는 것이 높은 노력과 낮은 수익의 작업으로 간주됩니다. 시장은 기업과 성인 중심 솔루션에 비해 작으며, 규제 장벽으로 인해 더욱 매력적으로 보이지 않습니다. 따라서, 어린이들을 위한 음성 인식의 개선은 우선순위 목록의 상위에 오르지 못합니다.

정확하고 윤리적인 AI가 공정한 문해 능력 결과를 위해 중요한 이유

이러한 도전에도 불구하고, 음성 AI는 교실과 치료 세션에서 중요한 역할을 합니다. 읽기 평가, 초기 문해 프로그램, 학습 장애의 스크리닝 등에 사용됩니다. 그러나 정확도는 중요합니다. 한 연구에 따르면, 가장 잘 수행되는 음성 인식 시스템은 5세 어린이의 단어 중 단 18%만 정확하게 전사했습니다. 인식 오류는 교육자와 전문가가 의존하는 데이터를 왜곡할 수 있으며, 이는 어린이의 읽기 수준을 낮게 평가하거나 발달 문제나 학습 장애의 가능성을 신호하는 것을 지연시킬 수 있습니다.

음성 AI가 실패할 때, 이는 학습 결과에만 영향을 미치지 않습니다. 이는 불평등의 격차를 넓힙니다. 다양한 억양, 신경 다양성 있는 학습자, 다국어 사용자 어린이들은 음성 인식의 부정확성으로 인해 불균형적으로 영향을 받습니다. 이러한 그룹은 이미 교육과 의료에서 불균형을 경험하고 있으며, 음성 AI가 실패할 때, 이는 기존의 불균형을更加 악화시킵니다. AI 개발자들에게 이는, 정확성뿐만 아니라 공정성을 고려하여 시스템을 설계해야 함을 강조합니다.

윤리적인 고려도同等히 중요합니다. 어린이들의 데이터는 매우 민감하며, 주의와 투명한 의도를 가지고 다루어야 합니다. 많은 기존 도구는 음성 데이터를 처리하기 위해 제3자의 서버를 의존합니다. 이는 고객 서비스 챗봇에는 충분할 수 있지만, 어린 학습자에게는 전적으로 부적절합니다.幸い, 로컬 및 현지 데이터 처리가 등장하고 있으며, 이는 데이터가 장치에서 벗어나지 않으며, 데이터 수집, 타겟 광고, 보관을 제한하는 법률과 일치합니다.

목적을 위한 도구로 격차를 메우기

真正으로 어린이들을 지원하기 위해서, 음성 AI는 기본적인 전사 기능을 넘어서, 교실, 클리닉, 기타 동적 학습 환경의 실제 복잡성을 위해 설계되어야 합니다. 그 역할은 인간의 전문성을 대체하는 것이 아니라, 강화하는 것입니다. 가장 효과적인 시스템은 점수나 레이블을 할당하는 것이 아니라, 타임스탬프, 음소 수준의 전사, 주저함 지표와 같은 기능을 통해 자세하고, 실행 가능한 통찰력을 제공합니다.

교육자와 치료사에게 세부적이고 신뢰할 수 있는 데이터를 제공함으로써, AI는 전문가들이 각 어린이의 필요에 따라 정보에 기반한 결정을 내릴 수 있도록 강화할 수 있습니다. 음성 AI가 주의 깊게 설계되고 윤리적으로 개발된다면, 단순한 도구를 넘어서, 문해력, 공정성, 그리고 모든 어린이에게 의미 있는 학습 결과를 지원하는 신뢰할 수 있는 파트너가 될 수 있습니다.

Bohdan Khomych는 SoftServe의 연구개발 제품 담당 이사로, 프리미어 IT 컨설팅 및 디지털 서비스 제공업체입니다. 그는 과학자와密切하게 협력하여 인간의 발전을 위한 새로운 기술을 연구, 개발, 상업화합니다. 그의 관심 분야는 AI 에이전트, 생성적 AI, 양자 컴퓨팅, 바이오 혁신, 고성능 컴퓨팅을 포함합니다. Bohdan Khomych는 우크라이나 가톨릭 대학교에서 기술 관리 학위를, 키이우 국립 대학교에서 사이버 엔지니어링 학위를 취득했습니다.