AI 모델 및 플랫폼

새로운 AI 모델, 더 다양한 인간 언어와 협업

mm
Unite.AI를 Google의 선호 소스에 추가

워터루 대학교의 연구자들은 컴퓨터가 더 다양한 인간 언어를 처리할 수 있는 AI 모델을 개발했다. 이는 많은 언어가 프로그래밍 과정에서 자주 뒤처지는 현실을 고려할 때 중요한 발전이다. 아프리카 언어는 종종 컴퓨터 과학자들이 주목하지 않아 자연어 처리(NLP) 기능이 제한적이다.

新的 언어 모델은 워터루 대학교의 David R. Cheriton 컴퓨터 과학 학교의 연구자 팀에 의해 개발되었다.

연구는 2021년 자연어 처리에 관한 경험적 방법 회의에서 다언어 표현 학습 워크샵에서 발표되었다.

이 모델은 아프리카 언어로 된 텍스트를 분석하는 데 컴퓨터가 도움을 주는 중요한 역할을 하고 있으며, AfriBERTa라고 불린다. 이는 저자원 언어에 대한 인상적인 결과를 내기 위해 깊은 학습 기술을 사용한다.

11개 아프리카 언어와 협업

AfriBERTa는 현재 아마하어, 하우사어, 스와힐리어를 포함한 11개 아프리카 언어와 협업하며, 이는 4억 명 이상의 사람들이 사용하는 언어이다. 이 모델은 기존의 최고 모델과 비교할 수 있는 출력 품질을 보여주었으며, 1GB의 텍스트만을 학습하여 이를 달성했다. 다른 유사한 모델들은 일반적으로 훨씬 더 많은 데이터를 필요로 한다.

Kelechi Ogueji는 워터루 대학교의 컴퓨터 과학 석사 과정 학생이다.

“사전 학습 언어 모델은 기계 번역부터 질문 응답까지 다양한 작업을 위한 컴퓨터의 텍스트 처리 및 분석 방식을変革했다”라고 Ogueji는 말했다. “아프리카 언어는 연구 커뮤니티의 주목을 거의 받지 못했다.”

“한 가지 도전은 신경망이 텍스트 및 컴퓨터와 함께 빌드하는 데 매우 집요하고 집중적이라는 것이다. 그리고 영어와는 달리, 엄청난 양의 텍스트를 가지고 있는 반면, 세계에서 사용되는 7,000개 언어 중 대부분은 저자원 언어로 분류되며, 이는 신경망에 데이터를 공급하기에는 충분한 데이터가 부족하다는 것을 의미한다.”

사전 학습 기술

이러한 모델 대부분은 사전 학습 기술에 의존하는데, 이는 연구자가 모델에 일부 단어가 숨겨진 또는 마스킹된 텍스트를 제공하는 것을 포함한다. 모델은 숨겨진 단어를 추측해야 하며, 이는 수십억 번 반복된다. 결국 모델은 단어 사이의 통계적 연관성을 학습하며, 이는 인간의 언어 지식과 유사하다.

Jimmy Lin은 컴퓨터 과학의 Cheriton 의자이며 Ogueji의 지도자이다.

“특정 다운스트림 작업에 대해 정확도는 같지만 훨씬 더 작은 양의 데이터를 사용하여 사전 학습된 모델을 훈련할 수 있는 능력은 많은 이점이 있다”라고 Lin은 말했다. “모델을 훈련하는 데 필요한 데이터가 적다는 것은 계산이 적게 필요하다는 것을 의미하며, 이는 대규모 데이터 센터를 운영할 때 발생하는 탄소 배출을 줄이는 데 도움이 된다. 더 작은 데이터 세트는 데이터 큐레이션을 더 실용적으로 만들며, 이는 모델에 존재하는 편향을 줄이는 한 가지 접근 방식이다.”

“이 연구는 아프리카 대륙의 13억 명 이상의 사람들에게 자연어 처리 기능을 제공하는 데 작은 nhưng 중요한 단계를 제공한다.”

이 연구에는 워터루 대학교의 컴퓨터 과학 학사 학위를 최근 마친 Yuxin Zhu도 참여했다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.