AI 모델 및 플랫폼
애플린 리미티드, 자연어 처리를 위한 다양한 데이터 트레이닝 세트 출시
애플린 리미티드, 대규모 AI 시스템을 구축하려는 기업을 위한 고품질 트레이닝 데이터를 제공하는 선도적인 기업은 새로운 자연어 처리(NLP) 이니셔티브를 위한 다양한 트레이닝 데이터셋을 출시하고 있습니다. 이러한 데이터셋을 통해 최종 사용자는 언어 변형, 방언, 민족어, 억양, 인종 또는 성별에 관계없이 동일한 경험을 받을 수 있습니다.
2020년 3월 PNAS의 보고서에 따르면, 가상 어시스턴트, 자막, 손가락 없는 컴퓨팅을 위한 자동 음성 인식(ASR) 시스템과 같은 인기 있는 자동 음성 인식 시스템은 특히 인종에 따른 성능 차이를 보입니다. 이것은 시스템이 편향되거나 불완전한 데이터에 기반하고 있기 때문입니다. 따라서 다양한 트레이닝 세트를 개발하는 것이 매우 중요합니다.
새로운 출시로 애플린은 성능 차이를 줄이고 음성 인식 기술에 대한 더 包容적인 환경을 만들고자 합니다. 언어 해석과 NLP 시스템에서도 동일한 종류의 도전이 존재합니다.
마크 브라이언은 애플린의 CEO입니다.
“트레이닝 데이터의 품질과 다양성은 AI 모델의 성능과 편향에 직접적인 영향을 미칩니다”라고 브라이언은 말했습니다. “데이터 파트너로서, 우리는 다양한 사용 사례에 대한 완전한 트레이닝 데이터를 제공하여 AI 모델이 모든 사람에게 작동하도록 할 수 있습니다. 데이터를 생성, 레이블링 및 검증하기 위해 다양한 개인을 참여시키는 것이 중요합니다. 이를 통해 모델이 책임감 있게 구축되고 공정한지 확인할 수 있습니다”
애플린 언어 프로젝트
애플린은 다양한 프로젝트와 파트너십을 통해 다양한 AI 환경을 만들고자 합니다. 이러한 프로젝트와 파트너십에는 다음이 포함됩니다.
- 번역자 없이 국경 (TWB) 파트너십: 애플린은 TWB, 아마존, 카네기 멜런 대학교, 페이스북, 구글, 존스 홉킨스 대학교, 마이크로소프트, 트랜스레이티드와 파트너십을 맺었습니다. 이 파트너십은 COVID-19 번역 이니셔티브 (TICO-19)에 tham gia했습니다. TICO-19는 여러 언어에서 언어 기술을 개발하여 COVID-19 정보에 대한 접근성을 확대하려고 합니다. 이러한 언어에는 콩고 스와힐리, 티그리냐, 나이지리아 풀풀데 등이 포함됩니다.
- 캐나다 프랑스어 번역 프로젝트: 애플린은 마이크로소프트와 협력하여 마이크로소프트 번역기에 “캐나다 프랑스어”를 언어 옵션으로 추가했습니다.
- 이누크티투트 번역 프로젝트: 애플린은 누나부트 정부와 협력하여 마이크로소프트 번역기에 이누크티투트를 추가했습니다. 이누크티투트는 캐나다 북극에서 사용되는 원주민 언어입니다.
- 아프리카계 미국인 방언 (AAVE) 오프-더-셸프 데이터셋: 애플린은 AAVE 사용자와 다양한 주제에 대한 대화 데이터를 수집하여 AAVE를 대표하는 새로운 트레이닝 데이터셋을 만들고 있습니다.
ジュ디스 비숍 박사는 애플린의 AI 전문가 시니어 디렉터입니다.
“편향된 AI 데이터는 예상된 비즈니스 결과를 달성하지 못하고 해당 사용자에게 해를 끼칠 수 있습니다”라고 비숍 박사는 말했습니다. “AI 프로젝트의 규모와 복잡성으로 인해 대부분의 기업은 편향되지 않은 고품질 데이터를 구입하기 위해 AI 데이터 전문가와 파트너십을 맺지 않고는 충분한 양의 데이터를 구입할 수 없습니다. 애플린은 가장 다양한 전문 데이터 어노테이터 그룹을 개발하여 산업계에 책임감 있게 구축된 공정한 AI 프로젝트를 위한 명확하게 구분된 자원을 제공하고 있습니다”
애플린은 170개 이상의 국가에서 데이터 어노테이터의 도움을 받고 있으며, 언어 표현에는 235개의 고유 언어와 395개의 방언이 포함됩니다. 또한 오프-더-셸프(OTS) 데이터셋을 제공하여 기업이 더 빠르게 고품질 트레이닝 데이터를 구입할 수 있도록 합니다.












