사상 리더

머신러닝을 위한 인간 데이터 준비는 자원 집약적입니다: 비용을 줄이기 위한 두 가지 접근법

mm
Unite.AI를 Google의 선호 소스에 추가

작성자: Dattaraj Rao, Chief Data Scientist, Persistent Systems

데이터 입력에 의존하는 모든 시스템과 마찬가지로, 머신러닝(ML)은 “쓰레기 입력-쓰레기 출력”의 공리를 따릅니다. 깨끗하고 정확하게 레이블이 지정된 데이터는 모든 ML 모델을 구축하는 데 필요한 기초입니다. ML 훈련 알고리즘은 근본적인 데이터에서 패턴을 이해하고, 그로부터 보지 못한 데이터에 대해 일반화하는 방법을 학습합니다. 훈련 데이터의 품질이 낮으면, ML 알고리즘이 지속적으로 학습하고 외삽하는 것이 매우 어려울 것입니다.

반려견을 훈련시키는 것과 같은 관점에서 생각해 보십시오. 기본적인 행동 명령(입력)을 제대로 훈련하지 않거나 부정확하게 훈련하면, 반려견이 관찰을 통해 더 복잡한 긍정적인 행동을 학습하고 확장하는 것을 기대할 수 없습니다. 올바른 훈련은 시간이 많이 걸리고, 전문가를 고용하면 비용이 많이 들 수 있지만, 처음부터 올바르게 훈련하면 보상은 크습니다.

ML 모델을 훈련할 때, 높은 품질의 데이터를 생성하려면 도메인 전문가가 데이터를 주석으로 표시하는 데 시간을 투자해야 합니다. 이는 이미지에서 원하는 객체가 포함된 창을 선택하거나, 텍스트 항목 또는 데이터베이스 레코드에 레이블을 할당하는 것을 포함합니다. 특히 이미지, 비디오, 텍스트와 같은 비정형 데이터의 경우, 주석의 품질은 모델의 품질을 결정하는 데 중요한 역할을 합니다. 일반적으로, 레이블이 없는 데이터인 원시 이미지와 텍스트는 풍부하지만, 레이블을 지정하는 데 노력이 필요합니다. 이것은 ML 라이프 사이클의 인간이 관여하는 부분이며, 일반적으로 가장 비용이 많이 들고 노동 집약적인 부분입니다.

데이터 주석 도구인 Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS, DataRobot human-in-the-loop은 품질이 지속적으로 개선되고, 도메인 전문가에게 직관적인 인터페이스를 제공합니다. 그러나 도메인 전문가가 데이터를 주석으로 지정하는 데 필요한 시간을 최소화하는 것은 오늘날 기업들에게 여전히重大한 도전입니다. 특히 데이터 과학 전문가가 제한적이고 수요가 높은 환경에서 더욱如此입니다. 이것은 두 가지 새로운 데이터 준비 접근법이 등장하는 배경입니다.

액티브 러닝

액티브 러닝은 ML 모델이 도메인 전문가에게 특정 주석을 요청하는 방법입니다. 여기서 주목的是 완전한 주석을 얻는 것이 아니라, 모델이 더 잘 학습할 수 있도록 올바른 데이터 포인트를 주석으로 지정하는 것입니다. 예를 들어, 의료 및 생명 과학 분야에서, 조기 암 감지를 위해 임상 의사에게 데이터 기반 의사 결정에 도움을 주는 진단 회사입니다. 그들의 진단 과정에서, 암을 강조해야 하는 종양 블록이 있는 CT 스캔 이미지를 주석으로 지정해야 합니다.

ML 모델이 몇 개의 이미지를 학습한 후, 종양 블록이 표시된 후, 액티브 러닝을 사용하면 모델은 사용자에게 불확실한 이미지에 대한 주석을 요청합니다. 이러한 경계 포인트는 주석이 지정되면 모델의 신뢰도를 높입니다. 모델이 특정 임계値 이상에서 확신이 서면, 사용자에게 주석을 요청하는 대신 자체 주석을 수행합니다. 이것은 액티브 러닝이 정확한 모델을 구축하는 동시에 데이터 주석에 필요한 시간과 노력을 줄이는 방법입니다. modAL과 같은 프레임워크는 도메인 전문가를 지능적으로 조회하여 가장 정보가 풍부한 인스턴스를 레이블로 지정하여 분류 성능을 향상시킬 수 있습니다.

약한 감독

약한 감독은 노이즈가 많은 불확실한 데이터 또는 추상적인 개념을 사용하여大量의 비감독 데이터에 대한 레이블을 제공하는 접근법입니다. 이 접근법은 일반적으로 약한 레이블러를 사용하고, 이를 앙상블 접근법으로 결합하여 높은 품질의 주석이 지정된 데이터를 구축하려고 시도합니다. 노력은 자동 레이블링 활동에 도메인 지식을 통합하는 것입니다.

예를 들어, 인터넷 서비스 제공업체(ISP)가 스팸이 아니면 스팸인지 여부를 구분하는 이메일 데이터 세트를 플래그해야 하는 시스템이 필요하다면, “제안”, “축하”, “무료”와 같은 구절을 확인하는 약한 규칙을 작성할 수 있습니다. 이러한 약한 규칙은 Snorkel 및 Skweak과 같은 약한 감독 프레임워크를 사용하여 결합되어 높은 품질의 훈련 데이터를 구축할 수 있습니다.

ML의 핵심은 기업들이 수동으로 달성할 수 없는 방식으로 프로세스를 기하급수적으로 확장하는 데 도움을 주는 것입니다. 그러나 ML은 마법이 아니며, 여전히 모델을 올바르게 설정하고 훈련하는 데 인간의 개입이 필요하며, 모델이 너무歪曲되어 결과가 더 이상 유용하지 않거나 부정적인 경우에 필요합니다.

목표는 인간의 개입의 일부를 스트림화하고 자동화하여 시간을 절약하고 결과를 향상시키는 방법을 찾는 것입니다. 그러나 최적의 정확성을 유지하는 경계 안에서 이러한 목표를 달성해야 합니다. 높은 품질의 주석이 지정된 데이터를 얻는 것이 가장 비용이 많이 들고, 매우 중요한 ML 프로젝트의 부분이라는 것은 널리 인정받고 있습니다. 이것은不断으로 발전하는 분야이며, 도메인 전문가가 데이터 주석에 소요하는 시간을 줄이고 데이터 주석의 품질을 향상시키기 위한 많은 노력이 진행 중입니다. 액티브 러닝과 약한 감독을 탐색하고 활용하는 것은 여러 산업과 사용 사례에서 이를 달성하는ための 견고한 전략입니다.

Dattaraj Rao, Persistent Systems의 Chief Data Scientist는 “Keras to Kubernetes: The Journey of a Machine Learning Model to Production”이라는 책의 저자입니다. Persistent Systems에서 Dattaraj는 컴퓨터 비전, 자연어 이해, 확률적 프로그래밍, 강화 학습, 설명 가능한 AI 등 최첨단 알고리즘을 탐구하는 AI 연구소를 이끌며 의료, 금융, 산업 분야에서 적용 가능성을 보여줍니다. Dattaraj는 기계 학습과 컴퓨터 비전 분야에서 11개의 특허를 보유하고 있습니다.