AI 모델 및 플랫폼

DataGen, 1,800만 달러 투자 유치로 AI를 위한 합성 데이터 생성 플랫폼 개발

mm
Unite.AI를 Google의 선호 소스에 추가

이스라엘의 스타트업 회사인 DataGen은 최근 1,850만 달러의 투자를 유치하여 AI 회사들을 위한 합성 데이터 생성 플랫폼을 개발하기 위해 자금을 확보했다.

모든 인공지능 회사들은 인공지능 모델을 훈련시키기 위해 필요한 데이터를 수집하는 것과 같은核心적인 도전을 직면한다. 높은 품질의 훈련 데이터가 필요한 요구는 인공지능 회사들에게 필요한 데이터를 제공하는 하위 산업을 탄생시켰다. 인공지능 및 관련 회사들은 항상 필요한 데이터를 얻기 위한 새로운 방법을 찾고 있다. 이러한 훈련 데이터를 얻는 한 가지 방법은 데이터를 단순히 조작하거나 생성하는 것이다.

포춘誌에 따르면, DataGen은 다른 회사들이 자신의 인공지능 모델을 훈련시키기 위해 사용할 수 있는 합성 데이터를 생성하는 데 전문적인 회사이다. 특히 이미지 및 비디오 데이터를 생성한다. DataGen이 생성한 데이터는 고객사에서 자신의 인공지능 모델을 훈련시키기 위해 사용된다. DataGen의 CEO이자 설립자인 Ofir Chakon에 따르면, 회사는 고객사에게 완전히 합성된 데이터셋을 단 몇 시간 내에 생성할 수 있다. 이는 일반적으로 데이터셋을 준비하는 데 걸리는 시간, 즉 수주 또는 수개월의 데이터 레이블링 시간과 비교하면 상당히 빠르다.

합성 데이터가 회사들에게 매력적인 이유는 속도뿐만 아니라 다른 이유도 있다. 합성 데이터는 실제 데이터와 달리 개인 정보 보호 문제가 없다. 데이터 개인 정보 보호를 보호하기 위한 법률이 더 많이 만들어짐에 따라 합성 훈련 데이터가 더 매력적으로 된다. 기술 분석 회사인 가트너(Gartner)에 따르면, 2023년까지 전 세계 인구의 약 65%가 어떤 종류의 데이터 개인 정보 보호 법에 의해 보호될 것으로 예상된다.

합성 데이터는 실제 사람을 기반으로 하지 않지만, 여전히 편향될 수 있다. 합성 데이터 모델이 생성한 데이터는 원래 훈련 데이터와 같은 패턴을 가지게 된다. 즉, 데이터셋이 편향되어 있다면, 새로 생성된 데이터에도 동일한 편향이 존재할 수 있다. DataGen은 생성된 데이터의 편향을 줄이는 전략을 가지고 있다. 한 가지 방법은 상대적으로罕한 이벤트의 발생 빈도를 증가시키는 것이다. 즉, 데이터셋에서 과소 대표되는 클래스의 발생 빈도를 더 높은 수준으로 높일 수 있다.

罕한 이벤트의 발생 빈도를 높이는 기술은 잠재적으로 위험한 시나리오를 포함하는 데이터셋을 생성할 때 매우 중요하다. 자율 주행 자동차를 훈련시키는 데이터셋을 생각해 보자. 자동차는 도로에 생긴 싱크홀과 같은罕한 이벤트에 신뢰할 수 있는 방식으로 반응해야 한다. 그러나 이러한 이벤트는 매우罕하다. 이러한 이벤트에 대한 훈련 데이터를 얻는 것이 어려우므로, 이러한罕한 이벤트에 대한 훈련 데이터를 생성해야 한다.

Chakon은 포춘誌를 통해 다음과 같이 설명했다.

“우리 고객은 데이터를 생성할 때 모든 매개 변수를 완전히 제어할 수 있다. 실제로 적용했을 때, 다양한 도메인, 민족, 지리적 위치 또는 想定할 수 있는 모든 환경에서 잘 작동할 것이라는 것을 확신할 수 있다.”

DataGen은 실제 세계의 항목 및 이벤트의 현실적인 시뮬레이션을 생성하기 위해 생성적 적대 신경 네트워크(Generative Adversarial Networks, GANs)를 사용한다. Chakon은 회사가 실내 환경 또는 인간의 인식과 관련된 모든 것을 신뢰할 수 있는 방식으로 생성할 수 있다고 설명했다. 예를 들어, DataGen이 생성한 이미지 데이터셋은 로봇 픽킹 암을 훈련시키는 데 사용되는 물체의 예를 포함할 수 있으며, 생성된 이미지들은 실제와 거의 구별할 수 없다. DataGen의 소프트웨어는 시각적 메쉬워크와 물리 시뮬레이션 시스템을 결합하여 3D 객체를 생성할 수 있다.

DataGen의 투자자로는 Nvidia의 AI 연구 부서 및 막스 플랑크 지능 시스템 연구소의 책임자, 그리고 Kaggle의 CEO인 Anthony Goldbloom 등이 있다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.