사상 리더

합성 데이터의 부상, 그리고 왜 그것은 실제 데이터를 대체하기보다는 보완할 것인가

mm
Unite.AI를 Google의 선호 소스에 추가

엘론 머스크는 최근에 인공지능 모델을 훈련하기 위한 인간 데이터가 고갈되었다고 선언했다. 그의 경고는 인공지능이 계속 빠르게 발전하려면 새로운 데이터 소스가 필요하다는 최근의 논평 중 하나이다. 의료와 금융 gibi 산업에서 엄격한 개인 정보 보호 규정으로 인해 데이터 부족이更加 심각해지고 있다.

합성 데이터는 이러한 부족을 해결할 수 있는 가능한 솔루션이다. 합성 데이터의 중요성은 최근의 합병과 투자로증명되고 있다. 그러나 합성 데이터의 사용에는 모델 붕괴라는 심각한 문제가 있다. 모델 붕괴는 다중 모달 대규모 언어 모델(LLM)의 출력 품질이 실제 데이터 없이 훈련될 때 저하되는 현상이다. 이 문제가 해결되거나 지속되면 인공지능의 미래에 큰 영향을 미칠 수 있다.

합성 데이터란 무엇이며, 어떻게 생성되는가?

합성 데이터는 실제 이벤트에서 수집된 데이터가 아니라 인공적으로 생성된 데이터이다. 현재 가장 널리 사용되는 합성 데이터는 인공지능 생성 합성 데이터로, 실제 데이터에서 패턴과 상관관계를 학습한 후 이를 모방하는 새로운 데이터를 생성하는 방식이다.

LLM은 다양한 유형의 합성 데이터를 생성하는 데 사용되고 있다. 구조화된 데이터인 표 데이터와 비정형 데이터인 자유 텍스트, 비디오, 이미지 등이 포함된다. 데이터 유형에 따라 다양한 방법이 사용된다.

예를 들어, 합성 이미지 데이터를 생성하는 두 가지 일반적인 방법은 GAN과 확산 모델이다. GAN은 실제 데이터의 인공 버전을 생성하는 생성자와 실제와 생성된 데이터를 구분하는 판별자를 사용한다. 생성자는 판별자를 속이려고 계속해서 실제 데이터와 유사한 데이터를 생성한다. 확산 모델은 실제 데이터를 왜곡한 후 이를 역전환하여 “denoise”하는 접근 방식을 사용한다. 효과적으로 훈련되면 높은 품질의 합성 오디오와 비주얼 데이터를 생성할 수 있다.

합성 데이터의 중요성

합성 데이터에 대한 관심은 오래전부터 존재했다. 그러나 최근 5년 동안 LLM의 빠른 발전으로 합성 데이터에 대한需求이 증가하고, 합성 데이터를 생성하는 효과적인 방법이 더욱 발전했다. 결과적으로 합성 데이터의 사용은 폭발적으로 증가했다.

가트너는 2021년에 합성 데이터가 2024년까지 LLM 훈련에 사용되는 모든 데이터의 60%를 차지할 것으로 예측했다. 이는 2021년에 1%에서 크게 증가한 것이다. 예를 들어, 마이크로소프트의 Phi-4 모델은 다른 LLM보다 작지만 더 나은 성능을 보이며, 대부분 합성 데이터로 훈련되었다. 한편, 아마존의 알렉사 엔지니어들은 “교사/학생” 모델을 사용하여 합성 데이터를 생성하는 방법을 연구하고 있다.

이러한 광범위한 채택은 시장에서 주요 동향으로 반영되고 있다. 합성 데이터 부문은 2021-22년에 투자 붐을 경험했다. Gretel AITonic.ai는 각각 5000만 달러와 3500만 달러의 시리즈 B 라운드를 마쳤다. 이후 MOSTLY AI는 2500만 달러의 시리즈 B 라운드를 마쳤고, Synthesis AI는 1700만 달러의 시리즈 A 자금을 확보했다.

최근에는 대규모 인수를 통해 이러한 추세가 이어지고 있다. NVIDIA의 Gretel 인수는 기술巨자自己的 연구를 지원할 것이다. 마찬가지로, AI 솔루션 회사 SAS는 2024년 11월에 합성 데이터 스타트업 Hazy를 인수했다.

분석 회사 Cognilytica는 2021년에 합성 데이터 생성 시장의 규모가 약 1.1억 달러였으며, 2027년까지 11.5억 달러로 증가할 것으로 예측했다. 다른 예측은 이 부문의 연평균 성장률이 31%로, 2030년까지 23.3억 달러의 가치에 이를 것으로 전망한다.

모델 붕괴

그러나 합성 데이터의 흥미로운 잠재력은 모델 붕괴라는重大한 단점을 가지고 있다. 모델 붕괴는 합성 데이터만으로 훈련된 LLM이 출력의 정밀도 또는 다양성이 저하되는 현상이다.

실제 데이터는 복잡도가 높지만, 합성 데이터는 모델에 의해 간소화되고 축소된다. 예를 들어, 연구자들은 합성 훈련 데이터의 양이 증가할수록 모델의 정확도가 저하된다는 것을 발견했다. OXFORD, Cambridge, Imperial College, Toronto 대학의 학자들이 수행한 연구에 따르면, 모델 생성 데이터를 무분별하게 사용하면 결과 모델에 “영구적인 결함”이 발생할 수 있다.

さらに, 대부분의 LLM은 “블랙 박스”로, 합성 데이터에 어떻게 반응할지 이해하기 어렵다. Rice University와 Stanford 연구자들은 실제 데이터 없이, “미래의 생성 모델은 품질(정밀도) 또는 다양성(리콜)이 점진적으로 저하될 수밖에 없다”고 결론지었다.

실제 데이터의 지속적인 필요성

합성 데이터의需求이 증가함에도 불구하고, 실제 데이터의 필요성은 여전히 남아 있다. 실제로, 실제 데이터의 품질이 높은 훈련 데이터의需求은 증가할 수 있다. 그 이유는 두 가지이다. 첫째, 실제 데이터는 합성 데이터를 생성하는 AI 모델을 훈련하는 데 필요하다. 둘째, 모델 붕괴를 피하기 위해서는 합성 데이터를 실제 데이터와 지속적으로 동기화하는 것이 필요하다.

합성 데이터 생성을 위한 실제 데이터

위에서 언급한 대로, 현재 대부분의 합성 데이터는 생성 인공지능을 사용하여 생성된다. 이러한 생성 인공지능 모델은 실제 데이터로 훈련되어야 한다. 실제 데이터는 합성 데이터를 생성하는 데 필요하다.

모델 붕괴를 방지하기 위한 실제 데이터

모델 붕괴를 방지하기 위한 여러 전략이 있다. 이러한 전략에는 합성 데이터셋을 검증하고 정기적으로 검토하는 것이 포함된다. 그러나 가장 일반적인 접근 방식은 데이터를 다양화하는 것이다. Gartner의 조사에 따르면, 63%의 응답자는 부분적으로 합성 데이터셋을 사용하는 것을 선호하며, 13%만이 완전히 합성 데이터를 사용한다.

실제 데이터를 조금만 추가해도 모델의 성능을 크게 향상시킬 수 있다. 남가주 대학교 연구자들은 실제 데이터의 90%를 합성 데이터로 대체해도 성능에 큰 영향을 미치지 않는다는 것을 발견했다. 그러나 마지막 10%의 실제 데이터를 대체하면 성능이 크게 저하된다.

품질도 중요하다. 마이크로소프트의 Phi-4 성공 사례를 보자. 이 LLM은 주로 GPT-4o로 생성된 합성 데이터로 훈련되었다. 그러나 사전 훈련 데이터는 실제 데이터로 구성되었다.

합성 데이터가 가져올 수 있는 잠재적인 이점

합성 데이터를 지능적으로 사용하고, 실제 데이터와 효과적으로 결합하면, 6가지 특정한 문제를 해결할 수 있다: 데이터 부족, 데이터 접근성, 데이터 동질성, 편향, 개인 정보 보호 문제, 비용.

데이터 부족

AI 회사들은 시장 점유율을 얻고 새로운 성과를 달성하기 위해 데이터를 필요로 한다. 합성 데이터는 이러한 격차를 메울 수 있다.

데이터 접근성

대규모 기술 회사들은 데이터에 대한 게이트 키퍼로 작용하여, 작은 회사들의 진입 장벽을 높이고 있다. 합성 데이터는 인공지능을 민주화하여, 대규모 훈련 데이터를 저렴하고 접근하기 쉽게 만들 수 있다.

데이터 동질성

일부 특수한 경우, 실제 데이터셋은 너무 동질적이다. 합성 데이터는 이러한 격차를 메울 수 있다.

편향

일부 실제 데이터셋은 내재된 편향을 가지고 있다. 합성 데이터는 이러한 편향을 보완할 수 있다.

개인 정보 보호

의료와 금융 gibi 분야에서 개인 정보 보호 요구 사항이 데이터 부족을 더욱 심각하게 만들고 있다. 합성 데이터를 사용하면 고객의 개인 정보를 침해하지 않고, 훈련 데이터셋을 구축할 수 있다.

비용

일반적으로 합성 데이터는 실제 데이터보다 저렴하게 생성된다. 또한, 합성 데이터는 이미 레이블이 지정되어 있기 때문에, 데이터 준비 시간과 비용을 절약할 수 있다.

실제 데이터를 대체하기보다는 보완하기

합성 데이터의 이러한 이점을 활용하기 위해서는, 실제 데이터를 대체하는 것이 아니라, 보완하는 방식으로 사용해야 한다.

예를 들어, 메타의 새로운 LLM, LLAMA Behemoth는 30조 개의 데이터 포인트로 훈련되고 있다. 실제 데이터를 이러한 규모로 찾는 것은 어려울 수 있다. 그러나 실제 데이터는 여전히 필요하다. 합성 데이터는 실제 데이터를 보완하여, 더 많은 데이터 포인트를 제공할 수 있다.

13년 이상 동안, Gediminas Rickevicius는 세계적으로 선도적인 IT, 광고, 물류 회사에서 성장의 원동력이 되었습니다. 그는 전통적인 비즈니스 개발과 판매 접근 방식을 대형 데이터를 전략적 의사 결정에 통합함으로써 변화시키고 있습니다. Oxylabs의 글로벌 파트너십 부사장으로서, Gediminas는 기업들이 최신의 공개 웹 데이터 수집 솔루션을 통해 강화하는 그의 임무를 계속하고 있습니다.