AI 모델 및 플랫폼
합성 데이터는 인공 지능의 환상에 어떤 영향을 미칠까요?
합성 데이터는 강력한 도구이지만, 특정 상황에서만 인공 지능의 환상을 줄일 수 있습니다. 거의 모든 다른 경우에 대해서는 그것을 증폭시킵니다. 왜 이런 일이 발생하는 걸까요? 이것은 합성 데이터에 투자한 사람들에게 무엇을 의미할까요?
합성 데이터는 실제 데이터와 어떻게 다른가요?
합성 데이터는 인공 지능에 의해 생성된 정보입니다. 실제 세계의 사건이나 관찰에서 수집되는 것이 아니라 인공적으로 생성됩니다. 그러나 실제 데이터와 충분히 유사하여 정확하고 관련된 출력을 생성할 수 있습니다. 그것이 아이디어입니다.
인공 데이터셋을 생성하기 위해, 인공 지능 엔지니어는 실제 관계형 데이터베이스에서 생성 알고리즘을 훈련시킵니다. 요청하면 실제 데이터와 유사하지만 실제 정보를 포함하지 않는 두 번째 데이터셋을 생성합니다. 일반적인 추세와 수학적 속성은 유지되지만, 원래의 관계를 가리기 위해 충분한 노이즈가 있습니다.
인공 생성 데이터셋은 비식별화를 넘어섰습니다. 필드 간의 관계의 기본 논리를 복제하여 단순히 필드를 대체하는 대신 실제 데이터의 논리를 복제합니다. 식별 가능한 세부 정보가 포함되지 않기 때문에 회사에서 개인 정보 및 저작권 규정을 회피하기 위해 사용할 수 있습니다. 더 중요한 것은 무료로 공유하거나 배포할 수 있으며 보안 위반이 걱정되지 않습니다.
그러나 가짜 정보는 보충에 더 자주 사용됩니다. 비즈니스에서 실제 데이터가 너무 작을 때 이를 확장하거나 풍부하게 할 수 있습니다. 이를 통해 인공 지능 시스템을 효과적으로 훈련시킬 수 있습니다.
합성 데이터는 인공 지능의 환상을 최소화할 수 있나요?
때때로, 알고리즘은 존재하지 않는 이벤트를 참조하거나 논리적으로 불가능한 제안을 합니다. 이러한 환상은 종종 무의미하거나 잘못되거나 부정확합니다. 예를 들어, 대규모 언어 모델은 사자驯化 또는 6세에 의사가 되는 방법에 대한 자습서를 작성할 수 있습니다. 그러나 모두 이러한 극단적인 경우는 아니며, 이는 이를 인식하기 어렵게 만들 수 있습니다.
적절하게 큐레이션된 경우, 인공 데이터는 이러한 사건을 완화할 수 있습니다. 관련된 실제 훈련 데이터베이스는 모든 모델의基础입니다. 따라서 누군가가 더 많은 세부 정보를 가지고 있다면, 모델의 출력이 더 정확할 것입니다. 보충 데이터셋은 확장성을 가능하게 합니다. 공공 정보가 제한된 니치 응용 프로그램에서도 마찬가지입니다.
디바이싱은 또 다른 방법으로 인공 데이터베이스를 통해 인공 지능의 환상을 최소화할 수 있습니다. MIT 슬론 경영 대학에 따르면, 편향을 해결하는 데 도움이 될 수 있습니다. 실제 샘플 크기에 제한되지 않기 때문입니다. 전문가들은 실제 세부 정보를 사용하여 서브 인구 통계가 과소 대표되거나 과다 대표되는 간격을 채울 수 있습니다.
인공 데이터는 인공 지능의 환상을 어떻게 악화시킬까요?
지능형 알고리즘은 정보를 이유나 맥락화할 수 없습니다. 따라서 환상에 취약합니다. 생성 모델, 특히 대규모 언어 모델은 특히 취약합니다. 어떤 면에서 인공 사실은 문제를 악화시킵니다.
편향 증폭
인간과 마찬가지로, 인공 지능은 편향을 학습하고 재생산할 수 있습니다. 인공 데이터베이스가 일부 그룹을 과대평가하고 다른 그룹을 과소평가하는 경우(이는 우려스럽게도 쉽게 발생할 수 있음) 의사 결정 논리는歪曲되어 출력 정확도가 부정적으로 영향을 받습니다.
유사한 문제가 발생할 수 있습니다. 회사에서 실제 세계의 편향을 제거하기 위해 가짜 데이터를 사용하는 경우, 이는 더 이상 현실을 반영하지 않을 수 있습니다. 예를 들어, 유방암의 99% 이상이 여성에서 발생하기 때문에, 보충 정보를 사용하여 대표성을 균형잡히게 할 수 있습니다. 그러나 이는 진단을歪曲시킬 수 있습니다.
교차 환상
교차성은 사회학적 프레임워크로, 연령, 성별, 인종, 직업 및 계층과 같은 인구 통계가 어떻게 교차하는지 설명합니다. 이는 그룹의 사회적 정체성이 어떻게 겹치며, 이를 통해 고유한 차별과 특권의 조합이 어떻게 발생하는지 분석합니다.
생성 모델이 훈련에 사용된 내용을 기반으로 인공 세부 정보를 생성하도록 요청하면, 실제 데이터에不存在하거나 논리적으로 불가능한 조합을 생성할 수 있습니다.
링코핑 대학교의 젠더 및 사회 교수인 에리카 존슨은 기계 학습 과학자와 함께 이 현상을 보여주기 위해 협력했습니다. 그들은 1990년 미국 인구 통계 데이터의 인공 버전을 생성하기 위해 적대적 생성 네트워크를 사용했습니다.
すぐ에, 그들은 명백한 문제를 발견했습니다. 인공 버전에는 “아내와 미혼” 및 “결혼하지 않은 남편”이라는 카테고리가 있었습니다. 이는 모두 교차 환상이었습니다.
適切한 큐레이션이 없는 경우, 복제 데이터셋은 항상 데이터셋의 지배적인 서브 인구 통계를 과대평가하고, 과소 대표되거나 제외된 그룹을 과소평가할 것입니다. 에지 케이스와 아웃라이어는 지배적인 추세를 위해 무시될 수 있습니다.
모델 붕괴
인공 패턴과 추세에 대한 과도한 의존은 모델 붕괴로 이어집니다. 알고리즘의 성능이 현실 세계의 관찰과 사건에 대한 적응성이 떨어지면서 급격히恶化합니다.
이 현상은 특히 차세대 생성 인공 지능에서 명확합니다. 반복적으로 인공 버전을 사용하여 훈련하면, 자기 소비 루프가 발생합니다. 한 연구에 따르면, 최근 실제 데이터가 충분하지 않은 경우, 각 세대에서 품질과 리콜이 점진적으로 악화됩니다.
과적합
과적합은 훈련 데이터에 대한 과도한 의존입니다. 알고리즘은 초기에 잘 수행하지만, 새로운 데이터 포인트가 주어지면 환상을 일으킵니다. 인공 정보는 현실을 정확하게 반영하지 않는 경우, 이 문제를 악화시킬 수 있습니다.
계속해서 합성 데이터를 사용하는 의미
합성 데이터 시장은 번창하고 있습니다. 이 분야의 회사들은 2022년에 약 3억 2,800만 달러를 모금했습니다. 이는 2020년의 5,300만 달러에서 518% 증가한 것입니다. 이는 공개적으로 알려진 자금만을 나타내므로, 실제 금액은 더 높을 수 있습니다. 회사들이 이 솔루션에 매우 투자하고 있음을 알 수 있습니다.
회사들이 적절한 큐레이션과 디바이싱 없이 인공 데이터베이스를 계속 사용하는 경우, 모델의 성능은 점진적으로恶化할 것입니다. 이는 투자한 인공 지능에 대한 성과를 떨어뜨릴 것입니다. 결과는 응용 프로그램에 따라 더 심각할 수 있습니다. 예를 들어, 의료 분야에서 환상이 증가하면, 잘못된 진단 또는 부적절한 치료 계획으로 이어질 수 있으며, 이는 환자의 결과를 악화시킬 수 있습니다.
해결책은 실제 데이터로 돌아가는 것이 아닙니다.
인공 지능 시스템은 훈련을 위해 수백만, 아니면 수십억 개의 이미지, 텍스트 및 비디오가 필요합니다. 이는 대부분 공개 웹사이트에서 스크랩되어 대규모 공개 데이터셋으로 컴파일됩니다. 불행히도, 알고리즘은 인간이 생성할 수 있는 것보다 더 빠르게 이러한 정보를消費합니다. 알고리즘이 모든 것을 학습하면 어떻게 될까요?
비즈니스 리더들은 데이터 벽에 부딪히는 것을 걱정합니다. 데이터 벽은 인터넷에 있는 모든 공공 정보가 소진된 시점입니다. 이는 생각보다 더 빨리 다가올 수 있습니다.
평균적인 일반 크롤 웹페이지의 평문 양과 인터넷 사용자 수는 매년 2%에서 4%씩 증가하고 있지만, 알고리즘은 높은 품질의 데이터를 소진하고 있습니다. 훈련에 사용할 수 있는 데이터는 10%에서 40%에 불과합니다. 추세가 계속된다면, 2026년까지 인간이 생성한 공공 정보 재고가 소진될 수 있습니다.
인공 지능 분야는 데이터 벽에 훨씬 더 빨리 도달할 수 있습니다. 최근 몇 년 동안의 생성 인공 지능 붐은 정보 소유권과 저작권 침해에 대한 긴장을 고조시켰습니다. 더 많은 웹사이트 소유자는 로봇 제외 프로토콜을 사용하거나 사이트가 크롤링에 닫혔음을 명확히 하고 있습니다.
2024년 MIT 주도 연구 그룹에 의해 발표된 연구에 따르면, 대규모 웹 크롤 코퍼스인 Colossal Cleaned Common Crawl (C4) 데이터셋의 제한은 증가하고 있습니다. C4의 가장 활동적인 중요 소스 중 28% 이상이 완전히 제한되었습니다. 또한, C4의 45%는 서비스 약관에 의해 금지되었습니다.
회사들이 이러한 제한을 존중한다면, 실제 세계의 사실의 신선도, 관련성 및 정확도가 떨어질 것입니다. 따라서 인공 데이터베이스를 사용해야 할 수 있습니다. 대체재가 저작권 침해로 판결될 경우, 선택의 여지가 없을 수 있습니다.
합성 데이터와 인공 지능의 미래
저작권법이 현대화되고, 더 많은 웹사이트 소유자가 웹 크롤러에서 콘텐츠를 숨길 때, 인공 데이터셋 생성은 점점 더 인기를 얻을 것입니다. 조직은 환상의 위협에 대비해야 합니다.












