사상 리더

더러운 데이터의 높은 비용: AI 개발의 도전

mm
Unite.AI를 Google의 선호 소스에 추가

AI 개발에서 현대적인 금 러시가 진행 중이라는 것은 비밀이다. 마이크로소프트와 링크드인의 2024년 워크 트렌드 인덱스에 따르면, 40% 이상의 비즈니스 리더들은 향후 몇 년 내에 인공 지능(AI)을 사용하여 비즈니스 프로세스를 근본적으로 재설계할 것으로 예상한다. 이 심각한 변화는 기술적인 업그레이드만이 아니라 비즈니스 운영, 의사 결정, 고객과의 상호 작용의 근본적인 변환이다. 이 급격한 발전은 데이터 및 첫 번째 파티 데이터 관리 도구에 대한 수요를 창출하고 있다. 포레스터에 따르면, 기술 리더의 92%가 2024년에 데이터 관리 및 AI 예산을 증가시킬 계획이라고 한다.

(MSFT )

최근 맥킨지 글로벌 서베이에 따르면, 65%의 응답자가 자신의 조직이 생성된 AI 기술을 정기적으로 사용하고 있다고回答했다. 이 채택은 큰 발전을 의미하지만, 또한 중요한 도전을 강조한다. 즉, 이러한 AI 시스템에 공급되는 데이터의 품질이다. 효과적인 AI는 데이터의 품질에만큼 좋은 만큼 좋다는 산업에서, 신뢰할 수 있고 정확한 데이터를 얻는 것이 점점 더 어려워지고 있다.

나쁨 데이터의 높은 비용

나쁨 데이터는 새로운 문제가 아니다. 그러나 그 영향은 AI 시대에 커진다. 2017년에 매사추세츠 공과 대학(MIT)이 수행한 연구에 따르면, 나쁨 데이터는 회사에惊くほど 15%에서 25%의 수익을 비용으로 들인다고 추정했다. 2021년에 가트너는 나쁨 데이터가 조직에 평균적으로 연간 12.9백만 달러의 비용을 초래한다고 추정했다.

더러운 데이터-불완전한 데이터, 부정확한 데이터, 일관성이 없는 데이터-는 AI 시스템에 연쇄적인 영향을 미칠 수 있다. AI 모델이 나쁨 데이터에훈련될 때, 결과적인 통찰력과 예측은 근본적으로 결함이 있다. 이것은 AI 응용 프로그램의 효율성을 저하할 뿐만 아니라, 이러한 기술에 의존하는 비즈니스에重大な 위험을 초래한다.

이것은 기업의 데이터 과학 팀에게 주요한 문제를 야기한다. 최근 DBT의 상태 보고서에 따르면, 데이터 과학 전문가의 57%가 데이터 품질이 자신의 업무에서 주요 문제라고回答했다.

AI 모델에 대한 영향

나쁨 데이터의 영향은 세 가지 주요 방식으로 나타난다.

  1. 정확성과 신뢰성의 저하: AI 모델은 데이터에서 파생된 패턴과 상관관계에 달려 있다. 입력 데이터가 오염되면, 모델은 신뢰할 수 없는 출력을 생성한다. 이것은 잘못된 전략, 제품 실패, 고객의 신뢰 상실을 초래할 수 있다.
  2. 편향의 증폭: 더러운 데이터는 종종 편향을 포함한다. 이러한 편향이 제어되지 않으면, AI 알고리즘에 내재된다. 이것은 고용, 대출, 법 집행과 같은 민감한 분야에서 차별적인 관행을 초래할 수 있다.
  3. 운영 비용의 증가: 결함이 있는 AI 시스템은不断한 수정과 재훈련을 필요로 한다. 이것은 추가적인 시간과 자원을 소모한다. 기업은 오류를 수정하는 대신 혁신하고 개선하는 것을 계속해야 한다.

데이터파칼립스

“우리는 ‘临界点’에 접근하고 있다. 여기서 비인간이 생성한 콘텐츠가 인간이 생성한 콘텐츠를 훨씬 능가할 것이다. AI 자체의 발전은 데이터 정제와 검증을 위한 새로운 도구를 제공하고 있다. 그러나 웹上的 AI 생성 콘텐츠의 양은 지수적으로 증가하고 있다.

AI 생성 콘텐츠가 웹에 더 많이 공급될수록, 그리고 이러한 콘텐츠가 AI 생성 콘텐츠에훈련된 LLM에 의해 생성될수록, 우리는 첫 번째 파티 데이터와 신뢰할 수 있는 데이터가 위협을 받고贵重한 자원이 되는 미래를 맞이할 것이다.

데이터 희석의 도전

AI 생성 콘텐츠의 확산은 주요 산업 도전에 대한 몇 가지를 야기한다.

  • 품질 관리: 인간이 생성한 데이터와 AI가 생성한 데이터를 구별하는 것이 점점 더 어려워진다. 따라서 AI 모델을 훈련하는 데 사용되는 데이터의 품질과 신뢰성을 보장하는 것이 더 어려워진다.
  • 지적 재산권 문제: AI 모델이 AI 생성 콘텐츠에서 학습하고 스크레이핑할 때, 데이터의 소유권과 권한에 대한 질문이 제기된다. 이것은 법적 복잡성을 초래할 수 있다.
  • 윤리적 영향: 데이터의 기원이 투명하지 않으면, 잘못된 정보의 확산이나 편향의 강화와 같은 윤리적인 문제가 발생할 수 있다.

데이터를 서비스로서 제공

데이터를 서비스로서 제공하는 솔루션은 점점 더 많이 채택되고 있다. 이러한 솔루션은 첫 번째 파티 데이터를 보완하고 강화하는 데 사용된다. 데이터를 서비스로서 제공하는 솔루션의真正한 가치는 데이터 자체가 정규화되고, 정제되고, 평가된 후에 다양한 신뢰도와 상업적 적용 사례에 대한 표준화된 프로세스를 통해 시스템이 데이터를消化하는 것이다. 이 산업이 성숙함에 따라, 우리는 데이터 산업 전반에 걸쳐 이러한 표준화를 볼 수 있을 것이다. 이미 소매 미디어 부문에서 이러한 통일성을 위한 추진을 보이고 있다.

AI가 다양한 산업을 침투함에 따라, 데이터 품질의 중요성은 더욱 강조될 것이다. 깨끗한 데이터에 우선순위를 둔 기업은 경쟁 우위를 점할 수 있을 것이다. 그러나 데이터 품질을 무시하는 기업은 빠르게 뒤처질 것이다.

AI 개발에서 더러운 데이터의 높은 비용은 무시할 수 없는 문제이다. 나쁨 데이터 품질은 AI 시스템의 기반을 훼손하고, 결함이 있는 통찰력, 증가한 비용, 그리고 잠재적인 윤리적인 함정을 초래한다. 그러나 데이터 관리 전략을 채택하고, 데이터 무결성을 重視하는 문화를 육성함으로써, 조직은 이러한 위험을 완화할 수 있다.

데이터가 새로운石油인 시대에, 데이터의純度를 보장하는 것은 기술적인 필요성만이 아니라 전략적인 임무이다. 오늘날 깨끗한 데이터에 투자하는 기업은 내일 혁신의 최전선에 설 수 있을 것이다.

엘리 굿맨은 Datos의 CEO이자 공동 창립자입니다. 디지털 및 데이터 분야에서 25년 이상의 경험을 가지고 있는 엘리 굿맨은 ComScore를 포함한 다양한 대체 데이터 회사에서 리더십 역할을 맡았습니다.