사상 리더

AI 구현에서 데이터 품질의 중요성

mm
Unite.AI를 Google의 선호 소스에 추가

인공 지능과 기계 학습 기술은 모든 규모의 산업에서 큰 이점을 제공할 수 있습니다. McKinsey 보고서에 따르면, 인공 지능 기술을 사용하는 기업은 2030년까지 현금 흐름을 두 배로 늘릴 것입니다. 반면에, 인공 지능을 사용하지 않는 기업은 현금 흐름이 20% 줄어들 것입니다. 그러나 이러한 이점은 금융을 넘어서 있습니다. 인공 지능은 기업이 노동력 부족을 극복하는 데 도움이 될 수 있습니다. 또한 인공 지능은 고객 경험과 비즈니스 결과를 크게 개선하여 기업을 더 신뢰할 수 있게 만듭니다.

인공 지능이 इतन 많은 이점을 제공하는 데에도 불구하고, 왜 모든 사람이 인공 지능을 채택하고 있지 않을까요? 2019년에 PwC 설문조사에 따르면, 76%의 기업이 비즈니스 가치를 향상시키기 위해 인공 지능을 사용할 계획이라고 répond했습니다. 그러나 고품질 데이터에 접근할 수 있는 기업은 15%에 불과했습니다. 또 다른 Refinitiv의 연구에 따르면, 66%의 응답자가 데이터 품질이 좋지 않아 인공 지능을 효과적으로 배포하고 채택하는 능력을 저해한다고 répond했습니다.

설문조사에 따르면, 기계 학습과 인공 지능 기술을 사용하는 데 대한 주요 도전은 “데이터의 범위, 역사, 인구에 대한 정확한 정보”, “불완전하거나 오류가 있는 레코드의 식별”, “데이터의 정리 및 표준화”를 포함합니다. 이것은 데이터 품질이 좋지 않아 기업이 고품질의 인공 지능 분석을 얻는 데 주된 장애물임을 보여줍니다.

데이터가 중요한 이유

인공 지능 구현에서 데이터 품질이 중요한 이유는 많습니다. 여기 가장 중요한 몇 가지가 있습니다.

1. 쓰레기가 들어가면 쓰레기가 나온다

출력은 입력에 크게 의존합니다. 이 경우, 데이터 세트가 오류로 가득 차 있거나 편향되어 있다면, 결과도 잘못될 것입니다. 대부분의 데이터 관련 문제는 데이터의 양이 아니라 데이터의 품질에 관한 것입니다. 인공 지능 모델에 낮은 품질의 데이터를 입력하면, 모델이 제대로 작동하지 않을 것입니다.

2. 모든 인공 지능 시스템이 동일하지는 않다

데이터 세트를 생각할 때, 우리는通常적으로 양적 데이터를 생각합니다. 그러나 질적 데이터도 있습니다. 예를 들어, 비디오, 개인 인터뷰, 의견, 사진 등이 있습니다. 인공 지능 시스템에서 양적 데이터 세트는 구조화되어 있고, 질적 데이터 세트는 비구조화되어 있습니다. 모든 인공 지능 모델이 두 종류의 데이터 세트를 다룰 수는 없습니다. 따라서, 적절한 모델에 적합한 데이터 유형을 선택하는 것이 중요합니다.

3. 품질 대 양

인공 지능 시스템이 많은 데이터를 학습하기 위해 필요로 하는 것으로 생각됩니다. 그러나 데이터 세트가 고품질이고 짧은 경우, 출력이 관련性 있고 강건한 것을 보장할 수 있습니다.

4. 좋은 데이터 세트의 특성

좋은 데이터 세트의 특성은 주관적이고, 주로 인공 지능이 제공하는 응용 프로그램에 따라 다를 수 있습니다. 그러나, 데이터 세트를 분석할 때 고려해야 할 몇 가지 일반적인 특성이 있습니다.

  • 완전성: 데이터 세트는 완전해야 하며, 빈 격자나 데이터 세트의 빈칸이 없어야 합니다. 모든 셀에는 데이터 조각이 있어야 합니다.
  • 포괄성: 데이터 세트는 가능한 한 포괄적이어야 합니다. 예를 들어, 사이버 위협 벡터를 찾고 있다면, 모든 서명 프로파일과 필요한 모든 정보를 포함해야 합니다.
  • 일관성: 데이터 세트는 할당된 변수에 따라 일관성이 있어야 합니다. 예를 들어, 패키지 박스를 모델링한다면, 선택한 변수(플라스틱, 종이, 카드보드 등)에 대한 적절한 가격 데이터가 있어야 합니다.
  • 정확성: 정확성은 좋은 데이터 세트의 핵심입니다. 인공 지능 모델에 입력하는 모든 정보는 신뢰할 수 있고 완전히 정확해야 합니다. 데이터 세트의 큰 부분이 잘못된 경우, 출력도 정확하지 않을 것입니다.
  • 유일성: 이것은 일관성과 유사합니다. 각 데이터 포인트는 제공하는 변수에 고유해야 합니다. 예를 들어, 플라스틱 랩의 가격을 다른 패키징 카테고리에 속하게 하고 싶지 않을 것입니다.

데이터 품질 보장

데이터 품질을 높이는 방법은 많습니다. 예를 들어, 데이터 소스가 신뢰할 수 있는지 확인하는 것입니다. 여기 몇 가지 최선의 기술이 있습니다.

1. 데이터 프로파일링

데이터 프로파일링은 데이터를 사용하기 전에 이해하는 데 필수적입니다. 데이터 프로파일링은 값의 분포, 최대, 최소, 평균 값 및 이상 값을 제공합니다. 또한, 데이터의 형식 불일치를 도와줍니다. 데이터 프로파일링은 데이터 세트가 사용할 수 있는지 여부를 이해하는 데 도움이 됩니다.

2. 데이터 품질 평가

중앙 라이브러리에 사전 구축된 데이터 품질 규칙을 사용하여, 중앙 라이브러리를 사용하여 데이터 세트를 검증할 수 있습니다. 데이터 카탈로그에 내장된 데이터 도구가 있는 경우, 고객 이름, 이메일, 제품 코드를 검증하는 규칙을 재사용할 수 있습니다. 또한, 일부 데이터를 강화하고 표준화할 수 있습니다.

3. 데이터 품질 모니터링 및 평가

과학자들은 대부분의 데이터 세트에 대한 데이터 품질을 미리 계산합니다. 특정 속성의 문제를 좁혀서 해당 속성을 사용할지 여부를 결정할 수 있습니다.

4. 데이터 준비

연구자와 과학자는 데이터를 인공 지능 모델링에 준비하기 위해 데이터를 약간 조정해야 합니다. 이러한 연구자들은 데이터에서 속성을 파싱하고, 열을 전치하고, 값을 계산하기 위한 쉽게 사용할 수 있는 도구가 필요합니다.

인공 지능의 세계는 끊임없이 변화하고 있습니다. 각 기업이 데이터를 다르게 사용하는 데에도 불구하고, 데이터 품질은 모든 인공 지능 구현 프로젝트에 필수적입니다. 신뢰할 수 있는 좋은 품질의 데이터를 가지고 있다면,大量한 데이터 세트가 필요 없으며 성공할 가능성이 증가합니다. 다른 모든 조직과 마찬가지로,貴社가 인공 지능 구현으로 전환하고 있다면, 좋은 품질의 데이터가 있는지 확인하세요. 데이터 소스가 신뢰할 수 있는지 확인하고, 데이터 요구 사항에 부합하는지 확인하기 위한 신중한 검토를 수행하세요.

Amy Groden-Morrison는 TIBCO Software, RSA Security, Ziff-Davis와 같은 회사에서 15년 이상 마케팅 커뮤니케이션 리더십 역할을 수행했습니다. 그녀의 과거 업적에는 CNN과 함께 최초의 공동 브랜드 기술 프로그램을 설립하는 것이 포함되며, NYSE에서 이벤트 회사启动, 위기 중에 나스닥 상장 회사 재브랜드화, 보스턴 지역 스타트업의 성공적인 인수를위한 마케팅 및 포지셔닝 등이 있습니다. 현재 그녀는 Alpha Software의 마케팅 및 세일즈 오퍼레이션 부사장입니다.