AI 모델 및 플랫폼

ML 및 AI 노력을 위한 데이터 변환 강화 – 사고 리더

mm
Unite.AI를 Google의 선호 소스에 추가

데이터의 다양성, 속도, 볼륨이 클수록 예측 분석과 모델링을 통해 성장과 기회를 예측하고 개선할 수 있는 기회가 커집니다. 그러나 보고서, 기계 학습 (ML), 인공지능 (AI) 도구에서 최대의 가치를 얻으려면 조직은 많은 소스에서 데이터에 액세스하고 데이터가 고품질이고 신뢰할 수 있는지 확인해야 합니다. 이것은 빅데이터를 비즈니스 전략으로 변환하는 가장 큰 장벽입니다.

데이터 전문가들은 데이터를 수집하고 검증하여 사용할 준비를 하느라 분석하는 데 시간을 많이 소비하여 데이터에서 비즈니스 가치를 도출하는 주요 목적에 집중할 시간이 거의 없습니다. 놀랍지 않게도 76%의 데이터 과학자는 데이터 준비가 가장 싫어하는 작업이라고 말합니다. 또한 현재의 데이터 준비 작업인 데이터 랭글링과 전통적인 ETL은 수동 노력이 필요하며 빅데이터의 규모와 복잡성을 처리하기에 충분하지 않습니다.

AI의 힘을 활용하려는 기업은 이러한 번거롭고 주로 수동적인 프로세스를 벗어나야 합니다. 대신, 여러 소스와 형식에서 원시 데이터를 추출하고, 조인하고, 정규화하고, 비즈니스 논리와 지표를 추가하여 분석을 준비해야 합니다. 복잡한 데이터 변환을 통해 AI/ML 모델이 깨끗하고 정확한 데이터에 기반하여 신뢰할 수 있는 결과를 제공하는지 확인할 수 있습니다.

ELT와 클라우드의 힘을 활용

오늘날 데이터를 준비하고 변환하는 최선의 장소는 Amazon (AMZN ) Redshift, Google (GOOGL ) BigQuery, Microsoft Azure Synapse 또는 Snowflake와 같은 클라우드 데이터 웨어하우스 (CDW)입니다. 전통적인 데이터 웨어하우스 접근 방식은 데이터를 추출하고 변환한 후에만 로드할 수 있지만 CDW는 클라우드의 확장성과 성능을 활용하여 더 빠른 데이터 수집과 변환을 가능하게 하며 여러 개별 데이터 소스에서 데이터를 추출하고 로드한 후 CDW 내에서 변환할 수 있습니다.

理想적으로, ELT 모델은 초기에 원시 스테이징 데이터를 위한 CDW의 섹션으로 데이터를 이동합니다. 그곳에서 CDW는 데이터 통합 및 ETL 작업을 위한 거의 무제한의 컴퓨팅 리소스를 사용하여 스테이징된 데이터를 정화, 집계, 필터링 및 조인할 수 있습니다. 그런 다음 데이터를 보고서 및 분석을 최적화하는 다른 스키마 (예: 데이터 보트 또는 스타 스키마)로 변환할 수 있습니다.

ELT 접근 방식은 또한 필요에 따라 나중에 준비 및 변환을 위해 CDW 내에서 원시 데이터를 복제할 수 있습니다. 이렇게 하면 스키마를 읽을 때 결정하고 수요에 따라 특정 변환을 생성하는 비즈니스 인텔리전스 도구를 사용할 수 있으므로 데이터를 여러 가지 방법으로 변환하여 새로운 사용 사례를 발견할 수 있습니다.

기계 학습 모델 가속

이 실례는 두 개의 다른 산업에서 두 회사가 CDW 내에서 데이터 변환을 사용하여 AI 이니셔티브를 추진하는 방법을 보여줍니다.

고객을 더 잘 식별, 이해 및 동기를 부여할 수 있는 자체 고객 관리 플랫폼을 구축한 마케팅 및 광고 대행사는 CDW 내에서 데이터를 변환하여 플랫폼의 AI/ML 모델에 대한 실시간 고객 데이터를 여러 채널에 걸쳐 360도 고객 뷰로 통합하여 고객 상호 작용을 더 일관적이고 적절하고 개인화할 수 있습니다.

72개국에 37만 명의 고유 고객에게 1억 건의 배송을 처리하는 글로벌 물류 회사에서는 일일 50만 건의 예측을 수행하는 200개의 기계 학습 모델을 1년 동안 배포하여 효율성을 개선하고 고객 서비스를 향상시켜 고객 센터의 수신 전화를 40% 줄일 수 있었습니다.

시작을 위한 모범 사례

클라우드에서 데이터 변환의 힘으로 AI/ML 이니셔티브를 지원하려는 기업은 자신의 특정 사용 사례와 요구 사항을 이해해야 합니다. 데이터를 사용하여 수행하려는 작업 (예: 배달 루트를 최적화하여 연료 비용을 줄이기, 고객 서비스 에이전트에게 실시간으로 다음 최선의 제안을 제공하여 판매를 늘리기 등)에서 시작하여 프로세스를 역으로 분석하여 모델을 구축하는 데 관련 결과를 제공하는 데이터를 식별할 수 있습니다.

한번에 AI/ML 프로젝트에 필요한 데이터를 결정하면 데이터를 사용할 수 있게 하는 클라우드 네이티브 ELT 솔루션이 필요합니다. 다음과 같은 솔루션을 찾으십시오.

  • 현재 기술 스택과 함께 작동할 수 있는 벤더 중립적

  • 기술 스택이 변경됨에 따라 확장 및 축소하고 적응할 수 있는 충분한 유연성

  • 여러 데이터 소스에서 복잡한 데이터 변환을 처리

  • 사용량에 따라 요금을 지불하는 가격 모델

  • 선호하는 CDW에 최적화되어 해당 CDW의 기능을 최대한 활용하여 작업을 더 빠르게 실행하고 데이터를 원활하게 변환할 수 있음

모든 CDW의 공통 분모를 처리하는 클라우드 데이터 변환 솔루션은 일관된 경험을 제공할 수 있지만, 선택한 CDW의 강력한 차별화 기능을 활성화할 수 있는 솔루션만이 통찰력을 가속화하는 높은 성능을 제공할 수 있습니다. 올바른 솔루션을 통해 더 깨끗하고 신뢰할 수 있는 데이터를 더 많은 소스에서 더 짧은 시간에 사용하여 AI/ML 프로젝트를 구동하고 더 빠르고 신뢰할 수 있는 결과를 생성하여 이전에 실현되지 않은 비즈니스 가치와 혁신을 추동할 수 있습니다.

David Langton은 20년 이상의 경험을 보유한 숙련된 소프트웨어 전문가로서 수상한 기술과 제품을 개발해왔다. David는 현재 Matillion의 제품 부문 부사장으로 재직하고 있으며, Matillion은 데이터 변환 솔루션 제공업체이다. Matillion에서의 역할 이전에, 그는 금융 산업에서 데이터 웨어하우스 관리자 및 계약자로 일했다.