사상 리더

데이터 정리하기: AI가 게임을 바꾸는 방법

mm
Unite.AI를 Google의 선호 소스에 추가

우리는 데이터에 빠져 있습니다. 모든 플랫폼, 스마트워치, 스마트폰은 우리의 삶을 측정할 수 있는 작은 조각으로 나누어 주지만, 대부분의 데이터는 아직도 불일치하고 사용할 수 없습니다.

기업은 이것을 알고 있습니다. 기술 거대 기업인 Meta는 지난 여름에 데이터 레이블링 스타트업 Scale AI의 49% 지분을 14억 달러에 인수하여 고품질의 훈련 데이터를 확보하기 위해 계산된 전략을 취했습니다.

대규모 언어 모델의 신뢰성은 완전히 입력된 데이터의 품질에 달려 있습니다. 즉, “쓰레기가 들어가면 쓰레기가 나온다”라는 말과 같습니다. 그러나 오늘날 기업이 직면하는 실제 도전은 원시 정보의 홍수에서 행동할 수 있는 데이터를 만드는 것입니다.

해결책은 바로 눈 앞에 있습니다. AI 자체가 데이터를 정리하는 전략을 생성하여 대규모 데이터 세트를 레이블링하거나 끝없는 스프레드시트를 검색하는 번거로운 작업을 피하는 데 도움이 될 수 있습니다.

데이터가 어지러워질 때: 기업의 숨겨진 비용

2020년 Gartner 연구에 따르면, 데이터 품질이 나쁨으로 인해 기업은 최소 1억 2천 9백만 달러의 비용을 지불해야 합니다. 이는 생산성에 영향을 미치고, 잘못된 의사결정을 내리며, 부정확한 보고를 할 수 있습니다.

데이터가 어지러워지는 결과는 의료 분야와 같은 섹터에서 더욱 명백합니다. 불완전한 의료 기록, 청구 세부 정보, 시스템 간의 불일치한 데이터는 잘못된 진단, 치료 오류, 비효율적인 자원 할당으로 이어질 수 있습니다. 장기적으로 이는 비용을 증가시키고 이러한 시스템에 대한 신뢰를 저하합니다.

한편, 물류 분야에서 공급자와 유통업체 간의 데이터가 불일치하면 지연이나 재고 부족이 발생할 수 있습니다. 잘못된 배송 주소 또는 구식 재고 기록은 전체 공급망에 걸쳐 파급 효과를 일으켜 기한을 놓치거나 고객이 불만을 가질 수 있습니다.

“결과를 예측하거나 이해할 수 있다면 – 과거 데이터를 결합하여 – 이러한 비효율성을 크게 줄일 수 있습니다.” Transmetrics의 CEO인 Asparuh Koev는 Unite AI와의 대화에서 말했다.

실제로, 데이터가 어지러워지는 것은 비용이 많이 듭니다. 1-10-100 규칙은 이를 설명합니다. 데이터를 입력할 때 확인하는 비용은 1달러, 데이터를 정리하는 비용은 10달러, 아무 것도 하지 않는 경우 비용은 100달러입니다.

AI 기반 플랫폼이 제공하는 것

기업은 데이터를 정리하는 데 어려움을 겪고 있습니다. 등장하는 AI 기반 플랫폼은 데이터 정리 과정을 자동화하여 비용 효율성을 높이고 정확성을 개선합니다.

Claritype의 설립자 Robert Giardina는 AI의 과정을 설명했습니다.

“데이터를 공통 형식으로 변환합니다. 비즈니스에 적합한 표준 형식을 생성하는 것입니다.”

Claritype의 AI는 단순한 표준화 이상을 제공합니다. 플랫폼의 감독하에 수리가 가능하여 조직은 시스템 경계를 넘어 가장 긴급한 질문에 대한 답변을 찾을 수 있습니다.

“시스템이 이전에 분리되어 있었지만, 비즈니스 전체에 걸쳐 있는 질문에 대한 답변의 일부를 가지고 있습니다.” Giardina는 Unite AI에게 말했다.

예를 들어, 주요 공급자가 배송 지연에 영향을 받는 경우, 공급자와 주문 및 고객 기록을 연결하여 지연을 먼저 알릴 고객을 결정할 수 있습니다.

“우리의 궁극적인 목표는 기업 내의 모든 데이터 조각을 연결하여 모든 질문에 쉽고 즉각적으로 답변할 수 있도록 하는 것입니다.” Giardina는 말했다.

이와 같은 상호 연결된 사고는 오늘날 기업에서 발생하는 더广泛한 사고의 변화를 대표합니다. 즉, 데이터 정리를 위한 ad hoc 접근에서 체계적인 데이터 거버넌스 접근으로 전환하는 것입니다.

데이터 거버넌스는 이제 가치 있는 비즈니스 프로세스로 간주됩니다. 데이터 관리를 전반적인 전략에 통합함으로써 기업은 더 나은 의사결정을 내릴 수 있고 데이터에서 더 의미 있는 통찰력을 얻을 수 있습니다.

AI가 데이터를 정리하는 방법과 직면하는 도전

AI에過度 의존하는 것은 위험할 수 있습니다. Giardina는 “표준화 이상의 자동 데이터 변환이 걱정됩니다.”라고 말했다.

예를 들어, 약어를 잘못 해석할 수 있습니다. “International Business Machines, Inc.” 또는 “I.B.M.”은 일반적으로 “IBM”으로 변환되지만, “I.B.”를 “IBM”으로 잘못 변환하면 두 회사 모두에게 큰 문제가 될 수 있습니다.

누락된 데이터와 부정확한 데이터는 가장 일반적인 문제입니다. AI만으로 이러한 결손을 컨텍스트에 따라 채우는 것은 쉽게 오류를 일으킬 수 있습니다. Giardina는 “의미 있는 효과가 있는 경우, 우리는 각 추측에 대한 승인을 위해 인간이 필요합니다.”라고 지적합니다.

자동화와 인간의 통찰력을 균형잡기

데이터가 어지러워지는 것은 정보를 처리하는 방식에 대한 심각한 결점을 강조합니다. 의사결정을 개선하기 위해, 기업은 데이터를 순수한 기술적인 문제로 간주하는 것을 중단하고, 인간의 전문 지식, 윤리적 인식, 장기적인 전략적 비전을 결합하는 거버넌스 모델로 전환해야 합니다.

데이터를 정리하면 더 효과적인 AI를 만들 수 있으며, 이는 다시 데이터 품질을 개선합니다. 이 상호 보완적인 사이클은 약속이 있지만, 자동화만으로는 우리의 데이터 문제를 해결할 수 없다는 것을 기억하도록 합니다. 이 잠재력을 실현하려면 알고리즘의 정밀성과 인간의 판단, 그리고 알고리즘이 도입할 수 있는 편향에 대한 의식이 필요합니다.

Allie AI의 CEO인 Alex Sandoval도 제조 지능 AI 회사에서, 생성된 AI 조종사는 알고리즘만으로 작동하지 않으며, 공장의 논리에서 인간의 유연성이 필요하다고 강조했습니다.

“오늘날 가장 성공적인 배치는 모델에 광범위한 프로그래밍 가능한 논리 컨트롤러(PLC) 데이터, 운영자 노트 및 규정 프로토콜을 공급하는 것만이 아닙니다. 기계의 행동과 디지털 직관을 번역할 수 있는 새로운 유형의 최전선 노동자가 필요합니다.”라고 그는 결론지었습니다.

Gabrielle Degeorge는 이탈리아 로마에 기반을 둔 저널리스트이자 다국어 커뮤니케이션 전문가입니다. 그는 제네바 대학교에서 전문 번역학 석사 학위를 취득했으며, 그의 업무는 산업과 사회의 발전에 대한 인공지능의 역할을 강조합니다.