Líderes de pensamento

O Alto Custo dos Dados Sujos no Desenvolvimento de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Não é segredo que está acontecendo uma corrida ao ouro nos dias atuais no desenvolvimento de IA. De acordo com o Índice de Tendências de Trabalho de 2024 da Microsoft (MSFT ) e do Linkedin, mais de 40% dos líderes empresariais antecipam redesenhar completamente seus processos de negócios do zero usando inteligência artificial (IA) nos próximos anos. Essa mudança sísmica não é apenas uma atualização tecnológica; é uma transformação fundamental de como as empresas operam, tomam decisões e interagem com os clientes. Esse desenvolvimento rápido está alimentando uma demanda por dados e ferramentas de gerenciamento de dados de primeira parte. De acordo com Forrester, um impressionante 92% dos líderes de tecnologia planejam aumentar seus orçamentos de gerenciamento de dados e IA em 2024.

Na última Pesquisa Global da McKinsey sobre IA, 65% dos respondentes indicaram que suas organizações estão regularmente usando tecnologias de IA gerativa. Embora essa adoção signifique um salto significativo, também destaca um desafio crítico: a qualidade dos dados que alimentam esses sistemas de IA. Em uma indústria onde a IA eficaz é tão boa quanto os dados em que é treinada, dados confiáveis e precisos estão se tornando cada vez mais difíceis de encontrar.

O Alto Custo dos Dados Ruins

Os dados ruins não são um problema novo, mas seu impacto é amplificado na era da IA. Em 2017, um estudo do Instituto de Tecnologia de Massachusetts (MIT) estimou que os dados ruins custam às empresas um impressionante 15% a 25% de sua receita. Em 2021, a Gartner estimou que os dados ruins custam às organizações uma média de $12,9 milhões por ano.

Os dados sujos — dados que são incompletos, imprecisos ou inconsistentes — podem ter um efeito em cascata nos sistemas de IA. Quando os modelos de IA são treinados em dados de baixa qualidade, as informações e previsões resultantes são fundamentalmente falhas. Isso não apenas compromete a eficácia das aplicações de IA, mas também apresenta riscos significativos para as empresas que dependem dessas tecnologias para a tomada de decisões críticas.

Isso está criando um grande problema para as equipes de ciência de dados corporativas, que tiveram que se concentrar cada vez mais em limpar e organizar os dados. Em um recente relatório do estado da engenharia conduzido pela DBT, 57% dos profissionais de ciência de dados citaram a baixa qualidade dos dados como um problema predominante em seu trabalho.

As Repercussões nos Modelos de IA

O impacto dos Dados Ruins no Desenvolvimento de IA manifesta-se de três maneiras principais:

  1. Redução da Precisão e Confiabilidade: Os modelos de IA prosperam em padrões e correlações derivados dos dados. Quando os dados de entrada são contaminados, os modelos produzem saídas não confiáveis; amplamente conhecidas como “alucinações de IA”. Isso pode levar a estratégias mal orientadas, falhas de produtos e perda de confiança do cliente.
  2. Amplificação de Vieses: Os dados sujos frequentemente contêm vieses que, se não forem verificados, são incorporados nos algoritmos de IA. Isso pode resultar em práticas discriminatórias, especialmente em áreas sensíveis como contratação, empréstimos e aplicação da lei. Por exemplo, se uma ferramenta de recrutamento de IA for treinada em dados históricos de contratação tendenciosos, ela pode favorecer injustamente certas demografias em detrimento de outras.
  3. Aumento dos Custos Operacionais: Os sistemas de IA com falhas exigem ajustes e treinamento constantes, o que consome tempo e recursos adicionais. As empresas podem se encontrar em um ciclo perpétuo de correção de erros em vez de inovar e melhorar.

A Datapocalipse que Vem

“Estamos nos aproximando rapidamente de um ‘ponto de inflexão’ – onde o conteúdo gerado por não humanos superará em muito a quantidade de conteúdo gerado por humanos. Os avanços na própria IA estão fornecendo novas ferramentas para limpeza e validação de dados. No entanto, a quantidade enorme de conteúdo gerado por IA na web está crescendo exponencialmente.

À medida que mais conteúdo gerado por IA é enviado para a web e esse conteúdo é gerado por LLMs treinados em conteúdo gerado por IA, estamos olhando para um futuro onde os dados de primeira parte e confiáveis se tornarão commodities perigosas e valiosas.

Os Desafios da Diluição de Dados

A proliferação de conteúdo gerado por IA cria vários desafios importantes para a indústria:

  • Controle de Qualidade: Distinguir entre dados gerados por humanos e dados gerados por IA torna-se cada vez mais difícil, tornando mais difícil garantir a qualidade e confiabilidade dos dados usados para treinar modelos de IA.
  • Preocupações com Propriedade Intelectual: À medida que os modelos de IA aprendem inadvertidamente com conteúdo gerado por IA, surgem questões sobre a propriedade e os direitos associados aos dados, potencialmente levando a complicações legais.
  • Implicações Éticas: A falta de transparência sobre a origem dos dados pode levar a questões éticas, como a disseminação de informações falsas ou o reforço de vieses.

Dados como Serviço Tornam-se Fundamentais

Cada vez mais, as soluções de Dados como Serviço (DaaS) estão sendo buscadas para complementar e aprimorar os dados de primeira parte para fins de treinamento. O verdadeiro valor do DaaS é o próprio dado, que foi normalizado, limpo e avaliado para diferentes casos de uso de fidelidade e aplicação comercial, bem como a padronização dos processos para se adequar ao sistema que digere os dados. À medida que essa indústria amadurece, prevejo que começaremos a ver essa padronização em toda a indústria de dados. Já estamos vendo esse impulso para uniformidade no setor de mídia de varejo.

À medida que a IA continua a permeiar várias indústrias, a importância da qualidade dos dados só aumentará. As empresas que priorizam dados limpos obterão uma vantagem competitiva, enquanto aquelas que os negligenciam cairão rapidamente para trás.

O alto custo dos dados sujos no desenvolvimento de IA é uma questão premente que não pode ser ignorada. A baixa qualidade dos dados compromete a própria fundação dos sistemas de IA, levando a insights falhos, aumentos de custos e possíveis armadilhas éticas. Ao adotar estratégias de gerenciamento de dados abrangentes e fomentar uma cultura que valoriza a integridade dos dados, as organizações podem mitigar esses riscos.

Em uma era em que os dados são o novo petróleo, garantir sua pureza não é apenas uma necessidade técnica, mas um imperativo estratégico. As empresas que investem em dados limpos hoje serão as que liderarão a fronteira da inovação amanhã.

Eli Goodman é CEO e co-fundador da Datos, uma empresa da Semrush. Com mais de 25 anos de experiência no espaço digital e de dados, Eli ocupou cargos de liderança em várias empresas de dados alternativos, incluindo um mandato de 9 anos na ComScore.