Líderes de pensamento

Desvendando o Caos: O Papel dos LLMs na Extração de Dados Não Estruturados

mm
Adicione Unite.AI às suas fontes preferidas no Google

Recentes avanços em hardware, como o GPU Nvidia H100, aumentaram significativamente as capacidades computacionais. Com nove vezes a velocidade do Nvidia A100, esses GPUs são excelentes no processamento de cargas de trabalho de aprendizado profundo. Esse avanço impulsionou o uso comercial de inteligência artificial gerativa em processamento de linguagem natural (NLP) e visão computacional, permitindo a extração de dados automatizada e inteligente. As empresas agora podem facilmente converter dados não estruturados em insights valiosos, marcando um grande salto tecnológico. 

Métodos Tradicionais de Extração de Dados 

Entrada de Dados Manual 

Surpreendentemente, muitas empresas ainda dependem da entrada de dados manual, apesar da disponibilidade de tecnologias mais avançadas. Esse método envolve a digitação direta de informações no sistema de destino. É frequentemente mais fácil de adotar devido aos menores custos iniciais. No entanto, a entrada de dados manual não é apenas tediosa e demorada, mas também altamente propensa a erros. Além disso, ela representa um risco de segurança ao lidar com dados sensíveis, tornando-a uma opção menos desejável na era da automação e segurança digital. 

Reconhecimento Óptico de Caracteres (OCR)  

A tecnologia OCR, que converte imagens e conteúdo manuscrito em dados legíveis por máquina, oferece uma solução mais rápida e econômica para a extração de dados. No entanto, a qualidade pode ser imprevisível. Por exemplo, caracteres como “S” podem ser mal interpretados como “8” e vice-versa.  

O desempenho do OCR é significativamente influenciado pela complexidade e características dos dados de entrada; ele funciona bem com imagens digitalizadas de alta resolução, livres de problemas como inclinações de orientação, marcas d’água ou sobrescritas. No entanto, ele enfrenta desafios com texto manuscrito, especialmente quando os visuais são intricados ou difíceis de processar. Adaptações podem ser necessárias para obter resultados melhorados ao lidar com entradas de texto. As ferramentas de extração de dados no mercado com OCR como tecnologia base frequentemente adicionam camadas e camadas de pós-processamento para melhorar a precisão dos dados extraídos. Mas essas soluções não podem garantir resultados 100% precisos.  

Correspondência de Padrões de Texto 

A correspondência de padrões de texto é um método para identificar e extrair informações específicas de texto usando regras ou padrões pré-definidos. É mais rápido e oferece um ROI mais alto do que outros métodos. É eficaz em todos os níveis de complexidade e alcança 100% de precisão para arquivos com layouts semelhantes.  

No entanto, sua rigidez em combinações de palavras pode limitar a adaptabilidade, exigindo uma correspondência exata de 100% para uma extração bem-sucedida. Desafios com sinônimos podem levar a dificuldades na identificação de termos equivalentes, como diferenciar “tempo” de “clima”. Além disso, a Correspondência de Padrões de Texto exibe sensibilidade contextual, carecendo de consciência de múltiplos significados em diferentes contextos. Encontrar o equilíbrio certo entre rigidez e adaptabilidade permanece um desafio constante ao empregar esse método de forma eficaz. 

Reconhecimento de Entidades Nomeadas (NER)  

O reconhecimento de entidades nomeadas (NER), uma técnica de NLP, identifica e categoriza informações-chave em texto. 

As extrações do NER são limitadas a entidades pré-definidas, como nomes de organizações, locais, nomes pessoais e datas. Em outras palavras, os sistemas NER atualmente carecem da capacidade inerente de extrair entidades personalizadas além desse conjunto pré-definido, que poderia ser específico de um domínio ou caso de uso. Em segundo lugar, o foco do NER nos valores-chave associados a entidades reconhecidas não se estende à extração de dados de tabelas, limitando sua aplicabilidade a tipos de dados mais complexos ou estruturados. 

 À medida que as organizações lidam com quantidades crescentes de dados não estruturados, esses desafios destacam a necessidade de uma abordagem abrangente e escalável para metodologias de extração. 

Desbloqueando Dados Não Estruturados com LLMs 

Utilizar grandes modelos de linguagem (LLMs) para a extração de dados não estruturados é uma solução atraente com vantagens distintas que abordam desafios críticos. 

Extração de Dados Consciente de Contexto 

Os LLMs possuem uma forte compreensão contextual, aprimorada por meio de um treinamento extensivo em grandes conjuntos de dados. Sua capacidade de ir além da superfície e entender as complexidades do contexto os torna valiosos no tratamento de diversas tarefas de extração de informações. Por exemplo, quando solicitados a extrair valores de tempo, eles capturam a informação pretendida e consideram elementos relacionados, como valores de clima, incorporando sinônimos e semântica de forma transparente. Esse nível avançado de compreensão estabelece os LLMs como uma escolha dinâmica e adaptável no domínio da extração de dados.  

Aproveitando as Capacidades de Processamento Paralelo 

Os LLMs utilizam processamento paralelo, tornando as tarefas mais rápidas e eficientes. Diferentemente dos modelos sequenciais, os LLMs otimizam a distribuição de recursos, resultando em tarefas de extração de dados aceleradas. Isso melhora a velocidade e contribui para o desempenho geral do processo de extração. 

Adaptação a Diversos Tipos de Dados 

Enquanto alguns modelos, como Redes Neurais Recorrentes (RNNs), são limitados a sequências específicas, os LLMs lidam com dados não específicos de sequência, acomodando estruturas de sentenças diversas com facilidade. Essa versatilidade abrange diversas formas de dados, como tabelas e imagens. 

Melhorando os Fluxos de Processamento 

O uso de LLMs marca uma mudança significativa na automação tanto das etapas de pré-processamento quanto de pós-processamento. Os LLMs reduzem a necessidade de esforço manual, automatizando processos de extração com precisão, simplificando o manejo de dados não estruturados. Seu treinamento extensivo em conjuntos de dados diversos permite que eles identifiquem padrões e correlações que os métodos tradicionais não detectam. 

Essa figura de um pipeline de IA gerativa ilustra a aplicabilidade de modelos como BERT, GPT e OPT na extração de dados. Esses LLMs podem realizar várias operações de NLP, incluindo a extração de dados. Normalmente, o modelo de IA gerativa fornece um prompt que descreve os dados desejados, e a resposta subsequente contém os dados extraídos. Por exemplo, um prompt como “Extraia os nomes de todos os fornecedores deste pedido de compra” pode produzir uma resposta contendo todos os nomes de fornecedores presentes no relatório semi-estruturado. Posteriormente, os dados extraídos podem ser parseados e carregados em uma tabela de banco de dados ou um arquivo plano, facilitando a integração perfeita nos fluxos de trabalho organizacionais. 

Evolução de Estruturas de IA: RNNs para Transformers na Extração de Dados Moderna 

A inteligência artificial gerativa opera dentro de uma estrutura codificador-decodificador que apresenta duas redes neurais colaborativas. O codificador processa os dados de entrada, condensando recursos essenciais em um “Vector de Contexto”. Esse vetor é então utilizado pelo decodificador para tarefas gerativas, como tradução de linguagem. Essa arquitetura, que aproveita redes neurais como RNNs e Transformers, encontra aplicações em domínios diversos, incluindo tradução de máquina, geração de imagens, síntese de fala e extração de entidades de dados. Essas redes são excelentes em modelar relações e dependências intrincadas dentro de sequências de dados. 

Redes Neurais Recorrentes 

Redes Neurais Recorrentes (RNNs) foram projetadas para lidar com tarefas de sequência, como tradução e resumo, excelindo em certos contextos. No entanto, elas lutam com a precisão em tarefas que envolvem dependências de longo alcance.  

 As RNNs são excelentes na extração de pares de chave-valor de sentenças, mas enfrentam dificuldades com estruturas semelhantes a tabelas. Abordar isso requer uma consideração cuidadosa da sequência e do posicionamento, exigindo abordagens especializadas para otimizar a extração de dados de tabelas. No entanto, sua adoção foi limitada devido ao baixo ROI e ao desempenho subpar em muitas tarefas de processamento de texto, mesmo após serem treinadas em grandes volumes de dados. 

Redes de Memória de Curto e Longo Prazo 

Redes de Memória de Curto e Longo Prazo (LSTMs) surgem como uma solução que aborda as limitações das RNNs, particularmente por meio de um mecanismo de atualização e esquecimento seletivo. Como as RNNs, as LSTMs são excelentes na extração de pares de chave-valor de sentenças. No entanto, elas enfrentam desafios semelhantes com estruturas semelhantes a tabelas, exigindo uma consideração estratégica da sequência e dos elementos posicionais.  

 Os GPUs foram usados pela primeira vez para aprendizado profundo em 2012 para desenvolver o famoso modelo de CNN AlexNet. Posteriormente, algumas RNNs também foram treinadas usando GPUs, embora não tenham produzido bons resultados. Hoje, apesar da disponibilidade de GPUs, esses modelos foram amplamente substituídos por LLMs baseados em transformers. 

Transformer – Mecanismo de Atenção 

A introdução dos transformers, notadamente apresentada no artigo revolucionário “A Atenção é Tudo o que Você Precisa” (2017), revolucionou o NLP, propondo a arquitetura do ‘transformer’. Essa arquitetura permite cálculos paralelos e captura adequadamente dependências de longo alcance, desbloqueando novas possibilidades para modelos de linguagem. LLMs como GPT, BERT e OPT aproveitaram a tecnologia dos transformers. No coração dos transformers está o mecanismo de “atenção”, um contribuinte fundamental para o desempenho aprimorado no processamento de sequências de dados. 

O mecanismo de “atenção” nos transformers calcula uma soma ponderada de valores com base na compatibilidade entre a ‘consulta’ (prompt de pergunta) e a ‘chave’ (compreensão do modelo de cada palavra). Essa abordagem permite atenção focada durante a geração de sequências, garantindo extração precisa. Dois componentes cruciais dentro do mecanismo de atenção são a Atenção Própria, que captura a importância entre as palavras na sequência de entrada, e a Atenção Multi-Cabeça, que permite padrões de atenção diversificados para relações específicas.  

No contexto da Extração de Faturas, a Atenção Própria reconhece a relevância de uma data mencionada anteriormente ao extrair quantias de pagamento, enquanto a Atenção Multi-Cabeça se concentra independentemente em valores numéricos (quantias) e padrões textuais (nomes de fornecedores). Diferentemente das RNNs, os transformers não entendem intrinsicamente a ordem das palavras. Para abordar isso, eles usam codificação posicional para rastrear a posição de cada palavra em uma sequência. Essa técnica é aplicada a embeddings de entrada e saída, auxiliando na identificação de chaves e seus valores correspondentes dentro de um documento.  

A combinação dos mecanismos de atenção e codificações posicionais é vital para a capacidade de um grande modelo de linguagem de reconhecer uma estrutura como tabular, considerando seu conteúdo, espaçamento e marcadores de texto. Essa habilidade os distingue de outras técnicas de extração de dados não estruturados.

Tendências e Desenvolvimentos Atuais 

O espaço de IA se desdobra com tendências e desenvolvimentos promissores, redefinindo a forma como extraímos informações de dados não estruturados. Vamos mergulhar nos principais aspectos que moldam o futuro desse campo. 

Avanços em Grandes Modelos de Linguagem (LLMs) 

A inteligência artificial gerativa está passando por uma fase transformadora, com os LLMs ocupando o centro das atenções no tratamento de conjuntos de dados complexos e diversificados para a extração de dados não estruturados. Duas estratégias notáveis estão impulsionando esses avanços: 

  1. Aprendizado Multimodal: Os LLMs estão expandindo suas capacidades, processando simultaneamente vários tipos de dados, incluindo texto, imagens e áudio. Esse desenvolvimento melhora sua capacidade de extrair informações valiosas de fontes diversas, aumentando sua utilidade na extração de dados não estruturados. Pesquisadores estão explorando maneiras eficientes de usar esses modelos, visando eliminar a necessidade de GPUs e permitir a operação de grandes modelos com recursos limitados.
  1. Aplicações RAG: Geração Aumentada por Recuperação (RAG) é uma tendência emergente que combina grandes modelos de linguagem pré-treinados com mecanismos de busca externos para aprimorar suas capacidades. Acessando um vasto corpus de documentos durante o processo de geração, o RAG transforma modelos de linguagem básicos em ferramentas dinâmicas personalizadas para aplicações tanto comerciais quanto de consumo.

Avaliando o Desempenho dos LLMs 

O desafio de avaliar o desempenho dos LLMs é enfrentado com uma abordagem estratégica, incorporando métricas específicas de tarefa e metodologias de avaliação inovadoras. Desenvolvimentos-chave nesse espaço incluem: 

  1. Métricas personalizadas: Métricas de avaliação personalizadas estão surgindo para avaliar a qualidade das tarefas de extração de informações. Precisão, recall e pontuação F1 são provadas eficazes, particularmente em tarefas como extração de entidades.
  1. Avaliação Humana: A avaliação humana permanece fundamental ao lado de métricas automatizadas, garantindo uma avaliação abrangente dos LLMs. Integrando métricas automatizadas com julgamento humano, métodos de avaliação híbridos oferecem uma visão matizada da correção contextual e relevância das informações extraídas.

Processamento de Imagens e Documentos  

LLMs multimodais substituíram completamente o OCR. Os usuários podem converter texto digitalizado de imagens e documentos em texto legível por máquina, com a capacidade de identificar e extrair informações diretamente do conteúdo visual usando módulos baseados em visão. 

Extração de Dados de Links e Sites 

Os LLMs estão evoluindo para atender à crescente demanda por extração de dados de sites e links da web. Esses modelos estão cada vez mais aptos a realizar raspagem de web, convertendo dados de páginas da web em formatos estruturados. Essa tendência é inestimável para tarefas como agregação de notícias, coleta de dados de comércio eletrônico e inteligência competitiva, aprimorando a compreensão contextual e extração de dados relacionais da web. 

O Surgimento de Pequenos Gigantes na IA Gerativa 

A primeira metade de 2023 viu um foco no desenvolvimento de grandes modelos de linguagem baseados na suposição de que “maior é melhor”. No entanto, resultados recentes mostram que modelos menores, como TinyLlama e Dolly-v2-3B, com menos de 3 bilhões de parâmetros, se destacam em tarefas como raciocínio e resumo, conquistando o título de “pequenos gigantes”. Esses modelos usam menos poder de processamento e armazenamento, tornando a IA mais acessível a empresas menores sem a necessidade de GPUs caras. 

Conclusão 

Os primeiros modelos de IA gerativa, incluindo redes adversárias gerativas (GANs) e autoencoders variacionais (VAEs), introduziram abordagens novas para gerenciar dados baseados em imagens. No entanto, o verdadeiro avanço veio com os grandes modelos de linguagem baseados em transformers. Esses modelos superaram todas as técnicas anteriores no processamento de dados não estruturados devido à sua estrutura codificador-decodificador, atenção própria e atenção multi-cabeça, concedendo-lhes uma compreensão profunda da linguagem e habilitando capacidades de raciocínio semelhantes às humanas. 

 Enquanto a inteligência artificial gerativa oferece um começo promissor na mineração de dados textuais de relatórios, a escalabilidade dessas abordagens é limitada. Os primeiros passos frequentemente envolvem processamento OCR, que pode resultar em erros, e desafios persistem na extração de texto de imagens dentro de relatórios.  

 A extração de texto dentro das imagens em relatórios é outro desafio. Abraçar soluções como processamento de dados multimodais e extensões de limite de token no GPT-4, Claud3, Gemini, oferece um caminho promissor para o futuro. No entanto, é importante notar que esses modelos são acessíveis apenas por meio de APIs. Embora o uso de APIs para extração de dados de documentos seja eficaz e econômico, ele vem com sua própria série de limitações, como latência, controle limitado e riscos de segurança.  

 Uma solução mais segura e personalizável reside no ajuste fino de um LLM interno. Essa abordagem não apenas mitiga preocupações de privacidade e segurança de dados, mas também melhora o controle sobre o processo de extração de dados. O ajuste fino de um LLM para a compreensão do layout de documentos e para a compreensão do significado do texto com base em seu contexto oferece um método robusto para extrair pares de chave-valor e itens de linha. Aproveitando o aprendizado zero-shot e few-shot, um modelo ajustado pode se adaptar a layouts de documentos diversificados, garantindo uma extração de dados não estruturados eficiente e precisa em vários domínios. 

Jay Mishra, COO na Astera, uma provedora líder de soluções de dados sem código, é um líder experiente em dados e análise com mais de 20 anos de experiência em estratégias transformadoras para empoderar organizações por meio de soluções de dados impulsionadas por IA.