Líderes de pensamento
Movendo Grandes Modelos de Linguagem (LLM) para Aplicações Comerciais do Mundo Real

Os grandes modelos de linguagem estão por todos os lugares. Cada conversa com um cliente ou pitch de VC envolve perguntas sobre como a tecnologia LLM está pronta e como ela impulsionará aplicações futuras. Eu abordei alguns padrões sobre isso em meu post anterior. Aqui, vou falar sobre alguns padrões do mundo real para uma aplicação na indústria farmacêutica que a Persistent Systems trabalhou.
Grandes Modelos de Linguagem e Forças Principais
Os LLMs são bons em entender a linguagem, essa é a sua especialidade. O padrão mais comum que estamos vendo com aplicações é a geração aumentada de recuperação (RAG), onde o conhecimento é compilado externamente a partir de fontes de dados e fornecido como um prompt para o LLM para parafrasear uma resposta. Nesse caso, mecanismos de busca super-rápidos, como bancos de dados vetoriais e motores baseados em Elasticsearch, servem como uma primeira linha de busca. Em seguida, os resultados da busca são compilados em um prompt e enviados ao LLM, principalmente como uma chamada de API.
Outro padrão é gerar uma consulta em dados estruturados, alimentando o LLM com um modelo de dados como prompt e uma consulta específica do usuário. Esse padrão pode ser usado para desenvolver uma interface avançada “fale com seus dados” para bancos de dados SQL, como Snowflake, bem como para bancos de dados gráficos, como Neo4j.
Utilizando Padrões de LLM para Insights do Mundo Real
A Persistent Systems analisou recentemente um padrão para Blast Motion, uma empresa de telemetria esportiva (análise de swing para beisebol, golfe, etc.), onde analisamos dados de séries temporais de resumos de jogadores para obter recomendações.
Para aplicações mais complexas, muitas vezes precisamos encadear as solicitações de LLM com processamento entre as chamadas. Para uma empresa farmacêutica, desenvolvemos um aplicativo de rastreamento inteligente que filtra pacientes para ensaios clínicos com base em critérios extraídos de documentos de ensaios clínicos. Aqui, usamos uma abordagem de encadeamento de LLM. Primeiro, desenvolvemos um LLM para ler o documento do ensaio clínico e usar o padrão RAG para extrair critérios de inclusão e exclusão.
Para isso, um LLM relativamente mais simples, como o GPT-3.5-Turbo (ChatGPT), foi usado. Em seguida, combinamos essas entidades extraídas com o modelo de dados do banco de dados SQL dos pacientes no Snowflake, para criar um prompt. Esse prompt foi alimentado em um LLM mais poderoso, como o GPT4, o que nos deu uma consulta SQL para filtrar os pacientes, pronta para ser executada no Snowflake. Como usamos o encadeamento de LLM, podemos usar vários LLMs para cada etapa da cadeia, permitindo-nos gerenciar os custos.
Atualmente, decidimos manter essa cadeia determinística para um melhor controle. Ou seja, decidimos ter mais inteligência nas cadeias e manter a orquestração muito simples e previsível. Cada elemento da cadeia é uma aplicação complexa por si só, que levaria alguns meses para ser desenvolvida nos dias pré-LLM.
Impulsionando Casos de Uso Mais Avançados
Para um caso mais avançado, podemos usar agentes como ReAct para solicitar ao LLM que crie instruções passo a passo para seguir uma consulta específica do usuário. Isso, claro, precisaria de um LLM de alta qualidade, como o GPT4 ou o Cohere, ou o Claude 2. No entanto, então há o risco do modelo dar um passo incorreto que precisará ser verificado usando guardrails. Isso é um trade-off entre mover a inteligência para links controláveis da cadeia ou tornar a cadeia toda autônoma.
Hoje, à medida que nos acostumamos com a era da Inteligência Artificial Gerativa para linguagem, a indústria está começando a adotar aplicações de LLM com Cadeias previsíveis. À medida que essa adoção cresce, logo começaremos a experimentar com mais autonomia para essas cadeias por meio de agentes. É sobre isso que o debate sobre a IA Geral é e estamos interessados em ver como tudo isso evolui ao longo do tempo.












