Modelos e plataformas de IA

Avaliando Modelos de Linguagem Grande: Um Guia TÃĐcnico

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os modelos de linguagem grande (LLM) como GPT-4, Claude e LLaMA explodiram em popularidade. Graças à sua capacidade de gerar textos impressionantemente semelhantes aos humanos, esses sistemas de IA estÃĢo sendo usados para tudo, desde criaçÃĢo de conteÚdo atÃĐ chatbots de atendimento ao cliente.

Mas como sabemos se esses modelos sÃĢo realmente bons? Com novos LLMs sendo anunciados constantemente, todos alegando ser maiores e melhores, como avaliamos e comparamos seu desempenho?

Neste guia abrangente, exploraremos as principais tÃĐcnicas para avaliar modelos de linguagem grande. Vamos olhar para os prÃģs e contras de cada abordagem, quando elas sÃĢo melhor aplicadas e como vocÊ pode aproveitÃĄ-las em seus prÃģprios testes de LLM.

MÃĐtricas Específicas de Tarefa

Uma das maneiras mais diretas de avaliar um LLM ÃĐ testÃĄ-lo em tarefas de NLP estabelecidas usando mÃĐtricas padronizadas. Por exemplo:

Resumo

Para tarefas de resumo, mÃĐtricas como ROUGE (Recall-Oriented Understudy for Gisting Evaluation) sÃĢo comumente usadas. ROUGE compara o resumo gerado pelo modelo com um resumo “referÊncia” escrito por humanos, contando a sobreposiçÃĢo de palavras ou frases.

Existem vÃĄrias variaçÃĩes de ROUGE, cada uma com seus prÃģs e contras:

  • ROUGE-N: Compara a sobreposiçÃĢo de n-gramas (sequÊncias de N palavras). ROUGE-1 usa unigramas (palavras Únicas), ROUGE-2 usa bigramas, etc. A vantagem ÃĐ que captura a ordem das palavras, mas pode ser muito rígido.
  • ROUGE-L: Baseado na subsequÊncia comum mais longa (LCS). Mais flexível em relaçÃĢo à ordem das palavras, mas se concentra nos principais pontos.
  • ROUGE-W: Pesa as correspondÊncias de LCS por sua significÃĒncia. Tenta melhorar o ROUGE-L.

Em geral, as mÃĐtricas ROUGE sÃĢo rÃĄpidas, automÃĄticas e funcionam bem para classificar resumos de sistemas. No entanto, elas nÃĢo medem a coerÊncia ou o significado. Um resumo pode obter uma alta pontuaçÃĢo ROUGE e ainda ser sem sentido.

A fÃģrmula para ROUGE-N ÃĐ:

ROUGE-N=∑∈{Resumos de ReferÊncia}∑∑ïŋ―∈{Resumos de ReferÊncia}∑

Onde:

  • Count_{match}(gram_n) ÃĐ a contagem de n-gramas no resumo gerado e no resumo de referÊncia.
  • Count(gram_n) ÃĐ a contagem de n-gramas no resumo de referÊncia.

Por exemplo, para ROUGE-1 (unigramas):

  • Resumo gerado: “O gato sentou-se.”
  • Resumo de referÊncia: “O gato sentou-se no tapete.”
  • Unigramas sobrepostos: “O”, “gato”, “sentou-se”
  • PontuaçÃĢo ROUGE-1 = 3/5 = 0,6

ROUGE-L usa a subsequÊncia comum mais longa (LCS). É mais flexível em relaçÃĢo à ordem das palavras. A fÃģrmula ÃĐ:

ROUGE-L=ïŋ―ïŋ―ïŋ―(gerado, referÊncia)max(length(gerado), length(referÊncia))

Onde LCS ÃĐ o comprimento da subsequÊncia comum mais longa.

ROUGE-W pondera as correspondÊncias de LCS. Considera a significÃĒncia de cada correspondÊncia na LCS.

TraduçÃĢo

Para tarefas de traduçÃĢo, BLEU (Bilingual Evaluation Understudy) ÃĐ uma mÃĐtrica popular. BLEU mede a semelhança entre a saída de traduçÃĢo do modelo e traduçÃĩes profissionais humanas, usando precisÃĢo de n-gramas e uma penalidade de brevidade.

Aspectos-chave de como BLEU funciona:

  • Compara sobreposiçÃĩes de n-gramas para n atÃĐ 4 (unigramas, bigramas, trigramas, 4-gramas).
  • Calcula uma mÃĐdia geomÃĐtrica das precisÃĩes de n-gramas.
  • Aplica uma penalidade de brevidade se a traduçÃĢo for muito mais curta do que a referÊncia.
  • Geralmente varia de 0 a 1, com 1 sendo uma correspondÊncia perfeita com a referÊncia.

BLEU se correlaciona razoavelmente bem com julgamentos humanos de qualidade de traduçÃĢo. Mas ainda tem limitaçÃĩes:

  • Apenas mede precisÃĢo em relaçÃĢo às referÊncias, nÃĢo recall ou F1.
  • Luta com traduçÃĩes criativas que usam palavras diferentes.
  • Suscetível a “jogadas” com truques de traduçÃĢo.

Outras mÃĐtricas de traduçÃĢo, como METEOR e TER, tentam melhorar as fraquezas do BLEU. Mas, em geral, mÃĐtricas automÃĄticas nÃĢo capturam completamente a qualidade da traduçÃĢo.

Outras Tarefas

AlÃĐm de resumo e traduçÃĢo, mÃĐtricas como F1, precisÃĢo, MSE e mais podem ser usadas para avaliar o desempenho de LLM em tarefas como:

  • ClassificaçÃĢo de texto
  • ExtraçÃĢo de informaçÃĩes
  • Resposta a perguntas
  • AnÃĄlise de sentimento
  • DetecçÃĢo de erros gramaticais

A vantagem das mÃĐtricas específicas de tarefa ÃĐ que a avaliaçÃĢo pode ser totalmente automatizada usando conjuntos de dados padronizados, como SQuAD para QA e GLUE benchmark para uma variedade de tarefas. Os resultados podem ser facilmente acompanhados ao longo do tempo à medida que os modelos melhoram.

No entanto, essas mÃĐtricas estÃĢo focadas em uma tarefa específica e nÃĢo podem medir a qualidade geral da linguagem. LLMs que performam bem em mÃĐtricas para uma tarefa específica podem falhar ao gerar textos coerentes, lÃģgicos e Úteis em geral.

ReferÊncias de Pesquisa

Uma forma popular de avaliar LLMs ÃĐ testÃĄ-los contra referÊncias de pesquisa abrangentes que cobrem tÃģpicos e habilidades diversificados. Essas referÊncias permitem que os modelos sejam testados rapidamente em escala.

Algumas referÊncias bem conhecidas incluem:

  • SuperGLUE – Conjunto desafiador de 11 tarefas de linguagem diversificadas.
  • GLUE – ColeçÃĢo de 9 tarefas de compreensÃĢo de sentenças. Mais simples do que SuperGLUE.
  • MMLU – 57 tarefas diferentes de ciÊncias, ciÊncias sociais e humanidades. Testa conhecimento e habilidade de raciocínio.
  • Winograd Schema Challenge – Problemas de resoluçÃĢo de pronomes que exigem raciocínio comum.
  • ARC – Tarefas de raciocínio natural desafiadoras.
  • Hellaswag – Raciocínio comum sobre situaçÃĩes.
  • PIQA – Perguntas de física que exigem diagramas.

Ao avaliar essas referÊncias, os pesquisadores podem testar rapidamente os modelos em sua capacidade de realizar matemÃĄtica, lÃģgica, raciocínio, codificaçÃĢo, senso comum e muito mais. O percentual de perguntas respondidas corretamente se torna uma mÃĐtrica de referÊncia para comparar os modelos.

No entanto, um problema significativo com as referÊncias ÃĐ a contaminaçÃĢo de dados de treinamento. Muitas referÊncias contÊm exemplos que jÃĄ foram vistos pelos modelos durante o treinamento. Isso permite que os modelos “memorizem” respostas para perguntas específicas e performem melhor do que suas capacidades reais.

SÃĢo feitas tentativas para “descontaminar” as referÊncias removendo exemplos sobrepostos. Mas isso ÃĐ desafiador de fazer de forma abrangente, especialmente quando os modelos podem ter visto versÃĩes parafraseadas ou traduzidas de perguntas.

EntÃĢo, enquanto as referÊncias podem testar um conjunto amplo de habilidades de forma eficiente, elas nÃĢo podem medir confiavelmente as capacidades de raciocínio reais ou evitar a inflaçÃĢo de pontuaçÃĩes devido à contaminaçÃĢo. MÃĐtodos de avaliaçÃĢo complementares sÃĢo necessÃĄrios.

AvaliaçÃĢo de LLM por LLM

Uma abordagem intrigante ÃĐ ter um LLM avaliar a saída de outro LLM. A ideia ÃĐ aproveitar a tarefa “mais fÃĄcil”:

  • Produzir uma saída de alta qualidade pode ser difícil para um LLM.
  • Mas determinar se uma saída dada ÃĐ de alta qualidade pode ser uma tarefa mais fÃĄcil.

Por exemplo, enquanto um LLM pode lutar para gerar um parÃĄgrafo factual, coerente e lÃģgico do zero, ele pode mais facilmente julgar se um parÃĄgrafo dado faz sentido lÃģgico e se encaixa no contexto.

EntÃĢo, o processo ÃĐ:

  1. Passar o prompt de entrada para o primeiro LLM para gerar a saída.
  2. Passar o prompt de entrada + saída gerada para o segundo LLM “avaliador”.
  3. Perguntar ao LLM avaliador uma pergunta para avaliar a qualidade da saída. Por exemplo, “A resposta acima faz sentido lÃģgico?”

Essa abordagem ÃĐ rÃĄpida de implementar e automatiza a avaliaçÃĢo de LLM. Mas existem alguns desafios:

  • O desempenho depende fortemente da escolha do LLM avaliador e da redaçÃĢo do prompt.
  • EstÃĄ limitado pela dificuldade da tarefa original. Avaliar raciocínio complexo ainda ÃĐ difícil para LLMs.
  • Pode ser computacionalmente caro se usar LLMs baseados em API.

A avaliaçÃĢo por LLM ÃĐ especialmente promissora para avaliar informaçÃĩes recuperadas em sistemas de RAG (retrieval-augmented generation). Consultas adicionais de LLM podem validar se o contexto recuperado ÃĐ usado apropriadamente.

No geral, a autoavaliaçÃĢo mostra potencial, mas requer cuidado na implementaçÃĢo. Ela complementa, em vez de substituir, a avaliaçÃĢo humana.

AvaliaçÃĢo Humana

Dada as limitaçÃĩes das mÃĐtricas automÃĄticas e das referÊncias, a avaliaçÃĢo humana ainda ÃĐ o padrÃĢo de ouro para avaliar rigorosamente a qualidade de LLM.

Especialistas podem fornecer avaliaçÃĩes qualitativas detalhadas sobre:

  • PrecisÃĢo e correçÃĢo factual
  • LÃģgica, raciocínio e senso comum
  • CoerÊncia, consistÊncia e legibilidade
  • AdequaçÃĢo do tom, estilo e voz
  • Gramaticalidade e fluÊncia
  • Criatividade e nuances

Para avaliar um modelo, os humanos recebem um conjunto de prompts de entrada e as respostas geradas pelo LLM. Eles avaliam a qualidade das respostas, frequentemente usando escalas de classificaçÃĢo e rubricas.

A desvantagem ÃĐ que a avaliaçÃĢo humana manual ÃĐ cara, lenta e difícil de escalar. Ela tambÃĐm exige o desenvolvimento de critÃĐrios padronizados e treinamento de avaliadores para aplicÃĄ-los consistentemente.

Alguns pesquisadores exploraram maneiras criativas de financiar avaliaçÃĩes humanas de LLM usando sistemas de torneio, onde as pessoas apostam e julgam partidas entre modelos. Mas a cobertura ainda ÃĐ limitada em comparaçÃĢo com avaliaçÃĩes manuais completas.

Para casos de uso empresariais onde a qualidade ÃĐ mais importante do que a escala bruta, a avaliaçÃĢo humana especializada permanece o padrÃĢo de ouro, apesar dos custos. Isso ÃĐ especialmente verdadeiro para aplicaçÃĩes mais arriscadas de LLMs.

ConclusÃĢo

Avaliar modelos de linguagem grande de forma abrangente requer o uso de uma ferramenta diversificada de mÃĐtodos complementares, em vez de confiar em uma tÃĐcnica Única.

Combinando abordagens automÃĄticas para velocidade com supervisÃĢo humana rigorosa para precisÃĢo, podemos desenvolver metodologias de teste confiÃĄveis para modelos de linguagem grande. Com avaliaçÃĢo robusta, podemos desbloquear o tremendo potencial dos LLMs enquanto gerenciamos seus riscos de forma responsÃĄvel.

Eu passei os Últimos cinco anos me imergindo no fascinante mundo de Aprendizado de MÃĄquina e Aprendizado Profundo. Minha paixÃĢo e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua tambÃĐm me levou em direçÃĢo ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.