Modelos e plataformas de IA
Avaliando Modelos de Linguagem Grande: Um Guia TÃĐcnico
Os modelos de linguagem grande (LLM) como GPT-4, Claude e LLaMA explodiram em popularidade. Graças à sua capacidade de gerar textos impressionantemente semelhantes aos humanos, esses sistemas de IA estÃĢo sendo usados para tudo, desde criaçÃĢo de conteÚdo atÃĐ chatbots de atendimento ao cliente.
Mas como sabemos se esses modelos sÃĢo realmente bons? Com novos LLMs sendo anunciados constantemente, todos alegando ser maiores e melhores, como avaliamos e comparamos seu desempenho?
Neste guia abrangente, exploraremos as principais tÃĐcnicas para avaliar modelos de linguagem grande. Vamos olhar para os prÃģs e contras de cada abordagem, quando elas sÃĢo melhor aplicadas e como vocÊ pode aproveitÃĄ-las em seus prÃģprios testes de LLM.
MÃĐtricas EspecÃficas de Tarefa
Uma das maneiras mais diretas de avaliar um LLM ÃĐ testÃĄ-lo em tarefas de NLP estabelecidas usando mÃĐtricas padronizadas. Por exemplo:
Resumo
Para tarefas de resumo, mÃĐtricas como ROUGE (Recall-Oriented Understudy for Gisting Evaluation) sÃĢo comumente usadas. ROUGE compara o resumo gerado pelo modelo com um resumo âreferÊnciaâ escrito por humanos, contando a sobreposiçÃĢo de palavras ou frases.
Existem vÃĄrias variaçÃĩes de ROUGE, cada uma com seus prÃģs e contras:
- ROUGE-N: Compara a sobreposiçÃĢo de n-gramas (sequÊncias de N palavras). ROUGE-1 usa unigramas (palavras Únicas), ROUGE-2 usa bigramas, etc. A vantagem ÃĐ que captura a ordem das palavras, mas pode ser muito rÃgido.
- ROUGE-L: Baseado na subsequÊncia comum mais longa (LCS). Mais flexÃvel em relaçÃĢo à ordem das palavras, mas se concentra nos principais pontos.
- ROUGE-W: Pesa as correspondÊncias de LCS por sua significÃĒncia. Tenta melhorar o ROUGE-L.
Em geral, as mÃĐtricas ROUGE sÃĢo rÃĄpidas, automÃĄticas e funcionam bem para classificar resumos de sistemas. No entanto, elas nÃĢo medem a coerÊncia ou o significado. Um resumo pode obter uma alta pontuaçÃĢo ROUGE e ainda ser sem sentido.
A fÃģrmula para ROUGE-N ÃĐ:
ROUGE-N=ââ{Resumos de ReferÊncia}ââïŋ―â{Resumos de ReferÊncia}â
Onde:
Count_{match}(gram_n)ÃĐ a contagem de n-gramas no resumo gerado e no resumo de referÊncia.Count(gram_n)ÃĐ a contagem de n-gramas no resumo de referÊncia.
Por exemplo, para ROUGE-1 (unigramas):
- Resumo gerado: âO gato sentou-se.â
- Resumo de referÊncia: âO gato sentou-se no tapete.â
- Unigramas sobrepostos: âOâ, âgatoâ, âsentou-seâ
- PontuaçÃĢo ROUGE-1 = 3/5 = 0,6
ROUGE-L usa a subsequÊncia comum mais longa (LCS). à mais flexÃvel em relaçÃĢo à ordem das palavras. A fÃģrmula ÃĐ:
ROUGE-L=ïŋ―ïŋ―ïŋ―(gerado, referÊncia)max(length(gerado), length(referÊncia))
Onde LCS ÃĐ o comprimento da subsequÊncia comum mais longa.
ROUGE-W pondera as correspondÊncias de LCS. Considera a significÃĒncia de cada correspondÊncia na LCS.
TraduçÃĢo
Para tarefas de traduçÃĢo, BLEU (Bilingual Evaluation Understudy) ÃĐ uma mÃĐtrica popular. BLEU mede a semelhança entre a saÃda de traduçÃĢo do modelo e traduçÃĩes profissionais humanas, usando precisÃĢo de n-gramas e uma penalidade de brevidade.
Aspectos-chave de como BLEU funciona:
- Compara sobreposiçÃĩes de n-gramas para n atÃĐ 4 (unigramas, bigramas, trigramas, 4-gramas).
- Calcula uma mÃĐdia geomÃĐtrica das precisÃĩes de n-gramas.
- Aplica uma penalidade de brevidade se a traduçÃĢo for muito mais curta do que a referÊncia.
- Geralmente varia de 0 a 1, com 1 sendo uma correspondÊncia perfeita com a referÊncia.
BLEU se correlaciona razoavelmente bem com julgamentos humanos de qualidade de traduçÃĢo. Mas ainda tem limitaçÃĩes:
- Apenas mede precisÃĢo em relaçÃĢo à s referÊncias, nÃĢo recall ou F1.
- Luta com traduçÃĩes criativas que usam palavras diferentes.
- SuscetÃvel a âjogadasâ com truques de traduçÃĢo.
Outras mÃĐtricas de traduçÃĢo, como METEOR e TER, tentam melhorar as fraquezas do BLEU. Mas, em geral, mÃĐtricas automÃĄticas nÃĢo capturam completamente a qualidade da traduçÃĢo.
Outras Tarefas
AlÃĐm de resumo e traduçÃĢo, mÃĐtricas como F1, precisÃĢo, MSE e mais podem ser usadas para avaliar o desempenho de LLM em tarefas como:
- ClassificaçÃĢo de texto
- ExtraçÃĢo de informaçÃĩes
- Resposta a perguntas
- AnÃĄlise de sentimento
- DetecçÃĢo de erros gramaticais
A vantagem das mÃĐtricas especÃficas de tarefa ÃĐ que a avaliaçÃĢo pode ser totalmente automatizada usando conjuntos de dados padronizados, como SQuAD para QA e GLUE benchmark para uma variedade de tarefas. Os resultados podem ser facilmente acompanhados ao longo do tempo à medida que os modelos melhoram.
No entanto, essas mÃĐtricas estÃĢo focadas em uma tarefa especÃfica e nÃĢo podem medir a qualidade geral da linguagem. LLMs que performam bem em mÃĐtricas para uma tarefa especÃfica podem falhar ao gerar textos coerentes, lÃģgicos e Úteis em geral.
ReferÊncias de Pesquisa
Uma forma popular de avaliar LLMs ÃĐ testÃĄ-los contra referÊncias de pesquisa abrangentes que cobrem tÃģpicos e habilidades diversificados. Essas referÊncias permitem que os modelos sejam testados rapidamente em escala.
Algumas referÊncias bem conhecidas incluem:
- SuperGLUE â Conjunto desafiador de 11 tarefas de linguagem diversificadas.
- GLUE â ColeçÃĢo de 9 tarefas de compreensÃĢo de sentenças. Mais simples do que SuperGLUE.
- MMLU â 57 tarefas diferentes de ciÊncias, ciÊncias sociais e humanidades. Testa conhecimento e habilidade de raciocÃnio.
- Winograd Schema Challenge â Problemas de resoluçÃĢo de pronomes que exigem raciocÃnio comum.
- ARC â Tarefas de raciocÃnio natural desafiadoras.
- Hellaswag â RaciocÃnio comum sobre situaçÃĩes.
- PIQA â Perguntas de fÃsica que exigem diagramas.
Ao avaliar essas referÊncias, os pesquisadores podem testar rapidamente os modelos em sua capacidade de realizar matemÃĄtica, lÃģgica, raciocÃnio, codificaçÃĢo, senso comum e muito mais. O percentual de perguntas respondidas corretamente se torna uma mÃĐtrica de referÊncia para comparar os modelos.
No entanto, um problema significativo com as referÊncias ÃĐ a contaminaçÃĢo de dados de treinamento. Muitas referÊncias contÊm exemplos que jÃĄ foram vistos pelos modelos durante o treinamento. Isso permite que os modelos âmemorizemâ respostas para perguntas especÃficas e performem melhor do que suas capacidades reais.
SÃĢo feitas tentativas para âdescontaminarâ as referÊncias removendo exemplos sobrepostos. Mas isso ÃĐ desafiador de fazer de forma abrangente, especialmente quando os modelos podem ter visto versÃĩes parafraseadas ou traduzidas de perguntas.
EntÃĢo, enquanto as referÊncias podem testar um conjunto amplo de habilidades de forma eficiente, elas nÃĢo podem medir confiavelmente as capacidades de raciocÃnio reais ou evitar a inflaçÃĢo de pontuaçÃĩes devido à contaminaçÃĢo. MÃĐtodos de avaliaçÃĢo complementares sÃĢo necessÃĄrios.
AvaliaçÃĢo de LLM por LLM
Uma abordagem intrigante ÃĐ ter um LLM avaliar a saÃda de outro LLM. A ideia ÃĐ aproveitar a tarefa âmais fÃĄcilâ:
- Produzir uma saÃda de alta qualidade pode ser difÃcil para um LLM.
- Mas determinar se uma saÃda dada ÃĐ de alta qualidade pode ser uma tarefa mais fÃĄcil.
Por exemplo, enquanto um LLM pode lutar para gerar um parÃĄgrafo factual, coerente e lÃģgico do zero, ele pode mais facilmente julgar se um parÃĄgrafo dado faz sentido lÃģgico e se encaixa no contexto.
EntÃĢo, o processo ÃĐ:
- Passar o prompt de entrada para o primeiro LLM para gerar a saÃda.
- Passar o prompt de entrada + saÃda gerada para o segundo LLM âavaliadorâ.
- Perguntar ao LLM avaliador uma pergunta para avaliar a qualidade da saÃda. Por exemplo, âA resposta acima faz sentido lÃģgico?â
Essa abordagem ÃĐ rÃĄpida de implementar e automatiza a avaliaçÃĢo de LLM. Mas existem alguns desafios:
- O desempenho depende fortemente da escolha do LLM avaliador e da redaçÃĢo do prompt.
- EstÃĄ limitado pela dificuldade da tarefa original. Avaliar raciocÃnio complexo ainda ÃĐ difÃcil para LLMs.
- Pode ser computacionalmente caro se usar LLMs baseados em API.
A avaliaçÃĢo por LLM ÃĐ especialmente promissora para avaliar informaçÃĩes recuperadas em sistemas de RAG (retrieval-augmented generation). Consultas adicionais de LLM podem validar se o contexto recuperado ÃĐ usado apropriadamente.
No geral, a autoavaliaçÃĢo mostra potencial, mas requer cuidado na implementaçÃĢo. Ela complementa, em vez de substituir, a avaliaçÃĢo humana.
AvaliaçÃĢo Humana
Dada as limitaçÃĩes das mÃĐtricas automÃĄticas e das referÊncias, a avaliaçÃĢo humana ainda ÃĐ o padrÃĢo de ouro para avaliar rigorosamente a qualidade de LLM.
Especialistas podem fornecer avaliaçÃĩes qualitativas detalhadas sobre:
- PrecisÃĢo e correçÃĢo factual
- LÃģgica, raciocÃnio e senso comum
- CoerÊncia, consistÊncia e legibilidade
- AdequaçÃĢo do tom, estilo e voz
- Gramaticalidade e fluÊncia
- Criatividade e nuances
Para avaliar um modelo, os humanos recebem um conjunto de prompts de entrada e as respostas geradas pelo LLM. Eles avaliam a qualidade das respostas, frequentemente usando escalas de classificaçÃĢo e rubricas.
A desvantagem ÃĐ que a avaliaçÃĢo humana manual ÃĐ cara, lenta e difÃcil de escalar. Ela tambÃĐm exige o desenvolvimento de critÃĐrios padronizados e treinamento de avaliadores para aplicÃĄ-los consistentemente.
Alguns pesquisadores exploraram maneiras criativas de financiar avaliaçÃĩes humanas de LLM usando sistemas de torneio, onde as pessoas apostam e julgam partidas entre modelos. Mas a cobertura ainda ÃĐ limitada em comparaçÃĢo com avaliaçÃĩes manuais completas.
Para casos de uso empresariais onde a qualidade ÃĐ mais importante do que a escala bruta, a avaliaçÃĢo humana especializada permanece o padrÃĢo de ouro, apesar dos custos. Isso ÃĐ especialmente verdadeiro para aplicaçÃĩes mais arriscadas de LLMs.
ConclusÃĢo
Avaliar modelos de linguagem grande de forma abrangente requer o uso de uma ferramenta diversificada de mÃĐtodos complementares, em vez de confiar em uma tÃĐcnica Única.
Combinando abordagens automÃĄticas para velocidade com supervisÃĢo humana rigorosa para precisÃĢo, podemos desenvolver metodologias de teste confiÃĄveis para modelos de linguagem grande. Com avaliaçÃĢo robusta, podemos desbloquear o tremendo potencial dos LLMs enquanto gerenciamos seus riscos de forma responsÃĄvel.












