Modelos y plataformas de IA
EvaluaciÃģn de Modelos de Lenguaje Grande: Una GuÃa TÃĐcnica
Los modelos de lenguaje grande (LLM) como GPT-4, Claude y LLaMA han explotado en popularidad. Gracias a su capacidad para generar texto impresionantemente similar al humano, estos sistemas de inteligencia artificial ahora se utilizan para todo, desde la creaciÃģn de contenido hasta los chatbots de servicio al cliente.
Pero, ÂŋcÃģmo sabemos si estos modelos son realmente buenos? Con nuevos LLM siendo anunciados constantemente, todos afirmando ser mÃĄs grandes y mejores, ÂŋcÃģmo evaluamos y comparamos su rendimiento?
En esta guÃa integral, exploraremos las principales tÃĐcnicas para evaluar los modelos de lenguaje grande. Analizaremos los pros y los contras de cada enfoque, cuÃĄndo se aplican mejor y cÃģmo puedes aprovecharlos en tus propias pruebas de LLM.
MÃĐtricas EspecÃficas de Tarea
Una de las formas mÃĄs directas de evaluar un LLM es probarlo en tareas de NLP establecidas utilizando mÃĐtricas estandarizadas. Por ejemplo:
Resumen
Para tareas de resumen, se utilizan comÚnmente mÃĐtricas como ROUGE (Recall-Oriented Understudy for Gisting Evaluation). ROUGE compara el resumen generado por el modelo con un resumen âde referenciaâ escrito por un humano, contando la superposiciÃģn de palabras o frases.
Hay varias variantes de ROUGE, cada una con sus pros y contras:
- ROUGE-N: Compara la superposiciÃģn de n-gramas (secuencias de N palabras). ROUGE-1 utiliza unigramas (palabras individuales), ROUGE-2 utiliza bigramas, etc. La ventaja es que captura el orden de las palabras, pero puede ser demasiado estricto.
- ROUGE-L: Basado en la subsecuencia comÚn mÃĄs larga (LCS). MÃĄs flexible en el orden de las palabras, pero se centra en los puntos principales.
- ROUGE-W: Pondera las coincidencias de LCS por su significado. Intenta mejorar a ROUGE-L.
En general, las mÃĐtricas de ROUGE son rÃĄpidas, automÃĄticas y funcionan bien para clasificar resÚmenes de sistemas. Sin embargo, no miden la coherencia ni el significado. Un resumen podrÃa obtener una alta puntuaciÃģn de ROUGE y aÚn ser sin sentido.
La fÃģrmula para ROUGE-N es:
ROUGE-N=ââ{ResÚmenes de Referencia}ââïŋ―â{ResÚmenes de Referencia}â
Donde:
Count_{match}(gram_n)es el recuento de n-gramas en ambos el resumen generado y el resumen de referencia.Count(gram_n)es el recuento de n-gramas en el resumen de referencia.
Por ejemplo, para ROUGE-1 (unigramas):
- Resumen generado: âEl gato se sentÃģ.â
- Resumen de referencia: âEl gato se sentÃģ en la alfombra.â
- Unigramas superpuestos: âElâ, âgatoâ, âse sentÃģâ
- PuntuaciÃģn de ROUGE-1 = 3/5 = 0,6
ROUGE-L utiliza la subsecuencia comÚn mÃĄs larga (LCS). Es mÃĄs flexible con el orden de las palabras. La fÃģrmula es:
ROUGE-L=ïŋ―ïŋ―ïŋ―(generated,reference)max(length(generated), length(reference))
DÃģnde LCS es la longitud de la subsecuencia comÚn mÃĄs larga.
ROUGE-W pondera las coincidencias de LCS. Considera la importancia de cada coincidencia en la LCS.
TraducciÃģn
Para tareas de traducciÃģn automÃĄtica, BLEU (Bilingual Evaluation Understudy) es una mÃĐtrica popular. BLEU mide la similitud entre la salida de traducciÃģn del modelo y las traducciones profesionales humanas, utilizando la precisiÃģn de n-gramas y una penalizaciÃģn por brevedad.
Aspectos clave de cÃģmo funciona BLEU:
- Compara superposiciones de n-gramas para n hasta 4 (unigramas, bigramas, trigramas, 4-gramas).
- Calcula una media geomÃĐtrica de las precisiones de n-gramas.
- Aplica una penalizaciÃģn por brevedad si la traducciÃģn es mucho mÃĄs corta que la de referencia.
- Generalmente oscila entre 0 y 1, siendo 1 una coincidencia perfecta con la referencia.
BLEU se correlaciona razonablemente bien con los juicios humanos de la calidad de la traducciÃģn. Pero todavÃa tiene limitaciones:
- Solo mide la precisiÃģn contra referencias, no la recuperaciÃģn ni la F1.
- Tiene dificultades con traducciones creativas que utilizan una redacciÃģn diferente.
- Es susceptible a âjugarâ con trucos de traducciÃģn.
Otras mÃĐtricas de traducciÃģn como METEOR y TER intentan mejorar las debilidades de BLEU. Pero en general, las mÃĐtricas automÃĄticas no capturan completamente la calidad de la traducciÃģn.
Otras Tareas
AdemÃĄs de la resoluciÃģn de resÚmenes y traducciones, se pueden utilizar mÃĐtricas como F1, precisiÃģn, MSE y mÃĄs para evaluar el rendimiento de LLM en tareas como:
- ClasificaciÃģn de texto
- ExtracciÃģn de informaciÃģn
- Respuesta a preguntas
- AnÃĄlisis de sentimiento
- DetecciÃģn de errores gramaticales
La ventaja de las mÃĐtricas especÃficas de tarea es que la evaluaciÃģn puede ser completamente automatizada utilizando conjuntos de datos estandarizados como SQuAD para QA y GLUE para una variedad de tareas. Los resultados pueden ser fÃĄcilmente rastreados con el tiempo a medida que los modelos mejoran.
Sin embargo, estas mÃĐtricas estÃĄn enfocadas de manera estrecha y no pueden medir la calidad general del lenguaje. Los LLM que funcionan bien en mÃĐtricas para una sola tarea pueden fallar al generar texto coherente, lÃģgico y Útil en general.
Benchmark de InvestigaciÃģn
Una forma popular de evaluar LLM es probarlos contra benchmarks de investigaciÃģn amplios que cubren temas y habilidades diversos. Estos benchmarks permiten que los modelos sean probados rÃĄpidamente a gran escala.
Algunos benchmarks conocidos incluyen:
- SuperGLUE â Un conjunto desafiante de 11 tareas de lenguaje diversas.
- GLUE â Una colecciÃģn de 9 tareas de comprensiÃģn de oraciones. MÃĄs simple que SuperGLUE.
- MMLU â 57 tareas diferentes de ciencias, tecnologÃa, ingenierÃa y matemÃĄticas (STEM), ciencias sociales y humanidades. Prueba conocimiento y habilidad de razonamiento.
- Winograd Schema Challenge â Problemas de resoluciÃģn de pronombres que requieren razonamiento comÚn.
- ARC â Tareas de razonamiento de lenguaje natural desafiantes.
- Hellaswag â Razonamiento comÚn sobre situaciones.
- PIQA â Preguntas de fÃsica que requieren diagramas.
Al evaluar en benchmarks como estos, los investigadores pueden probar rÃĄpidamente los modelos en su capacidad para realizar matemÃĄticas, lÃģgica, razonamiento, codificaciÃģn, sentido comÚn y mucho mÃĄs. El porcentaje de preguntas respondidas correctamente se convierte en una mÃĐtrica de benchmark para comparar modelos.
Sin embargo, un problema importante con los benchmarks es la contaminaciÃģn de datos de entrenamiento. Muchos benchmarks contienen ejemplos que ya fueron vistos por los modelos durante el entrenamiento previo. Esto permite que los modelos âmemoricenâ respuestas a preguntas especÃficas y funcionen mejor de lo que realmente son capaces.
Se intentan âdescontaminarâ los benchmarks eliminando ejemplos superpuestos. Pero esto es desafiante de hacer de manera integral, especialmente cuando los modelos pueden haber visto versiones parafraseadas o traducidas de las preguntas.
Asà que, aunque los benchmarks pueden probar un conjunto amplio de habilidades de manera eficiente, no pueden medir de manera fiable las capacidades de razonamiento verdaderas ni evitar la inflaciÃģn de puntuaciones debido a la contaminaciÃģn. Se necesitan mÃĐtodos de evaluaciÃģn complementarios.
AutorregulaciÃģn de LLM
Un enfoque intrigante es tener un LLM que evalÚe las salidas de otro LLM. La idea es aprovechar la tarea âmÃĄs fÃĄcilâ:
- Producir una salida de alta calidad puede ser difÃcil para un LLM.
- Pero determinar si una salida dada es de alta calidad puede ser una tarea mÃĄs fÃĄcil.
Por ejemplo, mientras que un LLM puede luchar por generar un pÃĄrrafo factual y coherente desde cero, puede juzgar mÃĄs fÃĄcilmente si un pÃĄrrafo dado tiene sentido lÃģgico y se ajusta al contexto.
Asà que el proceso es:
- Pasar la entrada de la promociÃģn al primer LLM para generar la salida.
- Pasar la entrada de la promociÃģn + la salida generada al segundo LLM âevaluadorâ.
- Preguntar al LLM evaluador una pregunta para evaluar la calidad de la salida. Por ejemplo, âÂŋLa respuesta anterior tiene sentido lÃģgico?â
Este enfoque es rÃĄpido de implementar y automatiza la evaluaciÃģn de LLM. Pero hay algunos desafÃos:
- El rendimiento depende mucho de la elecciÃģn del LLM evaluador y la redacciÃģn de la promociÃģn.
- EstÃĄ limitado por la dificultad de la tarea original. Evaluar el razonamiento complejo sigue siendo difÃcil para los LLM.
- Puede ser costoso en tÃĐrminos computacionales si se utilizan LLM basados en API.
La autorregulaciÃģn es especialmente prometedora para evaluar la informaciÃģn recuperada en sistemas de RAG (generaciÃģn aumentada con recuperaciÃģn). Las consultas adicionales de LLM pueden validar si el contexto recuperado se utiliza adecuadamente.
En general, la autorregulaciÃģn muestra potencial pero requiere cuidado en la implementaciÃģn. Complementa, en lugar de reemplazar, la evaluaciÃģn humana.
EvaluaciÃģn Humana
Dadas las limitaciones de las mÃĐtricas automÃĄticas y los benchmarks, la evaluaciÃģn humana sigue siendo el estÃĄndar de oro para evaluar rigurosamente la calidad de LLM.
Los expertos pueden proporcionar evaluaciones cualitativas detalladas sobre:
- PrecisiÃģn y correcciÃģn factual
- LÃģgica, razonamiento y sentido comÚn
- Coherencia, consistencia y legibilidad
- AdecuaciÃģn del tono, estilo y voz
- Gramaticalidad y fluidez
- Creatividad y sutileza
Para evaluar un modelo, a los humanos se les da un conjunto de promociones de entrada y las respuestas generadas por LLM. EvalÚan la calidad de las respuestas, a menudo utilizando escalas de calificaciÃģn y rubricas.
La desventaja es que la evaluaciÃģn humana manual es costosa, lenta y difÃcil de escalar. TambiÃĐn requiere desarrollar criterios estandarizados y capacitar a los evaluadores para aplicarlos consistentemente.
Algunos investigadores han explorado formas creativas de financiar las evaluaciones humanas de LLM mediante sistemas de torneo en los que las personas apuestan y juzgan enfrentamientos entre modelos. Pero la cobertura sigue siendo limitada en comparaciÃģn con las evaluaciones manuales completas.
Para casos de uso empresariales donde la calidad es mÃĄs importante que la escala bruta, las pruebas humanas expertas siguen siendo el estÃĄndar de oro a pesar de sus costos. Esto es especialmente cierto para aplicaciones mÃĄs riesgosas de LLM.
ConclusiÃģn
Evaluar modelos de lenguaje grande de manera integral requiere utilizar una herramienta diversa de mÃĐtodos complementarios, en lugar de confiar en una sola tÃĐcnica.
Al combinar enfoques automÃĄticos para la velocidad con una supervisiÃģn humana rigurosa para la precisiÃģn, podemos desarrollar metodologÃas de prueba confiables para modelos de lenguaje grande. Con una evaluaciÃģn robusta, podemos desbloquear el enorme potencial de los LLM mientras gestionamos sus riesgos de manera responsable.












