Líderes de opinión
Benchmarks para LLM
Comprenda el papel y las limitaciones de los benchmarks en la evaluación del rendimiento de los LLM. Explore las técnicas para desarrollar LLM robustos.
Los Modelos de Lenguaje Grande han ganado una gran popularidad en los últimos años. Me refiero a que lo has visto. La capacidad excepcional de los LLM para entender comandos de lenguaje humano los ha convertido en la integración perfecta para las empresas, apoyando flujos de trabajo críticos y automatizando tareas para alcanzar la máxima eficiencia. Además, más allá de la comprensión del usuario promedio, hay mucho más que los LLM pueden hacer. Y a medida que nuestra dependencia de ellos crece, debemos prestar mucha más atención a las medidas para garantizar la precisión y la confiabilidad necesarias. Esta es una tarea global que concierne a instituciones enteras, pero en el ámbito de las empresas, ahora hay varios benchmarks que se pueden utilizar para evaluar el rendimiento de los LLM en varios dominios. Estos pueden probar las habilidades del modelo en comprensión, razonamiento lógico, matemáticas, etc., y los resultados determinan si un LLM está listo para la implementación empresarial.
En este artículo, he reunido una lista completa de los benchmarks más populares para la evaluación de LLM. Discutiremos cada benchmark en detalle y veremos cómo diferentes LLM se desempeñan contra los criterios de evaluación. Pero primero, analicemos la evaluación de LLM con más detalle.
¿Qué es la evaluación de LLM?
Al igual que otros modelos de IA, los LLM también necesitan ser evaluados contra benchmarks específicos que evalúen varios aspectos del rendimiento del modelo de lenguaje: conocimiento, precisión, confiabilidad y coherencia. El estándar suele involucrar:
- Comprensión de consultas de usuario: Evaluar la capacidad del modelo para comprender y interpretar una amplia gama de entradas de usuario.
- Verificación de salida: Verificar las respuestas generadas por la IA contra una base de conocimientos de confianza para asegurarse de que sean correctas y relevantes.
- Robustez: Medir cómo se desempeña el modelo con entradas ambiguas, incompletas o ruidosas.
La evaluación de LLM da a los desarrolladores el poder de identificar y abordar limitaciones de manera eficiente, para que puedan mejorar la experiencia del usuario en general. Si un LLM se evalúa a fondo, será lo suficientemente preciso y robusto como para manejar diferentes aplicaciones del mundo real, incluso aquellas con entradas ambiguas o inesperadas.
Benchmarks
Los LLM son una de las tecnologías más complicadas hasta la fecha y pueden alimentar incluso las aplicaciones más complicadas. Entonces, el proceso de evaluación simplemente tiene que ser igual de complejo, poniendo a prueba su proceso de pensamiento y precisión técnica.
Un benchmark utiliza conjuntos de datos específicos, métricas y tareas de evaluación para probar el rendimiento de los LLM, lo que permite comparar diferentes LLM y medir su precisión, lo que a su vez impulsa el progreso en la industria mediante un mejor rendimiento.
Aquí hay algunos de los aspectos más típicos del rendimiento de los LLM:
- Conocimiento: El conocimiento del modelo debe probarse en varios dominios. Eso es lo que se hace con el benchmark de conocimiento. Evalúa cómo puede recordar información de diferentes campos, como Física, Programación, Geografía, etc.
- Razonamiento lógico: Significa probar la capacidad del modelo para ‘pensar’ paso a paso y derivar una conclusión lógica, que suele involucrar escenarios en los que el modelo debe seleccionar la continuación más plausible o explicación basada en el conocimiento cotidiano y el razonamiento lógico.
- Comprensión lectora: Los modelos deben ser excelentes en la interpretación del lenguaje natural y generar respuestas en consecuencia. La prueba se parece a responder preguntas basadas en pasajes para evaluar la comprensión, la inferencia y la retención de detalles. Algo así como una prueba de lectura en la escuela.
- Comprensión de código: Se necesita para medir la habilidad del modelo para entender, escribir y depurar código. Estos benchmarks dan al modelo tareas de programación o problemas que el modelo debe resolver con precisión, que a menudo cubren una variedad de lenguajes de programación y paradigmas.
- Conocimiento del mundo: Para evaluar la comprensión del modelo sobre el conocimiento general del mundo. Estos conjuntos de datos suelen tener preguntas que requieren un conocimiento amplio y enciclopédico para ser respondidas correctamente, lo que los hace diferentes de los benchmarks de conocimiento más específicos y especializados.
Benchmarks de “Conocimiento”
MMLU (Comprensión de lenguaje multimodal)
Este benchmark está diseñado para probar la comprensión del LLM de conocimientos factuales en varios temas como humanidades, ciencias sociales, historia, ciencias de la computación y incluso derecho. 57 preguntas y 15.000 tareas dirigidas a asegurar que el modelo tenga grandes capacidades de razonamiento. Esto hace que MMLU sea una buena herramienta para evaluar el conocimiento factual y el razonamiento del LLM en varios temas.
Recientemente se ha convertido en un benchmark clave para evaluar LLM para las áreas mencionadas anteriormente. Los desarrolladores siempre quieren optimizar sus modelos para superar a otros en este benchmark, lo que lo convierte en un estándar de facto para evaluar el razonamiento y el conocimiento avanzados en los LLM. Los modelos de gran empresa han mostrado puntuaciones impresionantes en este benchmark, incluyendo el GPT-4-omni con un 88,7%, el Claude 3 Opus con un 86,8%, el Gemini 1,5 Pro con un 85,9% y el Llama-3 70B con un 82%. Los modelos pequeños suelen no funcionar tan bien en este benchmark, generalmente sin superar el 60-65%, pero el rendimiento reciente del Phi-3-Small-7b con un 75,3% es algo a considerar.
Sin embargo, MMLU no está exento de inconvenientes: tiene problemas conocidos como preguntas ambiguas, respuestas incorrectas y falta de contexto. Además, muchos creen que algunas de sus tareas son demasiado fáciles para una evaluación adecuada de los LLM.
Me gustaría aclarar que los benchmarks como MMLU no representan perfectamente escenarios del mundo real. Si un LLM logra una gran puntuación en este, no siempre significa que se ha convertido en un experto en la materia. Los benchmarks son realmente limitados en alcance y a menudo dependen de preguntas de múltiple opción, que nunca pueden capturar completamente la complejidad y el contexto de las interacciones del mundo real. La verdadera comprensión requiere conocer hechos y aplicar ese conocimiento de manera dinámica, lo que implica pensamiento crítico, resolución de problemas y comprensión contextual. Por estas razones, los LLM necesitan ser refinados y actualizados constantemente para que el modelo mantenga la relevancia y eficacia del benchmark.
GPQA (Benchmark de preguntas y respuestas de nivel de posgrado)
Este benchmark evalúa a los LLM en razonamiento lógico utilizando un conjunto de datos con solo 448 preguntas. Fue desarrollado por expertos en el dominio y cubre temas en biología, física y química.
Cada pregunta pasa por el siguiente proceso de validación:
- Un experto en el tema responde la pregunta y proporciona retroalimentación detallada.
- El autor de la pregunta revisa la pregunta basándose en esta retroalimentación.
- Un segundo experto responde la pregunta revisada.
Este proceso puede asegurar que las preguntas sean objetivas, precisas y desafiantes para un modelo de lenguaje. Incluso los académicos experimentados logran solo una precisión del 65% en estas preguntas, mientras que el GPT-4-omni alcanza solo el 53,6%, lo que destaca la brecha entre la inteligencia humana y la máquina.
Debido a los requisitos de calificación altos, el conjunto de datos es en realidad bastante pequeño, lo que limita su poder estadístico para comparar la precisión y requiere efectos de gran tamaño. Los expertos que crearon y validaron estas preguntas provienen de Upwork, por lo que potencialmente introdujeron sesgos basados en su experiencia y los temas cubiertos.
Benchmarks de código
HumanEval
164 problemas de programación, una prueba real para las habilidades de codificación de los LLM. Es HumanEval. Está diseñado para probar las habilidades de codificación básicas de los grandes modelos de lenguaje (LLM). Utiliza la métrica pass@k para juzgar la precisión funcional del código generado, que produce la probabilidad de que al menos una de las muestras de código generadas por el LLM supere las pruebas.
Aunque el conjunto de datos HumanEval incluye firmas de función, cadenas de documentación, cuerpos de código y varias pruebas unitarias, no incluye la gama completa de problemas de codificación del mundo real, lo que no prueba adecuadamente la capacidad del modelo para generar código correcto para escenarios diversos.
MBPP (Programación de Python básica)
MBPP es un benchmark que consiste en 1.000 preguntas de programación en Python crowdsourced. Estos son problemas de nivel básico y se centran en habilidades de programación fundamentales. Utiliza enfoques de few-shot y fine-tuning para evaluar el rendimiento del modelo, y los modelos más grandes suelen funcionar mejor en este conjunto de datos. Sin embargo, dado que el conjunto de datos contiene principalmente programas de nivel básico, todavía no representa completamente las complejidades y desafíos de las aplicaciones del mundo real.
Benchmarks de matemáticas
Aunque la mayoría de los LLM son bastante buenos en estructurar respuestas estándar, el razonamiento matemático es un problema mucho mayor para ellos. ¿Por qué? Porque requiere habilidades relacionadas con la comprensión de preguntas, un enfoque lógico paso a paso con razonamiento matemático y derivar la respuesta correcta.
El método “Chain of Thought” (CoT) está diseñado para evaluar a los LLM en benchmarks relacionados con matemáticas, que implica solicitar a los modelos que expliquen su proceso de razonamiento paso a paso al resolver un problema. Hay varios beneficios en esto. Hace que el proceso de razonamiento sea más transparente, ayuda a identificar fallos en la lógica del modelo y permite una evaluación más detallada de las habilidades de resolución de problemas. Al descomponer problemas complejos en una serie de pasos más simples, CoT puede mejorar el rendimiento del modelo en benchmarks de matemáticas y proporcionar una comprensión más profunda de sus capacidades de razonamiento.
GSM8K: Un benchmark de matemáticas popular
Uno de los benchmarks bien conocidos para evaluar las habilidades matemáticas en los LLM es el conjunto de datos GSM8K. GSM8K consiste en 8.500 problemas de matemáticas de nivel de escuela secundaria, que requieren varios pasos para resolver, y las soluciones implican principalmente realizar una secuencia de cálculos elementales. Por lo general, los modelos más grandes o aquellos entrenados específicamente para el razonamiento matemático tienden a funcionar mejor en este benchmark, por ejemplo, los modelos GPT-4 tienen una puntuación del 96,5%, mientras que el DeepSeekMATH-RL-7B tiene una puntuación ligeramente inferior del 88,2%.
Aunque GSM8K es útil para evaluar la capacidad del modelo para manejar problemas de matemáticas de nivel de escuela secundaria, puede no capturar completamente la capacidad del modelo para resolver desafíos matemáticos más avanzados o diversos, lo que limita su eficacia como una medida integral de la capacidad matemática.
El conjunto de datos de matemáticas: Una alternativa integral
El conjunto de datos de matemáticas abordó las limitaciones de benchmarks como GSM8K. Este conjunto de datos es más extenso, cubriendo desde aritmética elemental hasta problemas de nivel de escuela secundaria y universitario. También se compara con humanos, con un estudiante de doctorado en ciencias de la computación que no le gusta las matemáticas logrando una precisión del 40% y un medallista de oro logrando una precisión del 90%.
Proporciona una evaluación más integral de las capacidades matemáticas de un LLM. Asegura que el modelo sea competente en aritmética básica y capaz en áreas complejas como álgebra, geometría y cálculo. Sin embargo, la mayor complejidad y diversidad de problemas pueden hacer que sea desafiante para los modelos lograr una alta precisión, especialmente aquellos que no se han entrenado explícitamente en una amplia gama de conceptos matemáticos. Además, los formatos de problemas variados en el conjunto de datos de matemáticas pueden introducir inconsistencias en el rendimiento del modelo, lo que hace más difícil sacar conclusiones definitivas sobre la capacidad matemática general del modelo.
Utilizar el método Chain of Thought con el conjunto de datos de matemáticas puede mejorar la evaluación porque revela las capacidades de razonamiento paso a paso de los LLM en una amplia gama de desafíos matemáticos. Un enfoque combinado como este asegura una evaluación más robusta y detallada de las verdaderas capacidades matemáticas de un LLM.
Benchmarks de comprensión lectora
Una evaluación de comprensión lectora evalúa la capacidad del modelo para entender y procesar texto complejo, lo cual es especialmente fundamental para aplicaciones como soporte al cliente, generación de contenido e recuperación de información. Hay varios benchmarks diseñados para evaluar esta habilidad, cada uno con atributos únicos que contribuyen a una evaluación integral de las capacidades del modelo.
RACE (Conjunto de datos de comprensión lectora de exámenes)
Los benchmarks RACE tienen casi 28.000 pasajes y 100.000 preguntas recopiladas de exámenes en inglés para estudiantes chinos de secundaria entre las edades de 12 y 18 años. No restringe las preguntas y respuestas a ser extraídas de los pasajes dados, lo que hace que las tareas sean aún más desafiantes.
Cubre una amplia gama de temas y tipos de preguntas, lo que hace una evaluación exhaustiva y incluye preguntas de diferentes niveles de dificultad. Además, las preguntas en RACE están diseñadas específicamente para probar habilidades de lectura humanas y son creadas por expertos en el dominio.
Sin embargo, el benchmark tiene algunas desventajas. Dado que se desarrolló con materiales educativos chinos, es propenso a introducir sesgos culturales que no reflejan un contexto global. Además, el alto nivel de dificultad en algunas preguntas no es necesariamente representativo de tareas típicas del mundo real. Por lo tanto, las evaluaciones de rendimiento pueden no ser del todo precisas.
DROP (Razonamiento discreto sobre párrafos)
Otro enfoque significativo es DROP (Discrete Reasoning Over Paragraphs), que desafía a los modelos a realizar razonamiento discreto sobre párrafos. Tiene 96.000 preguntas para probar las capacidades de razonamiento de los LLM y las preguntas se extraen de Wikipedia y se recopilan de Amazon Mechanical Turk. Las preguntas DROP a menudo requieren que los modelos realicen operaciones matemáticas como suma, resta y comparación basadas en información dispersa en un párrafo.
Las preguntas son desafiantes. Requieren que los LLM localicen múltiples números en el párrafo y los sumen o resten para obtener la respuesta final. Los grandes modelos como GPT-4 y Palm logran un 80% y un 85%, mientras que los humanos logran un 96% en el conjunto de datos DROP.
Benchmarks de sentido común
Probar el sentido común en los modelos de lenguaje es interesante pero también clave, ya que evalúa la capacidad del modelo para hacer juicios e inferencias que se alineen con el razonamiento humano. A diferencia de los humanos, que desarrollan un modelo de mundo integral a través de experiencias prácticas, los modelos de lenguaje se entrenan en grandes conjuntos de datos sin comprender inherentemente el contexto. Esto significa que los modelos luchan con tareas que requieren una comprensión intuitiva de situaciones cotidianas, razonamiento lógico y conocimiento práctico, que son muy importantes para aplicaciones de IA robustas y confiables.
HellaSwag (Finales más difíciles, contextos más largos y actividades de baja frecuencia para situaciones con generaciones adversas)
Hellaswag fue desarrollado por Rowan Zellers y colegas en la Universidad de Washington y el Instituto Allen de Inteligencia Artificial. Está diseñado para probar la capacidad del modelo para predecir la continuación más plausible de un escenario dado. Este benchmark se construye utilizando Filtro Adverso (AF), donde una serie de discriminadores seleccionan iterativamente respuestas incorrectas generadas por máquina. Este método crea un conjunto de datos con ejemplos triviales para humanos pero desafiantes para los modelos, lo que resulta en una “zona de dificultad” adecuada.
Aunque Hellaswag ha sido desafiante para modelos anteriores, los modelos de última generación como GPT-4 han logrado niveles de rendimiento cercanos a la precisión humana, lo que indica un progreso significativo en el campo. Sin embargo, estos resultados sugieren la necesidad de benchmarks en constante evolución para mantener el ritmo de los avances en las capacidades de la IA.
Openbook
El conjunto de datos Openbook consiste en 5.957 preguntas de ciencia de nivel elemental de múltiple opción. Las preguntas se recopilaron de exámenes de libro abierto y se desarrollaron para evaluar la comprensión humana del tema.
El benchmark Openbook requiere capacidad de razonamiento más allá de la recuperación de información. GPT-4 logra la precisión más alta del 95,9% hasta la fecha.
OpenbookQA se modela según exámenes de libro abierto y consta de 5.957 preguntas de ciencia de nivel elemental de múltiple opción. Estas preguntas están diseñadas para evaluar la comprensión de 1.326 hechos científicos básicos y su aplicación en situaciones nuevas.
Al igual que Hellaswag, los modelos anteriores encontraron OpenbookQA desafiante, pero los modelos modernos como GPT-4 han logrado niveles de rendimiento cercanos a los humanos. Este progreso subraya la importancia de desarrollar benchmarks aún más complejos y matizados para seguir empujando los límites de la comprensión de la IA.
¿Son suficientes los benchmarks para la evaluación del rendimiento de los LLM?
Sí, aunque proporcionan un enfoque estandarizado para evaluar el rendimiento de los LLM, también pueden ser engañosos. La Organización de Sistemas de Modelos Grandes dice que un buen benchmark de LLM debe ser escalable, capaz de evaluar nuevos modelos con un número relativamente pequeño de pruebas, y proporcionar un orden de clasificación único para todos los modelos. Pero hay razones por las que pueden no ser suficientes. Aquí hay algunas:
Fuga de benchmark
Este es un encuentro común, y ocurre cuando los datos de entrenamiento se superponen con los datos de prueba, lo que lleva a una evaluación engañosa. Si un modelo ya ha encontrado algunas preguntas de prueba durante el entrenamiento, su resultado puede no reflejar con precisión sus verdaderas capacidades. Pero un benchmark ideal debería minimizar la memorización y reflejar escenarios del mundo real.
Sesgo de evaluación
Las clasificaciones de los benchmarks de LLM se utilizan para comparar el rendimiento de los LLM en varias tareas. Sin embargo, confiar en esas clasificaciones para comparar modelos puede ser engañoso. Cambios simples en las pruebas de benchmark, como alterar el orden de las preguntas, pueden cambiar la clasificación de los modelos hasta ocho posiciones. Además, los LLM pueden funcionar de manera diferente dependiendo de los métodos de puntuación, lo que destaca la importancia de considerar los sesgos de evaluación.
Apertura
La interacción del mundo real con los LLM implica diseñar instrucciones para generar salidas de IA deseadas. Las salidas de los LLM dependen de la efectividad de las instrucciones, y los benchmarks están diseñados para probar la conciencia de contexto de los LLM. Aunque los benchmarks están diseñados para probar la conciencia de contexto de los LLM, no siempre se traducen directamente en rendimiento del mundo real. Por ejemplo, un modelo que logra una puntuación del 100% en un conjunto de datos de benchmark, como el LSAT, no garantiza el mismo nivel de precisión en aplicaciones prácticas. Esto subraya la importancia de considerar la naturaleza abierta de las tareas del mundo real en la evaluación de los LLM.
Evaluación efectiva para LLM robustos
Entonces, ahora sabes que los benchmarks no siempre son la mejor opción porque no pueden generalizarse en todos los problemas. Pero hay otras formas.
Benchmarks personalizados
Estos son perfectos para probar comportamientos y funcionalidades específicas en escenarios de tareas específicas. Digamos que si un LLM está diseñado para oficiales médicos, los conjuntos de datos recopilados de entornos médicos representarán efectivamente escenarios del mundo real. Estos benchmarks personalizados pueden centrarse en la comprensión del lenguaje específico del dominio, el rendimiento y los requisitos contextuales únicos. Al alinear los benchmarks con posibles escenarios del mundo real, puedes asegurarte de que el LLM funcione bien en general y sobresalga en las tareas específicas para las que está destinado. Esto puede ayudar a identificar y abordar cualquier brecha o debilidad en las capacidades del modelo desde el principio.
Tubería de detección de fuga de datos
Si deseas que tus evaluaciones “muestren” integridad, tener una tubería de benchmark libre de fugas de datos es muy importante. La fuga de datos ocurre cuando los datos del benchmark se incluyen en el corpus de preentrenamiento del modelo, lo que resulta en puntuaciones de rendimiento artificialmente altas. Para evitar esto, los benchmarks deben cruzarse con los datos de preentrenamiento. Además, se deben tomar medidas para evitar cualquier información previamente vista. Esto puede involucrar el uso de conjuntos de datos propietarios o recién curados que se mantienen separados de la tubería de entrenamiento del modelo, lo que garantizará que las métricas de rendimiento que obtengas reflejen la capacidad del modelo para generalizar bien.
Evaluación humana
Las métricas automatizadas por sí solas no pueden capturar el espectro completo del rendimiento de un modelo, especialmente cuando se trata de aspectos muy matizados y subjetivos de la comprensión y generación del lenguaje. Aquí, la evaluación humana proporciona una evaluación mucho mejor:
- Contratación de profesionales que puedan proporcionar evaluaciones detalladas y confiables, especialmente para dominios especializados.
- Externalización a plataformas como Amazon Mechanical Turk, que permiten recopilar juicios humanos diversos de manera rápida y a bajo costo.
- Retorno de la comunidad: Utilizar plataformas como el LMSYS leaderboard arena, donde los usuarios pueden votar y comparar modelos, agrega una capa adicional de información. El LMSYS Chatbot Arena Hard, por ejemplo, es particularmente efectivo para resaltar diferencias sutiles entre los mejores modelos a través de interacciones directas de los usuarios y votos.
Conclusión
Sin evaluación y benchmarking, no tendríamos forma de saber si la capacidad de los LLM para manejar tareas del mundo real es tan precisa y aplicable como creemos que es. Pero, como dije, los benchmarks no son una forma completamente segura de verificar eso, pueden llevar a brechas en el rendimiento de los LLM. Esto también puede frenar el desarrollo de LLM que sean verdaderamente robustos para el trabajo.
Así es como debería ser en un mundo ideal. Los LLM comprenden las consultas de los usuarios, identifican errores en las instrucciones, completan tareas como se les indica y generan salidas confiables. Los resultados ya son grandes pero no ideales. Aquí es donde los benchmarks específicos de tareas son muy útiles, al igual que la evaluación humana y la detección de fugas de benchmark. Al utilizarlos, obtenemos la oportunidad de producir LLM realmente robustos.












