Líderes de opiniÃģn

Benchmarks para LLM

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Comprenda el papel y las limitaciones de los benchmarks en la evaluaciÃģn del rendimiento de los LLM. Explore las tÃĐcnicas para desarrollar LLM robustos.

Los Modelos de Lenguaje Grande han ganado una gran popularidad en los Últimos aÃąos. Me refiero a que lo has visto. La capacidad excepcional de los LLM para entender comandos de lenguaje humano los ha convertido en la integraciÃģn perfecta para las empresas, apoyando flujos de trabajo críticos y automatizando tareas para alcanzar la mÃĄxima eficiencia. AdemÃĄs, mÃĄs allÃĄ de la comprensiÃģn del usuario promedio, hay mucho mÃĄs que los LLM pueden hacer. Y a medida que nuestra dependencia de ellos crece, debemos prestar mucha mÃĄs atenciÃģn a las medidas para garantizar la precisiÃģn y la confiabilidad necesarias. Esta es una tarea global que concierne a instituciones enteras, pero en el ÃĄmbito de las empresas, ahora hay varios benchmarks que se pueden utilizar para evaluar el rendimiento de los LLM en varios dominios. Estos pueden probar las habilidades del modelo en comprensiÃģn, razonamiento lÃģgico, matemÃĄticas, etc., y los resultados determinan si un LLM estÃĄ listo para la implementaciÃģn empresarial.

En este artículo, he reunido una lista completa de los benchmarks mÃĄs populares para la evaluaciÃģn de LLM. Discutiremos cada benchmark en detalle y veremos cÃģmo diferentes LLM se desempeÃąan contra los criterios de evaluaciÃģn. Pero primero, analicemos la evaluaciÃģn de LLM con mÃĄs detalle.

ÂŋQuÃĐ es la evaluaciÃģn de LLM?

Al igual que otros modelos de IA, los LLM tambiÃĐn necesitan ser evaluados contra benchmarks específicos que evalÚen varios aspectos del rendimiento del modelo de lenguaje: conocimiento, precisiÃģn, confiabilidad y coherencia. El estÃĄndar suele involucrar:

  1. ComprensiÃģn de consultas de usuario: Evaluar la capacidad del modelo para comprender y interpretar una amplia gama de entradas de usuario.
  2. VerificaciÃģn de salida: Verificar las respuestas generadas por la IA contra una base de conocimientos de confianza para asegurarse de que sean correctas y relevantes.
  3. Robustez: Medir cÃģmo se desempeÃąa el modelo con entradas ambiguas, incompletas o ruidosas.

La evaluaciÃģn de LLM da a los desarrolladores el poder de identificar y abordar limitaciones de manera eficiente, para que puedan mejorar la experiencia del usuario en general. Si un LLM se evalÚa a fondo, serÃĄ lo suficientemente preciso y robusto como para manejar diferentes aplicaciones del mundo real, incluso aquellas con entradas ambiguas o inesperadas.

Benchmarks

Los LLM son una de las tecnologías mÃĄs complicadas hasta la fecha y pueden alimentar incluso las aplicaciones mÃĄs complicadas. Entonces, el proceso de evaluaciÃģn simplemente tiene que ser igual de complejo, poniendo a prueba su proceso de pensamiento y precisiÃģn tÃĐcnica.

Un benchmark utiliza conjuntos de datos específicos, mÃĐtricas y tareas de evaluaciÃģn para probar el rendimiento de los LLM, lo que permite comparar diferentes LLM y medir su precisiÃģn, lo que a su vez impulsa el progreso en la industria mediante un mejor rendimiento.

Aquí hay algunos de los aspectos mÃĄs típicos del rendimiento de los LLM:

  • Conocimiento: El conocimiento del modelo debe probarse en varios dominios. Eso es lo que se hace con el benchmark de conocimiento. EvalÚa cÃģmo puede recordar informaciÃģn de diferentes campos, como Física, ProgramaciÃģn, Geografía, etc.
  • Razonamiento lÃģgico: Significa probar la capacidad del modelo para ‘pensar’ paso a paso y derivar una conclusiÃģn lÃģgica, que suele involucrar escenarios en los que el modelo debe seleccionar la continuaciÃģn mÃĄs plausible o explicaciÃģn basada en el conocimiento cotidiano y el razonamiento lÃģgico.
  • ComprensiÃģn lectora: Los modelos deben ser excelentes en la interpretaciÃģn del lenguaje natural y generar respuestas en consecuencia. La prueba se parece a responder preguntas basadas en pasajes para evaluar la comprensiÃģn, la inferencia y la retenciÃģn de detalles. Algo así como una prueba de lectura en la escuela.
  • ComprensiÃģn de cÃģdigo: Se necesita para medir la habilidad del modelo para entender, escribir y depurar cÃģdigo. Estos benchmarks dan al modelo tareas de programaciÃģn o problemas que el modelo debe resolver con precisiÃģn, que a menudo cubren una variedad de lenguajes de programaciÃģn y paradigmas.
  • Conocimiento del mundo: Para evaluar la comprensiÃģn del modelo sobre el conocimiento general del mundo. Estos conjuntos de datos suelen tener preguntas que requieren un conocimiento amplio y enciclopÃĐdico para ser respondidas correctamente, lo que los hace diferentes de los benchmarks de conocimiento mÃĄs específicos y especializados.

Benchmarks de “Conocimiento”

MMLU (ComprensiÃģn de lenguaje multimodal)

Este benchmark estÃĄ diseÃąado para probar la comprensiÃģn del LLM de conocimientos factuales en varios temas como humanidades, ciencias sociales, historia, ciencias de la computaciÃģn y incluso derecho. 57 preguntas y 15.000 tareas dirigidas a asegurar que el modelo tenga grandes capacidades de razonamiento. Esto hace que MMLU sea una buena herramienta para evaluar el conocimiento factual y el razonamiento del LLM en varios temas.

Recientemente se ha convertido en un benchmark clave para evaluar LLM para las ÃĄreas mencionadas anteriormente. Los desarrolladores siempre quieren optimizar sus modelos para superar a otros en este benchmark, lo que lo convierte en un estÃĄndar de facto para evaluar el razonamiento y el conocimiento avanzados en los LLM. Los modelos de gran empresa han mostrado puntuaciones impresionantes en este benchmark, incluyendo el GPT-4-omni con un 88,7%, el Claude 3 Opus con un 86,8%, el Gemini 1,5 Pro con un 85,9% y el Llama-3 70B con un 82%. Los modelos pequeÃąos suelen no funcionar tan bien en este benchmark, generalmente sin superar el 60-65%, pero el rendimiento reciente del Phi-3-Small-7b con un 75,3% es algo a considerar.

Sin embargo, MMLU no estÃĄ exento de inconvenientes: tiene problemas conocidos como preguntas ambiguas, respuestas incorrectas y falta de contexto. AdemÃĄs, muchos creen que algunas de sus tareas son demasiado fÃĄciles para una evaluaciÃģn adecuada de los LLM.

Me gustaría aclarar que los benchmarks como MMLU no representan perfectamente escenarios del mundo real. Si un LLM logra una gran puntuaciÃģn en este, no siempre significa que se ha convertido en un experto en la materia. Los benchmarks son realmente limitados en alcance y a menudo dependen de preguntas de mÚltiple opciÃģn, que nunca pueden capturar completamente la complejidad y el contexto de las interacciones del mundo real. La verdadera comprensiÃģn requiere conocer hechos y aplicar ese conocimiento de manera dinÃĄmica, lo que implica pensamiento crítico, resoluciÃģn de problemas y comprensiÃģn contextual. Por estas razones, los LLM necesitan ser refinados y actualizados constantemente para que el modelo mantenga la relevancia y eficacia del benchmark.

GPQA (Benchmark de preguntas y respuestas de nivel de posgrado)

Este benchmark evalÚa a los LLM en razonamiento lÃģgico utilizando un conjunto de datos con solo 448 preguntas. Fue desarrollado por expertos en el dominio y cubre temas en biología, física y química.

Cada pregunta pasa por el siguiente proceso de validaciÃģn:

  1. Un experto en el tema responde la pregunta y proporciona retroalimentaciÃģn detallada.
  2. El autor de la pregunta revisa la pregunta basÃĄndose en esta retroalimentaciÃģn.
  3. Un segundo experto responde la pregunta revisada.

Este proceso puede asegurar que las preguntas sean objetivas, precisas y desafiantes para un modelo de lenguaje. Incluso los acadÃĐmicos experimentados logran solo una precisiÃģn del 65% en estas preguntas, mientras que el GPT-4-omni alcanza solo el 53,6%, lo que destaca la brecha entre la inteligencia humana y la mÃĄquina.

Debido a los requisitos de calificaciÃģn altos, el conjunto de datos es en realidad bastante pequeÃąo, lo que limita su poder estadístico para comparar la precisiÃģn y requiere efectos de gran tamaÃąo. Los expertos que crearon y validaron estas preguntas provienen de Upwork, por lo que potencialmente introdujeron sesgos basados en su experiencia y los temas cubiertos.

Benchmarks de cÃģdigo

HumanEval

164 problemas de programaciÃģn, una prueba real para las habilidades de codificaciÃģn de los LLM. Es HumanEval. EstÃĄ diseÃąado para probar las habilidades de codificaciÃģn bÃĄsicas de los grandes modelos de lenguaje (LLM). Utiliza la mÃĐtrica pass@k para juzgar la precisiÃģn funcional del cÃģdigo generado, que produce la probabilidad de que al menos una de las muestras de cÃģdigo generadas por el LLM supere las pruebas.

Aunque el conjunto de datos HumanEval incluye firmas de funciÃģn, cadenas de documentaciÃģn, cuerpos de cÃģdigo y varias pruebas unitarias, no incluye la gama completa de problemas de codificaciÃģn del mundo real, lo que no prueba adecuadamente la capacidad del modelo para generar cÃģdigo correcto para escenarios diversos.

MBPP (ProgramaciÃģn de Python bÃĄsica)

MBPP es un benchmark que consiste en 1.000 preguntas de programaciÃģn en Python crowdsourced. Estos son problemas de nivel bÃĄsico y se centran en habilidades de programaciÃģn fundamentales. Utiliza enfoques de few-shot y fine-tuning para evaluar el rendimiento del modelo, y los modelos mÃĄs grandes suelen funcionar mejor en este conjunto de datos. Sin embargo, dado que el conjunto de datos contiene principalmente programas de nivel bÃĄsico, todavía no representa completamente las complejidades y desafíos de las aplicaciones del mundo real.

Benchmarks de matemÃĄticas

Aunque la mayoría de los LLM son bastante buenos en estructurar respuestas estÃĄndar, el razonamiento matemÃĄtico es un problema mucho mayor para ellos. ÂŋPor quÃĐ? Porque requiere habilidades relacionadas con la comprensiÃģn de preguntas, un enfoque lÃģgico paso a paso con razonamiento matemÃĄtico y derivar la respuesta correcta.

El mÃĐtodo “Chain of Thought” (CoT) estÃĄ diseÃąado para evaluar a los LLM en benchmarks relacionados con matemÃĄticas, que implica solicitar a los modelos que expliquen su proceso de razonamiento paso a paso al resolver un problema. Hay varios beneficios en esto. Hace que el proceso de razonamiento sea mÃĄs transparente, ayuda a identificar fallos en la lÃģgica del modelo y permite una evaluaciÃģn mÃĄs detallada de las habilidades de resoluciÃģn de problemas. Al descomponer problemas complejos en una serie de pasos mÃĄs simples, CoT puede mejorar el rendimiento del modelo en benchmarks de matemÃĄticas y proporcionar una comprensiÃģn mÃĄs profunda de sus capacidades de razonamiento.

GSM8K: Un benchmark de matemÃĄticas popular

Uno de los benchmarks bien conocidos para evaluar las habilidades matemÃĄticas en los LLM es el conjunto de datos GSM8K. GSM8K consiste en 8.500 problemas de matemÃĄticas de nivel de escuela secundaria, que requieren varios pasos para resolver, y las soluciones implican principalmente realizar una secuencia de cÃĄlculos elementales. Por lo general, los modelos mÃĄs grandes o aquellos entrenados específicamente para el razonamiento matemÃĄtico tienden a funcionar mejor en este benchmark, por ejemplo, los modelos GPT-4 tienen una puntuaciÃģn del 96,5%, mientras que el DeepSeekMATH-RL-7B tiene una puntuaciÃģn ligeramente inferior del 88,2%.

Aunque GSM8K es Útil para evaluar la capacidad del modelo para manejar problemas de matemÃĄticas de nivel de escuela secundaria, puede no capturar completamente la capacidad del modelo para resolver desafíos matemÃĄticos mÃĄs avanzados o diversos, lo que limita su eficacia como una medida integral de la capacidad matemÃĄtica.

El conjunto de datos de matemÃĄticas: Una alternativa integral

El conjunto de datos de matemÃĄticas abordÃģ las limitaciones de benchmarks como GSM8K. Este conjunto de datos es mÃĄs extenso, cubriendo desde aritmÃĐtica elemental hasta problemas de nivel de escuela secundaria y universitario. TambiÃĐn se compara con humanos, con un estudiante de doctorado en ciencias de la computaciÃģn que no le gusta las matemÃĄticas logrando una precisiÃģn del 40% y un medallista de oro logrando una precisiÃģn del 90%.

Proporciona una evaluaciÃģn mÃĄs integral de las capacidades matemÃĄticas de un LLM. Asegura que el modelo sea competente en aritmÃĐtica bÃĄsica y capaz en ÃĄreas complejas como ÃĄlgebra, geometría y cÃĄlculo. Sin embargo, la mayor complejidad y diversidad de problemas pueden hacer que sea desafiante para los modelos lograr una alta precisiÃģn, especialmente aquellos que no se han entrenado explícitamente en una amplia gama de conceptos matemÃĄticos. AdemÃĄs, los formatos de problemas variados en el conjunto de datos de matemÃĄticas pueden introducir inconsistencias en el rendimiento del modelo, lo que hace mÃĄs difícil sacar conclusiones definitivas sobre la capacidad matemÃĄtica general del modelo.

Utilizar el mÃĐtodo Chain of Thought con el conjunto de datos de matemÃĄticas puede mejorar la evaluaciÃģn porque revela las capacidades de razonamiento paso a paso de los LLM en una amplia gama de desafíos matemÃĄticos. Un enfoque combinado como este asegura una evaluaciÃģn mÃĄs robusta y detallada de las verdaderas capacidades matemÃĄticas de un LLM.

Benchmarks de comprensiÃģn lectora

Una evaluaciÃģn de comprensiÃģn lectora evalÚa la capacidad del modelo para entender y procesar texto complejo, lo cual es especialmente fundamental para aplicaciones como soporte al cliente, generaciÃģn de contenido e recuperaciÃģn de informaciÃģn. Hay varios benchmarks diseÃąados para evaluar esta habilidad, cada uno con atributos Únicos que contribuyen a una evaluaciÃģn integral de las capacidades del modelo.

RACE (Conjunto de datos de comprensiÃģn lectora de exÃĄmenes)

Los benchmarks RACE tienen casi 28.000 pasajes y 100.000 preguntas recopiladas de exÃĄmenes en inglÃĐs para estudiantes chinos de secundaria entre las edades de 12 y 18 aÃąos. No restringe las preguntas y respuestas a ser extraídas de los pasajes dados, lo que hace que las tareas sean aÚn mÃĄs desafiantes.

Cubre una amplia gama de temas y tipos de preguntas, lo que hace una evaluaciÃģn exhaustiva y incluye preguntas de diferentes niveles de dificultad. AdemÃĄs, las preguntas en RACE estÃĄn diseÃąadas específicamente para probar habilidades de lectura humanas y son creadas por expertos en el dominio.

Sin embargo, el benchmark tiene algunas desventajas. Dado que se desarrollÃģ con materiales educativos chinos, es propenso a introducir sesgos culturales que no reflejan un contexto global. AdemÃĄs, el alto nivel de dificultad en algunas preguntas no es necesariamente representativo de tareas típicas del mundo real. Por lo tanto, las evaluaciones de rendimiento pueden no ser del todo precisas.

DROP (Razonamiento discreto sobre pÃĄrrafos)

Otro enfoque significativo es DROP (Discrete Reasoning Over Paragraphs), que desafía a los modelos a realizar razonamiento discreto sobre pÃĄrrafos. Tiene 96.000 preguntas para probar las capacidades de razonamiento de los LLM y las preguntas se extraen de Wikipedia y se recopilan de Amazon Mechanical Turk. Las preguntas DROP a menudo requieren que los modelos realicen operaciones matemÃĄticas como suma, resta y comparaciÃģn basadas en informaciÃģn dispersa en un pÃĄrrafo.

Las preguntas son desafiantes. Requieren que los LLM localicen mÚltiples nÚmeros en el pÃĄrrafo y los sumen o resten para obtener la respuesta final. Los grandes modelos como GPT-4 y Palm logran un 80% y un 85%, mientras que los humanos logran un 96% en el conjunto de datos DROP.

Benchmarks de sentido comÚn

Probar el sentido comÚn en los modelos de lenguaje es interesante pero tambiÃĐn clave, ya que evalÚa la capacidad del modelo para hacer juicios e inferencias que se alineen con el razonamiento humano. A diferencia de los humanos, que desarrollan un modelo de mundo integral a travÃĐs de experiencias prÃĄcticas, los modelos de lenguaje se entrenan en grandes conjuntos de datos sin comprender inherentemente el contexto. Esto significa que los modelos luchan con tareas que requieren una comprensiÃģn intuitiva de situaciones cotidianas, razonamiento lÃģgico y conocimiento prÃĄctico, que son muy importantes para aplicaciones de IA robustas y confiables.

HellaSwag (Finales mÃĄs difíciles, contextos mÃĄs largos y actividades de baja frecuencia para situaciones con generaciones adversas)

Hellaswag fue desarrollado por Rowan Zellers y colegas en la Universidad de Washington y el Instituto Allen de Inteligencia Artificial. EstÃĄ diseÃąado para probar la capacidad del modelo para predecir la continuaciÃģn mÃĄs plausible de un escenario dado. Este benchmark se construye utilizando Filtro Adverso (AF), donde una serie de discriminadores seleccionan iterativamente respuestas incorrectas generadas por mÃĄquina. Este mÃĐtodo crea un conjunto de datos con ejemplos triviales para humanos pero desafiantes para los modelos, lo que resulta en una “zona de dificultad” adecuada.

Aunque Hellaswag ha sido desafiante para modelos anteriores, los modelos de Última generaciÃģn como GPT-4 han logrado niveles de rendimiento cercanos a la precisiÃģn humana, lo que indica un progreso significativo en el campo. Sin embargo, estos resultados sugieren la necesidad de benchmarks en constante evoluciÃģn para mantener el ritmo de los avances en las capacidades de la IA.

Openbook

El conjunto de datos Openbook consiste en 5.957 preguntas de ciencia de nivel elemental de mÚltiple opciÃģn. Las preguntas se recopilaron de exÃĄmenes de libro abierto y se desarrollaron para evaluar la comprensiÃģn humana del tema.

El benchmark Openbook requiere capacidad de razonamiento mÃĄs allÃĄ de la recuperaciÃģn de informaciÃģn. GPT-4 logra la precisiÃģn mÃĄs alta del 95,9% hasta la fecha.

OpenbookQA se modela segÚn exÃĄmenes de libro abierto y consta de 5.957 preguntas de ciencia de nivel elemental de mÚltiple opciÃģn. Estas preguntas estÃĄn diseÃąadas para evaluar la comprensiÃģn de 1.326 hechos científicos bÃĄsicos y su aplicaciÃģn en situaciones nuevas.

Al igual que Hellaswag, los modelos anteriores encontraron OpenbookQA desafiante, pero los modelos modernos como GPT-4 han logrado niveles de rendimiento cercanos a los humanos. Este progreso subraya la importancia de desarrollar benchmarks aÚn mÃĄs complejos y matizados para seguir empujando los límites de la comprensiÃģn de la IA.

ÂŋSon suficientes los benchmarks para la evaluaciÃģn del rendimiento de los LLM?

Sí, aunque proporcionan un enfoque estandarizado para evaluar el rendimiento de los LLM, tambiÃĐn pueden ser engaÃąosos. La OrganizaciÃģn de Sistemas de Modelos Grandes dice que un buen benchmark de LLM debe ser escalable, capaz de evaluar nuevos modelos con un nÚmero relativamente pequeÃąo de pruebas, y proporcionar un orden de clasificaciÃģn Único para todos los modelos. Pero hay razones por las que pueden no ser suficientes. Aquí hay algunas:

Fuga de benchmark

Este es un encuentro comÚn, y ocurre cuando los datos de entrenamiento se superponen con los datos de prueba, lo que lleva a una evaluaciÃģn engaÃąosa. Si un modelo ya ha encontrado algunas preguntas de prueba durante el entrenamiento, su resultado puede no reflejar con precisiÃģn sus verdaderas capacidades. Pero un benchmark ideal debería minimizar la memorizaciÃģn y reflejar escenarios del mundo real.

Sesgo de evaluaciÃģn

Las clasificaciones de los benchmarks de LLM se utilizan para comparar el rendimiento de los LLM en varias tareas. Sin embargo, confiar en esas clasificaciones para comparar modelos puede ser engaÃąoso. Cambios simples en las pruebas de benchmark, como alterar el orden de las preguntas, pueden cambiar la clasificaciÃģn de los modelos hasta ocho posiciones. AdemÃĄs, los LLM pueden funcionar de manera diferente dependiendo de los mÃĐtodos de puntuaciÃģn, lo que destaca la importancia de considerar los sesgos de evaluaciÃģn.

Apertura

La interacciÃģn del mundo real con los LLM implica diseÃąar instrucciones para generar salidas de IA deseadas. Las salidas de los LLM dependen de la efectividad de las instrucciones, y los benchmarks estÃĄn diseÃąados para probar la conciencia de contexto de los LLM. Aunque los benchmarks estÃĄn diseÃąados para probar la conciencia de contexto de los LLM, no siempre se traducen directamente en rendimiento del mundo real. Por ejemplo, un modelo que logra una puntuaciÃģn del 100% en un conjunto de datos de benchmark, como el LSAT, no garantiza el mismo nivel de precisiÃģn en aplicaciones prÃĄcticas. Esto subraya la importancia de considerar la naturaleza abierta de las tareas del mundo real en la evaluaciÃģn de los LLM.

EvaluaciÃģn efectiva para LLM robustos

Entonces, ahora sabes que los benchmarks no siempre son la mejor opciÃģn porque no pueden generalizarse en todos los problemas. Pero hay otras formas.

Benchmarks personalizados

Estos son perfectos para probar comportamientos y funcionalidades específicas en escenarios de tareas específicas. Digamos que si un LLM estÃĄ diseÃąado para oficiales mÃĐdicos, los conjuntos de datos recopilados de entornos mÃĐdicos representarÃĄn efectivamente escenarios del mundo real. Estos benchmarks personalizados pueden centrarse en la comprensiÃģn del lenguaje específico del dominio, el rendimiento y los requisitos contextuales Únicos. Al alinear los benchmarks con posibles escenarios del mundo real, puedes asegurarte de que el LLM funcione bien en general y sobresalga en las tareas específicas para las que estÃĄ destinado. Esto puede ayudar a identificar y abordar cualquier brecha o debilidad en las capacidades del modelo desde el principio.

Tubería de detecciÃģn de fuga de datos

Si deseas que tus evaluaciones “muestren” integridad, tener una tubería de benchmark libre de fugas de datos es muy importante. La fuga de datos ocurre cuando los datos del benchmark se incluyen en el corpus de preentrenamiento del modelo, lo que resulta en puntuaciones de rendimiento artificialmente altas. Para evitar esto, los benchmarks deben cruzarse con los datos de preentrenamiento. AdemÃĄs, se deben tomar medidas para evitar cualquier informaciÃģn previamente vista. Esto puede involucrar el uso de conjuntos de datos propietarios o reciÃĐn curados que se mantienen separados de la tubería de entrenamiento del modelo, lo que garantizarÃĄ que las mÃĐtricas de rendimiento que obtengas reflejen la capacidad del modelo para generalizar bien.

EvaluaciÃģn humana

Las mÃĐtricas automatizadas por sí solas no pueden capturar el espectro completo del rendimiento de un modelo, especialmente cuando se trata de aspectos muy matizados y subjetivos de la comprensiÃģn y generaciÃģn del lenguaje. Aquí, la evaluaciÃģn humana proporciona una evaluaciÃģn mucho mejor:

  • ContrataciÃģn de profesionales que puedan proporcionar evaluaciones detalladas y confiables, especialmente para dominios especializados.
  • ExternalizaciÃģn a plataformas como Amazon Mechanical Turk, que permiten recopilar juicios humanos diversos de manera rÃĄpida y a bajo costo.
  • Retorno de la comunidad: Utilizar plataformas como el LMSYS leaderboard arena, donde los usuarios pueden votar y comparar modelos, agrega una capa adicional de informaciÃģn. El LMSYS Chatbot Arena Hard, por ejemplo, es particularmente efectivo para resaltar diferencias sutiles entre los mejores modelos a travÃĐs de interacciones directas de los usuarios y votos.

ConclusiÃģn

Sin evaluaciÃģn y benchmarking, no tendríamos forma de saber si la capacidad de los LLM para manejar tareas del mundo real es tan precisa y aplicable como creemos que es. Pero, como dije, los benchmarks no son una forma completamente segura de verificar eso, pueden llevar a brechas en el rendimiento de los LLM. Esto tambiÃĐn puede frenar el desarrollo de LLM que sean verdaderamente robustos para el trabajo.

Así es como debería ser en un mundo ideal. Los LLM comprenden las consultas de los usuarios, identifican errores en las instrucciones, completan tareas como se les indica y generan salidas confiables. Los resultados ya son grandes pero no ideales. Aquí es donde los benchmarks específicos de tareas son muy Útiles, al igual que la evaluaciÃģn humana y la detecciÃģn de fugas de benchmark. Al utilizarlos, obtenemos la oportunidad de producir LLM realmente robustos.

Irina Barskaya, PhD, es una destacada científica de datos con mÃĄs de una dÃĐcada de experiencia, abarcando tanto anÃĄlisis de productos como anÃĄlisis para tecnologías de vanguardia. Ella encabezÃģ la creaciÃģn y el anÃĄlisis de Yasmina, la primera asistente de voz basada en inteligencia artificial completamente funcional y localizada para Arabia Saudita, manejando la localizaciÃģn y etiquetado de datos complejos para el ÃĄrabe moderno estÃĄndar y los dialectos sauditas. Actualmente, Irina dirige el anÃĄlisis de calidad en Yandex, impulsando avances en tecnologías de inteligencia artificial.