Modelos y plataformas de IA
Zephyr-7B: Introducción a la Destilación Directa de Alineación en Modelos de Lenguaje
La capacidad y el rendimiento de los modelos de lenguaje grande abiertos más pequeños han avanzado significativamente en los últimos años, y hemos presenciado el progreso desde los primeros modelos GPT-2 hasta marcos de LLM más compactos, precisos y efectivos que utilizan una cantidad considerablemente mayor de tokens que la cantidad de tokens “óptima de cálculo” recomendada por las leyes de escalado Chinchilla. Además, los desarrolladores han demostrado que estos marcos de LLM más pequeños pueden ser entrenados aún más utilizando un enfoque de dSFT o Destilación de Ajuste Fine-Tuning basado en modelos propietarios, que utiliza la salida de un modelo de enseñanza efectivo como datos supervisados para el modelo de estudiante en un intento de aumentar la precisión.
En este artículo, hablaremos sobre el marco Zephyr-7B, un banco de pruebas de chat de vanguardia para modelos de 7B parámetros que no requiere anotaciones humanas. El objetivo principal del marco es permitir que los desarrolladores produzcan modelos de lenguaje grande más pequeños que se alineen con la intención del usuario más que nunca antes. El marco Zephyr-7B no solo examina la aplicación de los enfoques actuales para marcos de LLM más grandes como dSFT, sino que también explora la posibilidad de utilizar otros enfoques para aprender un modelo de chat con una mejor alineación con la intención del usuario. Estaremos profundizando en el marco Zephyr, y explorando su arquitectura, funcionamiento y resultados. Así que comencemos.
Zephyr-7B: Introducción a la Destilación Directa de Alineación en Modelos de Lenguaje
Como se mencionó anteriormente, los modelos de lenguaje han progresado rápidamente en los últimos años, desde los primeros marcos GPT-2 hasta los actuales marcos GPT-4 y MiniGPT-5 LLM que, aunque son muy exhaustivos en tokens, ahora son más precisos y mucho más eficientes. Un aspecto destacado de estos marcos de LLM avanzados es que incorporan una cantidad significativamente mayor de tokens que la cantidad de tokens que se consideraban anteriormente como óptima de cálculo bajo las leyes de escalado Chinchilla. Además, los desarrolladores y investigadores que trabajan en marcos de LLM han aprendido que estos marcos de LLM más pequeños pueden ser entrenados aún más utilizando un enfoque de destilación de ajuste fine-tuning basado en modelos propietarios, que utiliza la salida de un modelo de enseñanza efectivo como datos supervisados para el modelo de estudiante en un intento de aumentar la precisión. La estrategia de destilación se ha demostrado ser una herramienta muy efectiva y útil para maximizar el potencial y las capacidades de los modelos abiertos en una amplia variedad de tareas, aunque todavía no puede replicar el rendimiento logrado por el modelo de enseñanza. Además, los usuarios han informado a menudo que estos modelos a menudo muestran “desalineación de intención”, lo que significa que los modelos no se comportan de una manera que se alinee con los requisitos de los usuarios finales, lo que lleva a salidas incorrectas que no proporcionan la salida o respuesta correcta a las entradas o consultas del usuario.
La alineación de intención siempre ha sido un desafío importante para los desarrolladores, con trabajos recientes que se centran en el desarrollo de benchmarks como AlpacaEval y MT-Bench desarrollados para abordar la desalineación. La motivación para desarrollar el marco Zephyr se puede atribuir al problema de utilizar la destilación para alinear un marco de LLM abierto pequeño en su totalidad, donde el paso principal es utilizar un AIF o Retroalimentación de Inteligencia Artificial para obtener datos de preferencia de un conjunto de modelos de enseñanza, y luego aplicar la optimización de preferencia destilada directamente como el objetivo de aprendizaje principal, un enfoque que se conoce como dDPO o Optimización de Preferencia Directa de Difusión. El aspecto destacado del enfoque dDPO es que, a diferencia de sus predecesores como PPO o Optimización de Preferencia Proximal, no requiere muestreo o anotaciones humanas, y también reduce el tiempo que se tarda en entrenar un modelo de lenguaje. Además, también permite a los desarrolladores maximizar las recompensas de la muestra final prestando atención a la secuencia de los pasos de difusión desde el principio hasta el final, en otras palabras, durante toda su duración.
Los desarrolladores han desarrollado el marco Zephyr-7B para validar este enfoque, y de alguna manera, es una versión alineada del marco de vanguardia Mistral-7B. El marco primero utiliza dSFT o Destilación de Ajuste Fine-Tuning basado en el conjunto de datos UltraChat, y aplica el enfoque dDPO o Optimización de Preferencia Directa de Difusión en los datos de retroalimentación. Los experimentos indican que el marco Zephyr-7B con 7 mil millones de parámetros entrega resultados comparables a los entregados por modelos de chat alineados con retroalimentación humana con más de 70 mil millones de parámetros. Además, los experimentos también indican que los resultados pueden mejorarse tanto en términos de benchmarks que tienen en cuenta las capacidades conversacionales, como en benchmarks académicos estándar, y el uso del aprendizaje de preferencia es fundamental para lograr los resultados deseados.

La figura anterior muestra el rendimiento de varios modelos de lenguaje en el benchmark MT-bench. El marco Zephyr-7B entrenado utilizando el enfoque dDPO se compara con modelos de lenguaje propietarios y de acceso abierto más grandes como GPT-3.5 Turbo, Llama-2-70B y más que fueron entrenados utilizando aprendizaje de refuerzo adicional y también incluyeron una gran cantidad de retroalimentación humana. Como se puede ver claramente, a pesar de la gran diferencia en la cantidad de parámetros que estos marcos utilizan, el marco Zephyr-7B entrega resultados comparables contra la mayoría de ellos, y supera a varios marcos en diferentes dominios.
Zephyr-7B: Método, Funcionamiento y Arquitectura
El objetivo principal del marco Zephyr-7B es ayudar a un modelo de lenguaje grande abierto a alinearse lo más cerca posible con la intención del usuario, y a lo largo de su totalidad, el marco Zephyr-7B asume acceso a un modelo de enseñanza grande que se consulta utilizando generación de prompts. El marco Zephyr-7B sigue un enfoque similar al utilizado en el marco InstructGPT, y tiene como objetivo generar un modelo de estudiante efectivo y preciso.
La siguiente figura muestra brevemente los tres pasos principales involucrados en el funcionamiento del marco Zephyr-7B.
- dSFT para la construcción de conjuntos de datos a gran escala utilizando un estilo de autoinstrucción.
- Recopilación de AIF utilizando un conjunto de modelos de chat completos seguido de binarización de preferencia y puntuación por GPT-4.
- dPO del modelo dSFT utilizando los datos de retroalimentación.

dSFT o Destilación de Ajuste Fine-Tuning
El marco comienza con un modelo de lenguaje grande crudo que primero necesita ser entrenado para responder a prompts de usuario. Tradicionalmente, el entrenamiento de estos marcos de LLM para responder a prompts de usuario se realiza utilizando Ajuste Fine-Tuning supervisado en un conjunto de datos que consiste en instrucciones de alta calidad y sus respuestas correspondientes. Dado que el marco Zephyr-7B tiene acceso a un modelo de enseñanza de lenguaje, el marco puede generar instrucciones y respuestas, y entrenar el modelo directamente en estas instrucciones y respuestas, y este enfoque se conoce como dSFT o destilación de ajuste fine-tuning. La siguiente figura muestra la destilación realizada por SFT donde x representa un conjunto de prompts de semilla construidos con el propósito principal de representar un conjunto diverso de dominios temáticos, y representa la respuesta de muestra, que se refina utilizando una nueva instrucción de muestra representada por x1 y C representa el punto final en el conjunto de datos final.

Retroalimentación de Inteligencia Artificial a través de Preferencias
La retroalimentación humana se utiliza para asignar modelos de lenguaje grande, ya que pueden proporcionar las señales de retroalimentación adicionales necesarias, y estas retroalimentaciones humanas se proporcionan tradicionalmente a través de preferencias sobre la calidad de las respuestas generadas por los marcos de LLM. Sin embargo, el marco Zephyr utiliza retroalimentación de inteligencia artificial del modelo de enseñanza en las salidas de otros modelos en lugar de retroalimentación humana para fines de destilación. El enfoque seguido por el marco Zephyr se ve influenciado por el utilizado por el marco UltraFeedback que utiliza el modelo de enseñanza para proporcionar preferencias sobre las salidas del modelo.
De manera similar al enfoque de Ajuste Fine-Tuning supervisado, comienza con un conjunto de prompts, donde x representa cada prompt individual que se alimenta a una colección de cuatro modelos como Llama, Falcon, Claude y más, cada uno de los cuales genera una respuesta. Estas respuestas se alimentan como entrada al modelo de enseñanza como GPT-3 o GPT-4, y el modelo produce una puntuación para la respuesta de entrada. Después de recopilar las puntuaciones de salida, el modelo guarda la respuesta con la puntuación más alta.
dDPO o Optimización de Preferencia Directa de Difusión
dDPO es el paso final del marco Zephyr, y su objetivo principal es refinar el modelo de enseñanza dSFT al maximizar la probabilidad de clasificar la respuesta preferida en un modelo de preferencia determinado por una función de recompensa al utilizar el modelo de lenguaje del estudiante. El paso anterior que involucra el uso de retroalimentación de inteligencia artificial se centró principalmente en utilizar métodos de aprendizaje de refuerzo como PPO o Optimización de Preferencia Proximal para la maximización de la optimización. En este paso, la recompensa se entrena primero y luego se muestrea de la política actual para calcular las actualizaciones, y así maximizar la optimización. La optimización de preferencia directa sigue un enfoque similar para optimizar el modelo de preferencia directamente utilizando los datos estáticos. El objetivo después de conectar la función de recompensa al modelo de preferencia se puede escribir como

Zephyr-7B: Experimentos, Benchmarks y Resultados
El marco Zephyr realiza sus experimentos de ajuste fine-tuning en el marco de vanguardia actual Mistral-7B que entrega un rendimiento comparable al de modelos de lenguaje más grandes en una amplia variedad de tareas de procesamiento de lenguaje natural o NLP.
Conjuntos de Datos
El marco Zephyr utiliza dos conjuntos de datos de diálogo que se han destilado de una mezcla de modelos propietarios y abiertos, que han demostrado ser efectivos en la producción de modelos de chat efectivos.
UltraChat
UltraChat es un conjunto de datos de auto-mejora que consiste en casi 1,5 millones de diálogos multi-giro en 30 temas y 20 materiales de texto generados por el marco GPT-3.5-Turbo. Para abordar el problema de capitalización incorrecta en el conjunto de datos UltraChat, el marco aplica un enfoque de truecasing heurístico para eliminar los errores gramaticales.
UltraFeedback
UltraFeedback es un conjunto de datos de prompts con más de 64k prompts, con cada prompt que tiene cuatro respuestas de LLM individuales. El marco Zephyr utiliza la puntuación media más alta obtenida del conjunto de datos UltraFeedback para construir preferencias binarias, y una de las tres respuestas de LLM restantes se rechaza como aleatoria.
Evaluación
Para evaluar el rendimiento del marco Zephyr, los desarrolladores han optado por dos benchmarks de chat, uno de un solo giro y otro de múltiples giros, en un intento de evaluar la capacidad del modelo para seguir las instrucciones del usuario y responder en consecuencia.
MT-Bench
El benchmark de evaluación MT-Bench consiste en 160 preguntas en 8 áreas de conocimiento únicas, y bajo el benchmark MT-Bench, el modelo debe responder a una pregunta inicial y proporcionar una respuesta a la pregunta de seguimiento.
AlpacaEval
AlpacaEval es un benchmark de un solo giro bajo el cual el modelo o el marco genera respuestas de usuario a más de 800 preguntas en diferentes temas con un enfoque principal en la utilidad.
Además de estos dos benchmarks principales, el marco Zephyr-7B también se evalúa en Open LLM Leaderboard para tareas de clasificación multiclase, ARC, HellaSwag, MMLU y más. Además, independientemente del benchmark que se utilice para evaluar el marco Zephyr-7B, se compara con una serie de modelos propietarios y abiertos, con sus procedimientos de alineación siendo el único factor diferenciador.
Resultados
Ahora veamos cómo se desempeña el marco Zephyr-7B y se compara con los modelos de lenguaje actuales.
Implementación del Enfoque dDPO Mejora las Capacidades de Chat
La siguiente tabla compara el rendimiento del marco Zephyr-7B con los modelos de lenguaje de vanguardia en los benchmarks AlpacaEval y MT-Bench.

Como se puede ver claramente, cuando se compara con los modelos de 7B abiertos, el marco Zephyr-7B no solo supera significativamente a los modelos dSFT en los dos benchmarks, sino que también establece nuevos estándares de vanguardia. Además, el marco Zephyr-7B también logra superar al marco XWIN-LM-7B, que es uno de los pocos modelos entrenados en el enfoque dPPO o destilación de PPO. Además, el rendimiento entregado por el marco Zephyr-7B es comparable a los resultados entregados por modelos de lenguaje más grandes como Llama2-Chat con más de 70B parámetros.
dDPO Mejora el Rendimiento de Tareas Académicas
La siguiente figura compara el rendimiento del marco Zephyr-7B con una amplia variedad de marcos de LLM de código abierto y propietarios.

Como se puede ver, el marco Zephyr-7B supera significativamente a los marcos de LLM con 7B parámetros, y la brecha entre su rendimiento y el entregado por los mejores modelos dSFT también es notable. A medida que aumenta el número de parámetros, el marco Zephyr-7B se queda corto, aunque coincide con el rendimiento entregado por marcos con 40 mil millones de parámetros.
Optimización de Preferencia
En la siguiente figura, evaluamos cómo los diferentes pasos seguidos en el proceso de alineación afectan el rendimiento. Como se puede observar, el enfoque dDPO combinado con dSFT mejora significativamente el rendimiento en ambos conjuntos de datos MT-Bench y AlpacaEval.

Finalmente, en la siguiente figura podemos ver las precisiones de prueba y entrenamiento durante la implementación de DPO. Como se puede ver, el enfoque DPO no afecta el rendimiento del modelo en tareas downstream.

Conclusión
En este artículo, hemos hablado sobre el marco Zephyr-7B basado en el marco de vanguardia actual Mistral-7B que tiene como objetivo resolver el desafío actual de la destilación de alineación de un modelo de lenguaje grande a un marco preentrenado más pequeño. El objetivo principal del marco es permitir que los desarrolladores produzcan modelos de lenguaje grande más pequeños que se alineen con la intención del usuario más que nunca antes. El marco Zephyr-7B no solo examina la aplicación de los enfoques actuales para marcos de LLM más grandes como dSFT, sino que también explora la posibilidad de utilizar otros enfoques para aprender un modelo de chat con una mejor alineación con la intención del usuario.
Sin embargo, a pesar de los resultados prometedores, el marco Zephyr-7B no es perfecto, y todavía se necesita hacer algún trabajo. Una de las limitaciones obvias es utilizar el marco GPT-4 para evaluar los benchmarks MT-Bench y AlpacaEval, que a menudo ha sido sesgado hacia los modelos que destila él mismo. Sin embargo, el marco Zephyr-7B espera abrir un camino para explorar las capacidades de los modelos abiertos más pequeños que son capaces de alinearse con la intención del usuario y las interacciones.












