Modelos y plataformas de IA
Generación de paráfrasis utilizando aprendizaje de refuerzo profundo – Líderes de pensamiento

Cuando escribimos o hablamos, todos nos hemos preguntado si hay una mejor manera de comunicar una idea a los demás. ¿Qué palabras debería usar? ¿Cómo debería estructurar el pensamiento? ¿Cómo es probable que respondan? En Phrasee, pasamos mucho tiempo pensando en el lenguaje, qué funciona y qué no.
Imagina que estás escribiendo el asunto de una campaña de correo electrónico que se enviará a 10 millones de personas en tu lista para promocionar un 20% de descuento en una laptop nueva y elegante.
¿Qué línea elegirías:
- Ahora puedes tomar un 20% adicional de descuento en tu próxima orden
- Prepárate – un 20% adicional de descuento
Aunque transmiten la misma información, una logró una tasa de apertura casi un 15% mayor que la otra (y apuesto a que no puedes superar a nuestro modelo para predecir cuál es ?). Aunque el lenguaje a menudo se puede probar a través de pruebas A/B o bandas armadas múltiples, generar paráfrasis automáticamente sigue siendo un problema de investigación muy desafiante.
Dos oraciones se consideran paráfrasis una de la otra si comparten el mismo significado y se pueden usar de manera intercambiable. Otra cosa importante que a menudo se da por sentada es si una oración generada por una máquina es fluida.
A diferencia del aprendizaje supervisado, los agentes de aprendizaje de refuerzo (RL) aprenden interactuando con su entorno y observando las recompensas que reciben como resultado. Esta diferencia ligeramente matizada tiene implicaciones masivas en la forma en que funcionan los algoritmos y cómo se entrenan los modelos. El aprendizaje de refuerzo profundo utiliza redes neuronales como un aproximador de función para permitir que el agente aprenda a superar a los humanos en entornos complejos como Go, Atari y StarCraft II.
A pesar de este éxito, el aprendizaje de refuerzo no se ha aplicado ampliamente a problemas del mundo real, incluido el procesamiento de lenguaje natural (NLP).
Como parte de mi tesis de maestría en Ciencia de Datos, demostramos cómo el aprendizaje de refuerzo profundo se puede utilizar para superar a los métodos de aprendizaje supervisado en la generación automática de paráfrasis de texto de entrada. El problema de generar la mejor paráfrasis se puede ver como encontrar la serie de palabras que maximiza la similitud semántica entre oraciones mientras mantiene la fluidez en la salida. Los agentes de RL están bien adaptados para encontrar el mejor conjunto de acciones para lograr la recompensa máxima esperada en entornos de control.
En contraste con la mayoría de los problemas de aprendizaje automático, el problema más grande en la mayoría de las aplicaciones de generación de lenguaje natural (NLG) no radica en la modelización, sino en la evaluación. Mientras que la evaluación humana se considera actualmente el estándar de oro en la evaluación de NLG, tiene desventajas significativas, incluyendo ser costosa, llevar mucho tiempo, ser difícil de ajustar y carecer de reproducibilidad en experimentos y conjuntos de datos (Han, 2016). Como resultado, los investigadores han estado buscando durante mucho tiempo métricas automáticas que sean simples, generalizables y que reflejen el juicio humano (Papineni et al., 2002).
Los métodos de evaluación automáticos más comunes en la evaluación de subtítulos de imágenes generados por máquina se resumen a continuación con sus pros y contras:

Generación de paráfrasis utilizando aprendizaje de refuerzo
Desarrollamos un sistema llamado ParaPhrasee que genera paráfrasis de alta calidad. El sistema consta de varios pasos para aplicar el aprendizaje de refuerzo de manera computacionalmente eficiente. Un resumen breve de la tubería de alto nivel se muestra a continuación con más detalles contenidos en la tesis.

Conjunto de datos
Hay varios conjuntos de datos de paráfrasis disponibles que se utilizan en la investigación, incluyendo: el corpus de paráfrasis de Microsoft (MSFT ), la competencia de similitud semántica de texto de ACL, Preguntas duplicadas de Quora y Enlaces compartidos de Twitter. Hemos seleccionado MS-COCO dado su tamaño, limpieza y uso como referencia para dos artículos notables de generación de paráfrasis. MS-COCO contiene 120k imágenes de escenas comunes con 5 subtítulos de imagen por imagen proporcionados por 5 anotadores humanos diferentes.
Aunque está diseñado principalmente para la investigación de visión por computadora, los subtítulos tienden a tener una alta similitud semántica y son paráfrasis interesantes. Dado que los subtítulos de imagen están proporcionados por personas diferentes, tienden a tener variaciones ligeras en los detalles proporcionados en la escena, por lo que las oraciones generadas tienden a alucinar detalles.

Modelo supervisado
Aunque el aprendizaje de refuerzo ha mejorado considerablemente en términos de eficiencia de muestra, tiempos de entrenamiento y mejores prácticas generales, entrenar modelos de RL desde cero sigue siendo muy lento e inestable (Arulkumaran et al., 2017). Por lo tanto, en lugar de entrenar desde cero, primero entrenamos un modelo supervisado y luego lo ajustamos utilizando RL.
Usamos un marco de modelo Encoder-Decoder y evaluamos el rendimiento de varios modelos supervisados de referencia. Cuando ajustamos el modelo utilizando RL, solo ajustamos la red decodificadora y tratamos la red codificadora como estática. Como tal, consideramos dos marcos principales:
- Entrenar el modelo supervisado desde cero utilizando un codificador-decodificador estándar/vanilla con GRUs
- Utilizar modelos de incrustación de oraciones preentrenados para el codificador, incluyendo: incrustaciones de palabras agrupadas (GloVe), InferSent y BERT
Los modelos supervisados tienden a rendir de manera bastante similar en todos los modelos, con BERT y el codificador-decodificador vanilla logrando el mejor rendimiento.

Aunque el rendimiento tiende a ser razonable, hay tres fuentes comunes de error: tartamudeo, generación de fragmentos de oración y alucinaciones. Estos son los principales problemas que intenta resolver el uso de RL.

Modelo de aprendizaje de refuerzo
Implementar algoritmos de RL es muy desafiante, especialmente cuando no sabes si el problema se puede resolver. Puede haber problemas en la implementación de tu entorno, tus agentes, tus hiperparámetros, tu función de recompensa o una combinación de todos los anteriores. Estos problemas se ven exacerbados cuando se hace aprendizaje de refuerzo profundo, ya que se suma la complejidad de depurar redes neuronales.
Como con todas las depuraciones, es crucial empezar de manera sencilla. Implementamos variaciones de dos entornos de RL de juguete bien entendidos (CartPole y FrozenLake) para probar algoritmos de RL y encontrar una estrategia repetible para transferir conocimiento del modelo supervisado.
Encontramos que utilizar un algoritmo Actor-Critic superó a REINFORCE en estos entornos. En cuanto a transferir conocimiento al modelo Actor-Critic, encontramos que inicializar los pesos del actor con el modelo supervisado entrenado y preentrenar el crítico logró el mejor rendimiento. Encontramos que era difícil generalizar enfoques de destilación de políticas sofisticados a nuevos entornos, ya que introducen muchos nuevos hiperparámetros que requieren ajuste para funcionar.
Apartir de estas ideas, luego nos dirigimos a desarrollar un enfoque para la tarea de generación de paráfrasis. Primero necesitamos crear un entorno.

El entorno nos permite probar fácilmente el impacto de utilizar diferentes métricas de evaluación como funciones de recompensa.
Luego definimos el agente, dado sus muchas ventajas, utilizamos una arquitectura Actor-Critic. El actor se utiliza para seleccionar la próxima palabra en la secuencia y tiene sus pesos inicializados utilizando el modelo supervisado. El crítico proporciona una estimación de la recompensa esperada que un estado es probable que reciba para ayudar al actor a aprender.
Diseñar la función de recompensa correcta
El componente más importante de diseñar un sistema de RL es la función de recompensa, ya que es lo que el agente de RL está tratando de optimizar. Si la función de recompensa es incorrecta, entonces los resultados sufrirán, incluso si todas las demás partes del sistema funcionan.
Un ejemplo clásico de esto es CoastRunners, donde los investigadores de OpenAI establecieron la función de recompensa como maximizar la puntuación total en lugar de ganar la carrera. El resultado de esto es que el agente descubrió un bucle donde podía obtener la puntuación más alta golpeando turbos sin completar nunca la carrera.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Dado que evaluar la calidad de las paráfrasis es en sí mismo un problema sin resolver, diseñar una función de recompensa que capture automáticamente este objetivo es aún más difícil. La mayoría de los aspectos del lenguaje no se descomponen bien en métricas lineales y son dependientes de la tarea (Novikova et al., 2017).
El agente de RL a menudo descubre una estrategia interesante para maximizar las recompensas que explota las debilidades en la métrica de evaluación en lugar de generar texto de alta calidad. Esto tiende a resultar en un rendimiento pobre en las métricas que el agente no está optimizando directamente.
Consideramos tres enfoques principales:
- Métricas de superposición de palabras
Las métricas de evaluación de NLP más comunes consideran la proporción de superposición de palabras entre la paráfrasis generada y la oración de evaluación. Cuanto mayor sea la superposición, mayor será la recompensa. El desafío de los enfoques a nivel de palabra es que el agente incluye demasiadas palabras de conexión como “a es en de” y no hay medida de fluidez. Esto resulta en paráfrasis de muy mala calidad.

- Métricas de similitud y fluidez a nivel de oración
Las propiedades principales de una paráfrasis generada son que debe ser fluida y semánticamente similar a la oración de entrada. Por lo tanto, intentamos puntuar estas individualmente y luego combinar las métricas. Para la similitud semántica, utilizamos la similitud coseno entre incrustaciones de oraciones de modelos preentrenados, incluyendo BERT. Para la fluidez, utilizamos una puntuación basada en la perplejidad de una oración de GPT-2. Cuanto mayor sea la similitud coseno y las puntuaciones de fluidez, mayor será la recompensa.
Probamos muchas combinaciones diferentes de modelos de incrustación de oraciones y modelos de fluidez, y aunque el rendimiento fue razonable, el problema principal que enfrentó el agente fue no equilibrar suficientemente la similitud semántica con la fluidez. Para la mayoría de las configuraciones, el agente priorizó la fluidez, lo que resultó en la eliminación de detalles y la mayoría de las entidades se colocaron “en el medio” de algo o se movieron “en una mesa” o “al lado de la carretera”.
El aprendizaje de refuerzo multiobjetivo es una pregunta de investigación abierta y es muy desafiante en este caso.

- Utilizar un modelo adversario como función de recompensa
Dado que los humanos se consideran el estándar de oro en la evaluación, entrenamos un modelo separado llamado discriminador para predecir si dos oraciones son paráfrasis una de la otra (similar a la forma en que un humano evaluaría). El objetivo del modelo de RL es entonces convencer a este modelo de que la oración generada es una paráfrasis de la entrada. El discriminador genera una puntuación de cuán probable es que las dos oraciones sean paráfrasis una de la otra, que se utiliza como recompensa para entrenar al agente.
Cada 5,000 intentos, el discriminador se le dice cuál paráfrasis provino del conjunto de datos y cuál se generó para que pueda mejorar sus conjeturas futuras. El proceso continúa durante varias rondas con el agente tratando de engañar al discriminador y el discriminador tratando de diferenciar entre las paráfrasis generadas y las paráfrasis de evaluación del conjunto de datos.
Después de varias rondas de entrenamiento, el agente genera paráfrasis que superan a los modelos supervisados y otras funciones de recompensa.

Conclusión y limitaciones
Los enfoques adversarios (incluido el autojuego para juegos) proporcionan un enfoque muy prometedor para entrenar algoritmos de RL para superar el rendimiento humano en ciertas tareas sin definir una función de recompensa explícita.
Aunque el RL pudo superar al aprendizaje supervisado en este caso, la cantidad de sobrecarga adicional en términos de código, computación y complejidad no vale la pena la ganancia de rendimiento para la mayoría de las aplicaciones. El RL es mejor dejarlo para situaciones en las que el aprendizaje supervisado no se puede aplicar fácilmente y una función de recompensa es fácil de definir (como juegos de Atari). Los enfoques y algoritmos son mucho más maduros en el aprendizaje supervisado y la señal de error es mucho más fuerte, lo que resulta en un entrenamiento mucho más rápido y estable.
Otra consideración es que, como con otros enfoques neuronales, el agente puede fallar de manera muy dramática en casos en los que la entrada es diferente de las entradas que ha visto anteriormente, lo que requiere una capa adicional de verificaciones de cordura para aplicaciones de producción.
La explosión de interés en los enfoques de RL y los avances en la infraestructura computacional en los últimos años desbloquearán oportunidades enormes para aplicar RL en la industria, especialmente dentro del NLP.












