Modelos y plataformas de IA
Dr. Neil Yager, Co-Fundador y Científico Jefe de Phrasee – Serie de Entrevistas

El Dr. Neil Yager es el Científico Jefe de Phrasee, y el arquitecto del método Phrasee, una herramienta de redacción de copias publicitarias impulsada por IA que ha ayudado a optimizar el contenido publicitario para algunas de las marcas más reconocidas del mundo, incluyendo eBay, Groupon y Virgin, además de muchas otras, desde Australia hasta América, en más de 20 idiomas, desde el inglés hasta el japonés.
El Dr. Yager ha escrito más de una docena de publicaciones académicas, ha escrito un libro sobre minería de datos, y posee varias patentes. Como uno de los expertos líderes en la comercialización de la inteligencia artificial, tiene un doctorado en Ciencias de la Computación de la Universidad de Nueva Gales del Sur en Australia.
¿Cuál fue su experiencia laboral relacionada con la IA antes de unirse a Phrasee?
He estado involucrado en trabajos relacionados con la IA desde mi doctorado en la década de 2000. Sin embargo, el campo ha pasado por varias rebrandings desde entonces. Por ejemplo, hace 15 años estudié “reconocimiento de patrones estadísticos”. Unos años más tarde, esto se conoció comúnmente como “aprendizaje automático”, que es un nombre mucho más atractivo. Más recientemente, el aprendizaje automático (y el “aprendizaje profundo” en particular) se ha vuelto sinónimo de “inteligencia artificial” en general. Tengo sentimientos encontrados al respecto. Por un lado, mi trabajo con Phrasee me ha enseñado la importancia del branding. Por otro lado, el término “inteligencia artificial” conlleva equipaje y puede llevar a malentendidos sobre la tecnología. Me pregunto dónde estaríamos si todos todavía lo llamáramos “reconocimiento de patrones estadísticos”.
La mayor parte de mi trabajo anterior fue en los campos de procesamiento de señales y visión por computadora. No tenía mucha exposición al procesamiento del lenguaje natural antes de unirme a Phrasee. Desde entonces he aprendido que el lenguaje es probablemente el problema más difícil en la IA.
En 2008, coescribió un libro llamado ‘Biometric System and Data Analysis: Design, Evaluation, and Data Mining‘, que combina aspectos de estadísticas y aprendizaje automático para proporcionar una guía integral para evaluar, interpretar y comprender datos biométricos. ¿Cree que este campo ha evolucionado desde que se publicó este libro? ¿Podría describir cómo?
El aprendizaje profundo ha revolucionado los campos de la visión por computadora, el procesamiento del lenguaje y el aprendizaje automático desde que escribí ese libro. No sería posible escribir ese libro hoy en día sin una sección sobre aprendizaje profundo.
La revolución del aprendizaje profundo realmente despegó en 2012, cuando un modelo de aprendizaje profundo ganó una competencia llamada ImageNet. ImageNet es un conjunto de datos de reconocimiento de objetos visuales donde la computadora determina qué hay en una imagen (por ejemplo, “perro” o “globo”). Durante décadas, los investigadores habían estado haciendo avances incrementales en conjuntos de datos de referencia como este. Cada subcampo operaba de forma independiente y dependía en gran medida de la experiencia específica del dominio. Casi de la noche a la mañana, todos los modelos que se habían construido con tanto esfuerzo durante muchos años se volvieron obsoletos. Los algoritmos de aprendizaje profundo diseñados por personas externas estaban ganando competencias por márgenes significativos. Esto transformó la industria de la IA.
El campo sigue siendo muy dinámico y ha evolucionado incluso desde que fundamos Phrasee hace unos años. Por ejemplo, las herramientas de aprendizaje profundo en las que ahora dependemos no existían cuando fundamos la empresa. El ritmo de la innovación plantea desafíos propios.
¿Podría compartir con nosotros qué es lo que Phrasee puede hacer por las empresas?
Phrasee resuelve dos problemas para las empresas. En primer lugar, está el problema de escribir copias publicitarias. Hay más canales publicitarios ahora que nunca antes (por ejemplo, correo electrónico, AdWords, redes sociales, impresos, podcasts, etc.). Es difícil escribir copias para todos estos canales que sean de alta calidad y se ajusten al estilo y tono de voz de la marca. Phrasee aborda el problema de la escala generando automáticamente copias. En segundo lugar, es importante que todo el lenguaje utilizado sea eficaz. No solo Phrasee genera lenguaje, sino que también utiliza aprendizaje automático para predecir el impacto de los mensajes y optimizarlos en consecuencia.
¿Qué lo atrajo a la idea de utilizar el Procesamiento del Lenguaje Natural (NLP) y el Aprendizaje Profundo para mejorar el poder de la copia publicitaria?
Utilizar la IA para maximizar el impacto de las campañas de marketing digital no es una idea nueva. Hay equipos de personas con doctorados en física que han sido reclutados para trabajar en la optimización de anuncios. Sin embargo, en la mayoría de los casos, están centrando sus esfuerzos de I+D en cosas como la segmentación de la audiencia, la personalización, la entrega en el momento adecuado, la colocación de anuncios, las fuentes, etc. Cuando estábamos explorando ideas para Phrasee, nos dimos cuenta de que casi todo sobre los anuncios se está optimizando, excepto el lenguaje utilizado en realidad. Identificamos esto como una brecha en el mercado y una gran oportunidad.
Phrasee puede mejorar la copia publicitaria en más de 20 idiomas, incluyendo el japonés. ¿Podría discutir algunos de los problemas únicos del Procesamiento del Lenguaje Natural que se encuentran con los idiomas extranjeros?
La adición más reciente a nuestro conjunto de idiomas compatibles es el ruso. Este es un idioma eslavo y es bastante distinto de otros idiomas indoeuropeos. En este caso, fue necesario construir nuevas reglas en nuestro sistema de generación de lenguaje para que la salida sea fluida y gramaticalmente correcta. Esto no es solo un problema de idioma, sino también un problema de desarrollo de software. Cuando la salida de nuestro sistema está en el idioma nativo del desarrollador, es relativamente fácil detectar errores y verificar que todo funcione correctamente. Sin embargo, cuando trabajamos con ruso o japonés, podríamos estar produciendo sinsentidos y no tener idea. Es importante tener a un hablante nativo estrechamente involucrado en el proceso de control de calidad.
El desafío no es solo con los idiomas extranjeros. Hay algunas diferencias regionales interesantes también. Por ejemplo, el inglés tiene variaciones de ortografía para los Estados Unidos, el Reino Unido, Australia, Canadá, etc. Además, hay diferencias gramaticales. En inglés británico, “se tiene una mirada”, mientras que en inglés americano, “se toma una mirada”. El significado de las palabras también puede variar de un lugar a otro. Un “caucho” es un borrador en el Reino Unido, pero un condón en Norteamérica. Para que los sistemas de generación de lenguaje natural se utilicen en aplicaciones comerciales, deben manejar todas estas sutilezas.
¿Podría compartir algunos detalles sobre cómo se utiliza el aprendizaje profundo en Phrasee?
Hay dos componentes principales de IA en la tecnología de Phrasee. El primero es la Generación de Lenguaje Natural (NLG), que produce lenguaje en realidad. El segundo es el aprendizaje profundo, y el enfoque aquí está en el rendimiento. El rendimiento puede significar diferentes cosas dependiendo del contexto. Por ejemplo, el objetivo de un asunto de correo electrónico es atraer al destinatario para que abra el correo electrónico y vea el contenido dentro. Para Facebook (META ), el objetivo podría ser maximizar los “me gusta” o las comparticiones. Dado un gran volumen de datos históricos, es posible encontrar tendencias y patrones sutiles que nunca serían notados por un ser humano. Esto es un problema de aprendizaje automático estándar.
El aprendizaje profundo ofrece algunas ventajas sobre el enfoque de aprendizaje automático tradicional. Con el aprendizaje automático tradicional, hay un fuerte enfoque en la “ingeniería de características”. Esto significa que el desarrollador necesita decidir qué cree que son las características más importantes del lenguaje. Por ejemplo, palabras, longitud, uso de emojis, etc. El problema es que esto está limitado por la habilidad y la imaginación del ingeniero. Sin embargo, con el aprendizaje profundo, el texto sin procesar se alimenta al modelo, y este construye su propia representación de lenguaje (esto se conoce como aprendizaje de extremo a extremo). Por lo tanto, está libre de sesgos humanos y es un enfoque poderoso. Sin embargo, el inconveniente es que puede ser difícil entender por qué el modelo se comporta de la manera en que lo hace. La “explicabilidad” es un área de investigación activa dentro de la comunidad de aprendizaje profundo. Sin embargo, hay un compromiso fundamental entre la complejidad de un sistema y nuestra capacidad para entenderlo. El lenguaje humano es desordenado, por lo que las soluciones de NLP exitosas suelen tener un alto grado de complejidad.
Una de las funcionalidades de Phrasee es la capacidad de escribir en el tono único de una marca. ¿Podría elaborar sobre cómo se realiza esto?
Cuando firmamos a un nuevo cliente, lo primero que hacemos es recopilar información sobre el estilo de comunicación de su marca. Esto incluye cualquier directriz de marca formal, campañas de marketing históricas y una serie de cuestionarios que hemos desarrollado para este propósito. Toda esta información se utiliza por un equipo interno de técnicos de lenguaje para construir un modelo de lenguaje específico del cliente. Nuestros modelos de lenguaje son generativos, lo que significa que pueden producir lenguaje nunca visto antes en el estilo único del cliente.
Los modelos de lenguaje se pueden actualizar en cualquier momento. Por ejemplo, en este momento estamos en el pico de la crisis del COVID-19. Nuestro equipo de lenguaje está revisando nuestros modelos para asegurarse de que no se pueda crear lenguaje inapropiado. Una frase como “Estas ofertas están ganando popularidad” podría haber sido inofensiva hace unos meses, pero es claramente inapropiada en medio de una pandemia global. Esto demuestra la flexibilidad de nuestro sistema.
¿Qué tipo de datos se necesitan para que una empresa pueda empezar a utilizar Phrasee?
Para ser honesto, no se necesita mucha información para empezar con nosotros. El primer paso es identificar un área de proyecto adecuada. Por ejemplo, esto podría ser los asuntos de los correos electrónicos de promoción semanales. Idealmente, esto tendrá una audiencia relativamente grande y las comunicaciones serán regulares. Una vez identificado el proyecto, necesitamos información sobre el tema previsto y la voz de la marca para construir el modelo de lenguaje. Phrasee necesita resultados de rendimiento de forma continua. Dado que nuestra solución utiliza aprendizaje automático, es importante que midamos y rastreemos las métricas clave con el tiempo. Esta información se alimenta a nuestro sistema para que pueda optimizar continuamente para el compromiso.
¿Hay algo más que le gustaría compartir sobre Phrasee?
Cuando Parry, Victoria y yo fundamos Phrasee hace cinco años, estábamos seguros de que solo sería cuestión de tiempo antes de que surgieran muchos otros startups con productos similares. Nuestro plan era adelantarnos a la competencia y mantenernos un paso por delante. Sin embargo, nos ha sorprendido la falta de participantes en este espacio. ¿Dónde está todo el mundo? Creo que hay varias razones para esto, pero una de las principales es que el lenguaje es un problema tan difícil. Me parece que otros han intentado crear productos similares pero han fallado en las primeras etapas de I+D. Esto es un testimonio de lo único que es nuestra tecnología.
Gracias por la entrevista informativa sobre Procesamiento del Lenguaje Natural, Generación de Lenguaje Natural y Aprendizaje Profundo. Para obtener más información, los visitantes pueden visitar Phrasee.












