Entrevistas
Carolyn Harvey, Directora de Operaciones de LXT – Serie de Entrevistas

Carolyn Harvey tiene una amplia experiencia liderando y creciendo operaciones globales en el campo de la relevancia de búsqueda y anotación para datos de ML. Carolyn es actualmente la Directora de Operaciones (COO) de LXT, donde lidera la división de operaciones globales de la empresa, asegurando la entrega consistente de todos los programas y proyectos de datos de IA. Se enfoca en datos de alta calidad a gran escala, creando eficiencias en programas a largo plazo y escalando en gran número de ubicaciones globales.
Como COO de LXT, Carolyn aporta su gran experiencia para desarrollar una organización de clase mundial.
¿Puede describir brevemente qué hace LXT y su rol como COO?
La inteligencia artificial depende de los datos para existir, y LXT es un líder emergente en la entrega de datos precisos y éticamente obtenidos que impulsan las innovaciones de IA. Como Directora de Operaciones, mi rol es supervisar, liderar y expandir nuestras operaciones globales a través de estrategias, estructuras y procesos que nos permitan entregar los datos de IA de la más alta calidad a nuestros clientes. Me aseguro de que entreguemos a tiempo en una amplia gama de casos de uso, desde la IA generativa hasta la relevancia de búsqueda y los coches autónomos, entre muchos otros.
¿Cómo ha evolucionado la misión de LXT desde su inicio en 2010?
Nuestra misión es impulsar las tecnologías del futuro a través de la generación y mejora de datos en todos los idiomas, culturas y modalidades. Nuestro objetivo es ayudar a las empresas de todos los tamaños a aprovechar los increíbles beneficios que ofrece la IA, impulsando sus modelos con datos de alta calidad. A medida que la misión de la empresa ha evolucionado, nuestro alcance de servicios se ha expandido desde la transcripción de lenguaje y la recopilación de habla hasta incluir una amplia gama de soluciones, incluyendo la recopilación y anotación de datos para texto, imagen y video, servicios de IA generativa y más. También hemos expandido nuestra huella global de instalaciones certificadas ISO 27001 para satisfacer las crecientes necesidades de nuestros clientes de servicios de datos seguros.
¿Cuáles han sido los principales impulsores de su crecimiento en el sector de datos de entrenamiento de IA?
La continua inversión en IA por parte de organizaciones de todos los tamaños ha impulsado nuestro crecimiento. Las empresas ahora saben que la IA es fundamental para mantenerse competitivas, y los datos impulsan la IA. Pero no todos los datos son iguales, y las empresas que están teniendo éxito en la IA saben que los datos de alta calidad son críticos para crear IA más precisa.
Ahora, con la IA generativa en la mente de todos, esta tendencia ha abierto aún más oportunidades de crecimiento para LXT. Los humanos son fundamentales para asegurarse de que estas soluciones sean precisas, éticas y responsables. Ofrecemos una gama de servicios de IA generativa en áreas como la fine-tuning de grandes modelos de lenguaje, la creación de prompts y más. Nuestros clientes saben que para generar confianza con los usuarios finales, la salida de sus productos de IA generativa debe ser factual, representar a una audiencia diversa y estar libre de lenguaje tóxico. Podemos ayudarlos a lograr estos objetivos con nuestros servicios de “human in the loop”.
¿Cómo ha impactado la explosión de la IA generativa en LXT y sus clientes?
LXT ha visto un aumento en la demanda de sus datos de entrenamiento de IA debido a la IA generativa, tanto para los datos orientados al lenguaje como para los aspectos más nuevos relacionados con el análisis, la creatividad y el pensamiento crítico. También estamos viendo un aumento en la demanda de conocimientos de dominio y perfiles especializados para trabajadores de proyectos.
Las solicitudes de los clientes van más allá de las entradas de aprendizaje automático de tareas microscópicas del pasado hacia los LLM y los conjuntos de datos más complejos requeridos por aplicaciones como ChatGPT, Gemini y muchos otros. Actualmente estamos involucrados en varios proyectos innovadores donde estamos escribiendo prompts destinados a confundir a la IA generativa para ver cómo responde, y luego creamos la respuesta correcta.
En el futuro, esto puede evolucionar aún más hacia la inteligencia artificial general (IAG), donde los conjuntos de datos se corresponderán con acciones aún más complicadas y sofisticadas.
Con años de experiencia trabajando en búsqueda y personalización para mejorar estos algoritmos, ¿cuáles son algunas de las formas en que las empresas líderes están mejorando su relevancia de búsqueda para proporcionar una mejor experiencia de usuario?
En un mundo donde el tiempo es precioso y la información está en todas partes, mejorar la relevancia de búsqueda puede fortalecer la lealtad, aumentar las tasas de conversión y hacer que los usuarios sean más productivos.
La relevancia de búsqueda comienza con la limpieza y organización de los datos de nuestros clientes, eliminando cualquier cosa que pueda generar falsos positivos, y creando campos de datos adicionales a través de los cuales los motores de búsqueda y recomendación pueden buscar para generar resultados más precisos. Con la ayuda del aprendizaje automático y el procesamiento del lenguaje natural, los clientes pueden permitir que su motor de búsqueda intuya más intuitivamente la intención del usuario y aprenda sobre sus preferencias con el tiempo. El resultado es una experiencia de búsqueda más rápida que conduce a resultados más personalizados.
Alcanzar este objetivo requiere grandes volúmenes de datos de entrenamiento, con un enfoque particular en entrenar a los algoritmos para que reconozcan, clasifiquen y devuelvan entidades relevantes, y para manejar errores tipográficos, errores gramaticales y otras anomalías de datos. También recomendamos un enfoque de refuerzo “human in the loop” (HITL) para asegurar datos precisos, reducir los sesgos y proporcionar una mejor experiencia de búsqueda para el usuario final. Con los avances en el aprendizaje automático en los últimos 10 años, HITL ha intensificado su enfoque en los procesos de revisión de calidad, lo que impulsa la necesidad de una experiencia más profunda por parte de los proveedores de datos.
¿Puede elaborar sobre el enfoque de LXT para la anotación de datos y cómo garantiza la calidad y precisión de los datos de entrenamiento de IA?
Como equipo de operaciones, debemos entender primero cómo los clientes utilizan los datos que proporcionamos en el desarrollo de sus productos y servicios para asegurarnos de que se ajusten a sus necesidades. Para hacer que esto suceda, necesitamos encontrar expertos en gestión de proyectos y anotación que tengan experiencia con el tipo de datos requeridos.
Desde allí, se trata principalmente de preparación y encontrar los recursos adecuados al comienzo de cada proyecto. Esto incluye alinear con los clientes sobre factores de éxito durante la fase de planificación, así como procesos de calificación y verificación profundos para los anotadores de proyectos que consideren detalles importantes como antecedentes educativos, intereses especiales, demografía y experiencia. También desarrollamos materiales de aprendizaje y referencia detallados como una guía, personalizados para cada proyecto. Aplicamos una supervisión madura de la gestión de la calidad y los procesos en todos los ciclos de vida del proyecto. El enfoque que utilizamos se alinea con y informa las mejores prácticas de la industria, asegurando que los resultados cumplan con las expectativas de los clientes.
Y todas estas metodologías están al servicio de nuestra promesa de calidad de datos garantizada.
¿Cómo maneja LXT el desafío de anotar datos no estructurados, que comprenden más del 80% de todos los datos?
LXT ha construido una plataforma de anotación interna que automatiza muchas partes del proceso de anotación y proporciona estructura y una interfaz de usuario consistente para los trabajadores. En la etapa de preprocesamiento, nos enfocamos en la preparación de los datos, el formato de los archivos de entrada y la eliminación de duplicados, entre otras cosas, y en la etapa de postprocesamiento, abordamos el empaquetado de los datos, la recopilación y el formato para la entrega al cliente.
Antes de que el proyecto comience, creamos pautas que se revisan con el cliente y se iteran a lo largo del ciclo de vida del proyecto a medida que las cosas cambian. Podemos dividir el proceso de etiquetado de datos en múltiples tareas para enfocarnos en cada elemento del proyecto de manera adecuada. Además, implementamos metodologías de control de calidad para impulsar la eliminación de errores a gran escala.
Finalmente, nuestro Equipo de Excelencia Operativa es responsable de la gestión de procesos avanzada para asegurar una alta eficiencia y escalabilidad para nuestros proyectos en todo el mundo.
¿Cuáles son algunos de los mayores desafíos que LXT enfrenta al recopilar datos a gran escala a nivel global, y cómo los supera?
La diversidad y el sesgo en los participantes y en las colecciones de datos son a menudo algunos de los mayores desafíos que LXT, y cualquier proveedor de datos de entrenamiento de IA, enfrentará. Otros desafíos incluyen una demanda reciente de experiencia en dominio y un panorama en rápida evolución con el cambio hacia los LLM y la IA generativa.
Superamos estos desafíos a través de un enfoque altamente proactivo para encontrar nuestra piscina de candidatos, donde revisamos la experiencia, la experiencia previa, los roles anteriores, los intereses y la demografía para formar la diversidad adecuada entre los equipos por género u otros aspectos, como el pensamiento analítico o la escritura creativa, antecedentes educativos, entre otros.
Una vez que hemos encontrado a los candidatos adecuados, nos esforzamos por involucrar a los trabajadores de manera regular para construir una fuerza laboral más experimentada, leal y satisfecha a largo plazo.
En términos de evaluación de IA, ¿cómo trabaja LXT para mitigar el sesgo y asegurar salidas éticas en los sistemas de IA que ayuda a entrenar?
Como se mencionó anteriormente, asegurar la diversidad es un desafío que muchos proveedores de datos de entrenamiento de IA deben resolver, y eso irá muy lejos hacia la mitigación del sesgo y la garantía de salidas éticas.
Me referiré nuevamente a nuestras mejores prácticas de compromiso, que incluyen encontrar anotadores diversos y representativos, y ser exhaustivos con las pautas y las medidas de control de calidad. Tenemos una estrategia de fuentes de impacto que nos permite llevar el trabajo a grupos nuevos y diversos de anotadores, como en regiones de lenguaje de cola larga.
Apuntamos a salidas éticas a través de nuestro uso de las mejores prácticas de la industria, alineándonos con las expectativas de nuestros clientes y conduciendo estándares más altos para nuestros gerentes de proyectos y anotadores. La comunicación es esencial, así como las auditorías de cumplimiento, el análisis de sesgo y el compromiso con los requisitos de regulación y privacidad de datos.
¿Cuál es la visión a largo plazo para LXT y cómo ve la evolución de la empresa en los próximos cinco años?
Nuestra visión es proporcionar datos precisos y éticamente obtenidos para impulsar la implementación de la IA y las tecnologías del futuro que mejorarán y enriquecerán la experiencia de las personas en todo el mundo.
Mientras que la automatización y la tecnología son importantes en la IA, también hay un componente humano importante que complementa la tecnología. A medida que nos movemos desde tareas automatizadas simples a grandes modelos de lenguaje (LLM), y desde la IA generativa a la inteligencia artificial general (IAG), será fundamental que los productos de IA representen fielmente a las personas, tanto a aquellas que generan los datos como a nuestras comunidades globales en general.
En LXT, nos esforzamos por asegurarnos de que la IA se utilice de una manera positiva y transformadora que refleje estos valores.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar LXT.












