Líderes de opinión

La verdad sobre los datos sintéticos: por qué la experiencia humana es fundamental para el éxito de LLM

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los desarrolladores de LLM están recurriendo cada vez más a los datos sintéticos para acelerar el desarrollo y reducir los costos. Los investigadores detrás de varios modelos de alto nivel, como LLama 3, Qwen 2 y DeepSeek R1, han mencionado el uso de datos sintéticos para entrenar sus modelos en los artículos de investigación. Desde el exterior, parece la solución perfecta: un pozo infinito de información para acelerar el desarrollo y reducir los costos. Pero esta solución conlleva un costo oculto que los líderes empresariales no pueden ignorar.

En términos simples, los datos sintéticos son generados por modelos de AI para crear conjuntos de datos artificiales para entrenar, afinar y evaluar LLM y agentes de AI. En comparación con la annotación humana tradicional, permite que la canalización de datos se escalable rápidamente, lo que es esencial en el paisaje en constante evolución y competitivo del desarrollo de AI.

Las empresas pueden tener otras razones para utilizar “datos falsos”, como proteger información sensible o confidencial en entornos financieros o de salud al generar versiones anonimizadas. Los datos sintéticos también son un buen sustituto cuando no están disponibles datos propiedad de terceros, como antes de lanzar un producto o cuando los datos pertenecen a clientes externos.

¿Están revolucionando los datos sintéticos el desarrollo de AI? La respuesta corta es un sí calificado: tienen un gran potencial, pero también pueden exponer a los LLM y agentes a vulnerabilidades críticas sin una supervisión humana rigurosa. Los productores de LLM y desarrolladores de agentes de AI pueden encontrar que los modelos de AI entrenados con datos sintéticos no verificados pueden generar salidas inexactas o sesgadas, crear crisis de reputación y resultar en incumplimiento de los estándares industriales y éticos. Invertir en supervisión humana para refinar los datos sintéticos es una inversión directa en la protección de la línea de fondo, el mantenimiento de la confianza de los stakeholders y la garantía de una adopción responsable de AI.

Con la entrada de humanos, los datos sintéticos pueden transformarse en datos de entrenamiento de alta calidad. Hay tres razones críticas para refinar los datos generados antes de utilizarlos para entrenar AI: para llenar las lagunas en el conocimiento del modelo de origen, para mejorar la calidad de los datos y reducir el tamaño de la muestra, y para alinear con los valores humanos.

Necesitamos capturar conocimiento único

Los datos sintéticos se generan principalmente por LLM que se entrenan en fuentes de internet disponibles públicamente, creando una limitación inherente. El contenido público rara vez capta el conocimiento práctico y de manos en la obra utilizado en el trabajo real. Actividades como diseñar una campaña de marketing, preparar un pronóstico financiero o realizar un análisis de mercado son típicamente privadas y no se documentan en línea. Además, las fuentes tienden a reflejar el lenguaje y la cultura centrados en EE. UU., limitando la representación global.

Para superar estas limitaciones, podemos involucrar a expertos para crear muestras de datos en áreas que sospechamos que el modelo de generación de datos sintéticos no puede cubrir. Volviendo al ejemplo corporativo, si queremos que nuestro modelo final maneje pronósticos financieros y análisis de mercado de manera efectiva, los datos de entrenamiento necesitan incluir tareas realistas de estos campos. Es importante identificar estas lagunas y complementar los datos sintéticos con muestras creadas por expertos.

Los expertos a menudo se involucran al principio del proyecto para definir el alcance del trabajo. Esto incluye crear una taxonomía, que describe las áreas específicas de conocimiento donde el modelo necesita realizar. Por ejemplo, en la salud, la medicina general se puede dividir en subtemas como nutrición, salud cardiovascular, alergias y más. Un modelo de salud debe entrenarse en todas las subáreas que se espera que cubra. Después de que la taxonomía se define por expertos en salud, los LLM pueden utilizarse para generar puntos de datos con preguntas y respuestas típicas rápidamente y a escala. Los expertos humanos todavía son necesarios para revisar, corregir y mejorar este contenido para asegurarse de que no solo sea preciso, sino también seguro y contextualmente apropiado. Este proceso de aseguramiento de la calidad es necesario en aplicaciones de alto riesgo, como la salud, para garantizar la precisión de los datos y mitigar el daño potencial.

Cantidad vs calidad: impulsar la eficiencia del modelo con menos, mejores muestras

Cuando los expertos en dominio crean datos para entrenar LLM y agentes de AI, crean taxonomías para conjuntos de datos, escriben preguntas, crean las respuestas ideales o simulan una tarea específica. Todos los pasos están diseñados cuidadosamente para adaptarse al propósito del modelo, y la calidad se garantiza por expertos en la materia en los campos correspondientes.

La generación de datos sintéticos no replica completamente este proceso. Se basa en las fortalezas del modelo subyacente utilizado para crear los datos, y la calidad resultante a menudo no es comparable a la de los datos curados por humanos. Esto significa que los datos sintéticos a menudo requieren volúmenes mucho más grandes para lograr resultados satisfactorios, lo que aumenta los costos computacionales y el tiempo de desarrollo.

En dominios complejos, hay matices que solo los expertos humanos pueden detectar, especialmente con valores atípicos o casos de borde. Los datos curados por humanos entregan consistentemente un mejor rendimiento del modelo, incluso con conjuntos de datos significativamente más pequeños. Al integrar estratégicamente la experiencia humana en el proceso de creación de datos, podemos reducir la cantidad de muestras necesarias para que el modelo funcione de manera efectiva.

En nuestra experiencia, la mejor manera de abordar este desafío es involucrar a expertos en la materia en la construcción de conjuntos de datos sintéticos. Cuando los expertos diseñan las reglas para la generación de datos, definen taxonomías de datos y revisan o corrigen los datos generados, la calidad final de los datos es mucho mayor. Este enfoque ha permitido a nuestros clientes lograr resultados sólidos utilizando menos muestras de datos, lo que conduce a un camino más rápido y eficiente hacia la producción.

Construir confianza: el papel irremplazable de los humanos en la seguridad y alineación de AI

Los sistemas automatizados no pueden anticipar todas las vulnerabilidades ni garantizar la alineación con los valores humanos, particularmente en casos de borde y escenarios ambiguos. Los revisores humanos expertos desempeñan un papel crucial en la identificación de riesgos emergentes y la garantía de resultados éticos antes de la implementación. Esta es una capa de protección que, al menos por ahora, AI no puede proporcionar por sí sola.

Por lo tanto, para construir un conjunto de datos de pruebas sólido, los datos sintéticos solos no serán suficientes. Es importante involucrar a expertos en seguridad desde el principio del proceso. Pueden ayudar a trazar los tipos de ataques potenciales y guiar la estructura del conjunto de datos. Los LLM pueden utilizarse para generar un gran volumen de ejemplos. Después de eso, los expertos son necesarios para verificar y refinar los datos para asegurarse de que sean realistas, de alta calidad y útiles para probar sistemas de AI. Por ejemplo, un LLM puede generar miles de preguntas de hacking estándar, pero un experto en seguridad puede crear ataques de “ingeniería social” novedosos que explotan sesgos psicológicos sutiles – una amenaza creativa que los sistemas automatizados luchan por inventar por sí solos.

Ha habido un progreso significativo en la alineación de LLM utilizando retroalimentación automatizada. En el artículo RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” los investigadores muestran que la alineación basada en AI puede realizar comparativamente a la retroalimentación humana en muchos casos. Sin embargo, mientras la retroalimentación de AI mejora a medida que los modelos mejoran, nuestra experiencia muestra que RLAIF todavía lucha en dominios complejos y con casos de borde o valores atípicos, áreas donde el rendimiento puede ser crítico dependiendo de la aplicación. Los expertos humanos son más efectivos para manejar matices de tareas y contexto, lo que los hace más confiables para la alineación.

Los agentes de AI también se benefician de pruebas automatizadas para abordar una amplia gama de riesgos de seguridad. Los entornos de prueba virtuales utilizan datos generados para simular comportamientos de agentes como la interfaz con herramientas en línea y la realización de acciones en sitios web. Para maximizar la cobertura de pruebas en escenarios realistas, la experiencia humana es integral para diseñar los casos de prueba, verificar los resultados de las evaluaciones automatizadas y informar sobre vulnerabilidades.

El futuro de los datos sintéticos

Los datos sintéticos son una técnica muy valiosa para el desarrollo de modelos de lenguaje grande, especialmente cuando la escalabilidad y la implementación rápida son críticas en el paisaje en constante evolución de hoy. Si bien no hay fallos fundamentales en los datos sintéticos en sí, requieren refinamiento para alcanzar su máximo potencial y entregar el valor más alto. Un enfoque híbrido que combina la generación de datos automatizada con la experiencia humana es un método muy efectivo para desarrollar modelos capaces y confiables, ya que el rendimiento final del modelo depende más de la calidad de los datos que del volumen total. Este proceso integrado, que utiliza AI para la escalabilidad y expertos humanos para la validación, produce modelos más capaces con una mejor alineación de seguridad, lo cual es esencial para construir la confianza del usuario y garantizar una implementación responsable.

Ilya Kochik es el Vicepresidente de Desarrollo de Negocios en Toloka, un socio de datos humanos para los principales laboratorios de investigación de GenAI, donde se especializa en tareas de vanguardia para modelos y sistemas agénticos de frontera. Con sede en Londres, su experiencia incluye roles de liderazgo y técnicos en Google, QuantumBlack (AI de McKinsey) y Bain & Company.