Líderes de opinión

El auge de los datos sintéticos y por qué complementarán en lugar de reemplazar a los datos reales

mm
Añade Unite.AI a tus fuentes preferidas en Google

Elon Musk afirmó recientemente que hemos agotado los datos humanos disponibles para entrenar modelos de inteligencia artificial. Su advertencia es el último comentario sobre la necesidad de nuevas fuentes de datos si la inteligencia artificial ha de continuar su rápido progreso. En industrias como la atención médica y las finanzas, las estrictas regulaciones de privacidad están haciendo que la escasez de datos sea aún más aguda.

Mientras que los datos sintéticos, una posible solución a esta escasez, no son nuevos, su importancia sigue creciendo, como se evidencia en las recientes oleadas de fusiones y inversiones en este campo. Sin embargo, existen incertidumbres profundas en torno al uso de datos sintéticos, especialmente el riesgo de colapso del modelo, donde la calidad de la salida de un modelo de lenguaje grande multimodal (LLM) se deteriora sin datos del mundo real para entrenarlo. Si este problema resulta intractable o soluble, puede tener un impacto significativo en el futuro de la inteligencia artificial generativa (Gen AI).

¿Qué son los datos sintéticos y cómo se crean?

Los datos sintéticos se crean artificialmente en lugar de recopilarse a partir de eventos reales. Los datos sintéticos generados por inteligencia artificial son ahora la forma más extendida, que implica entrenar modelos en datos del mundo real para detectar patrones y correlaciones, y luego generar nuevos datos que imitan estas propiedades estadísticas.

Los LLM se están utilizando para generar una variedad de tipos de datos sintéticos, incluidos datos estructurados, como datos tabulares, y datos no estructurados, como textos libres, videos e imágenes. Se utilizan una serie de métodos, dependiendo del tipo de datos que se producen.

Por ejemplo, dos métodos comunes utilizados para generar datos de imagen sintéticos son GANs y modelos de difusión. Los GANs utilizan dos redes neuronales: un generador crea versiones artificiales de datos reales, mientras que un discriminador identifica cuáles son reales y cuáles son generados. Trabajando juntos continuamente, el generador intenta “engañar” al discriminador, mejorando constantemente la realismo y la diversidad de los datos artificiales. Los modelos de difusión siguen un enfoque diferente, aprendiendo a distorsionar los datos reales y luego invirtiendo este proceso para “desenoizar” los datos. Una vez entrenados efectivamente, pueden producir datos sintéticos de alta calidad.

La creciente importancia de los datos sintéticos

Ha habido un interés de larga data en los datos sintéticos. Sin embargo, en los últimos 5 años, el rápido desarrollo de los LLM ha aumentado la demanda de datos sintéticos y ha creado un medio cada vez más efectivo para generarlos a escala. Como resultado, el uso de datos sintéticos ha aumentado vertiginosamente.

Gartner prevé que los datos sintéticos representarán el 60% de todos los datos utilizados para entrenar a los LLM para 2024, en comparación con solo el 1% en 2021. Hay todas las razones para creer que esta estimación es ampliamente precisa. Por ejemplo, el modelo Phi-4 de Microsoft, que supera a otros LLM a pesar de ser mucho más pequeño, fue entrenado con éxito en datos sintéticos en su mayoría. Mientras tanto, los ingenieros de Alexa de Amazon están explorando el uso de un modelo “maestro/alumno” donde el modelo “maestro” genera datos sintéticos que se utilizan para ajustar un modelo “alumno” más pequeño.

Esta adopción generalizada se refleja en los movimientos importantes en el mercado. El sector de los datos sintéticos experimentó un auge de inversiones en 2021-22. Gretel AI y Tonic.ai obtuvieron rondas de financiación Serie B de $50 millones y $35 millones, respectivamente. Estos fueron seguidos por MOSTLY AI cerrando una ronda de financiación Serie B de $25 millones y Synthesis AI obteniendo $17 millones en financiación Serie A.

Más recientemente, la tendencia ha sido hacia adquisiciones a gran escala. La adquisición de Gretel por parte de NVIDIA esta primavera apoyará el trabajo de la gigante tecnológica en este campo. De manera similar, la empresa de soluciones de inteligencia artificial SAS adquirió la startup de datos sintéticos Hazy en noviembre de 2024.

La firma de análisis Cognilytica estimó que el mercado de generación de datos sintéticos en 2021 fue de alrededor de $110 millones. La firma espera que alcance $1.15 mil millones para 2027. Otras previsiones anticipan un CAGR del 31% para el sector, a medida que crece hasta $2.33 mil millones en valor para 2030.

Colapso del modelo

Sin embargo, el emocionante potencial de los datos sintéticos viene con un importante inconveniente: el colapso del modelo. Este es un fenómeno en el que los LLM entrenados únicamente con datos sintéticos comienzan a producir salidas menos precisas o menos diversas.

Mientras que los datos del mundo real tienden a ser altos en complejidad, los datos sintéticos a menudo se simplifican y condensan en los modelos. Por ejemplo, los investigadores encontraron que la precisión de un modelo entrenado para detectar lunares cancerosos en fotografías estaba relacionada inversamente con la cantidad de datos de entrenamiento sintéticos. Un estudio reciente de académicos de Oxford, Cambridge, Imperial College y la Universidad de Toronto encontró que el uso de datos generados por modelos de manera indiscriminada llevó a “defectos irreversibles en el modelo resultante.”

Peor aún, la mayoría de los LLM son “cajas negras”, lo que hace difícil entender cómo responderán a los datos sintéticos. Investigadores de la Universidad de Rice y Stanford concluyeron que sin algunos datos frescos del mundo real, “los modelos generativos futuros están condenados a tener su calidad (precisión) o diversidad (recuerdo) disminuir progresivamente.”

La necesidad continua de datos del mundo real

Evidentemente, incluso con el aumento en la demanda de datos sintéticos, la necesidad de datos del mundo real sigue siendo. De hecho, la demanda de datos del mundo real de alta calidad puede incluso aumentar. La razón de esto es doble. Primero, los datos del mundo real siempre serán necesarios para entrenar los modelos de inteligencia artificial que generan los datos sintéticos. Y segundo, para evitar el colapso del modelo, es necesario sincronizar continuamente los datos sintéticos con los datos del mundo real.

Datos reales para entrenar modelos de inteligencia artificial que producen datos sintéticos

Como se mencionó anteriormente, la mayoría de los datos sintéticos de hoy en día se crean utilizando inteligencia artificial generativa. Y estos modelos de inteligencia artificial generativa deben ser entrenados en datos del mundo real para crear datos sintéticos útiles. Esto se debe a que solo pueden crear datos sintéticos replicando los patrones y propiedades estadísticas de un conjunto de datos del mundo real.

Consideremos el ejemplo reciente de una compañía de seguros que pudo utilizar datos sintéticos para probar a diferentes proveedores sin comprometer sus datos de clientes sensibles. Para generar este conjunto de datos sintéticos, que imitaba con precisión la realidad, tuvo que utilizar sus propios datos del mundo real para entrenar el modelo de inteligencia artificial que luego generó los datos sintéticos.

Datos reales para mitigar el colapso del modelo

Existen múltiples estrategias para mitigar el riesgo de colapso del modelo. Estas incluyen validar y revisar regularmente los conjuntos de datos sintéticos, y comprobar la calidad de los datos sintéticos antes de que se utilicen en modelos generativos. Sin embargo, el enfoque más común es diversificar los datos utilizados combinando datos sintéticos con datos humanos. La encuesta de Gartner encontró que el 63% de los encuestados prefieren utilizar un conjunto de datos parcialmente sintético, con solo el 13% que dice utilizar datos sintéticos completamente.

Incluso agregar cantidades modestas de datos del mundo real puede mejorar significativamente el rendimiento de un modelo. Investigadores de la Universidad del Sur de California encontraron que las empresas pueden reemplazar hasta el 90% de sus datos reales con datos sintéticos sin experimentar una caída significativa en el rendimiento. Sin embargo, reemplazar ese último 10% de datos humanos resulta en una disminución significativa.

La calidad también cuenta, como se ilustra en el caso del éxito de Microsoft con Phi-4. Este LLM se entrenó en datos sintéticos predominantemente generados por GPT-4o. Sin embargo, gran parte de los datos de preentrenamiento, un conjunto de datos general utilizado para la primera etapa de entrenamiento antes de que un modelo se ajuste, fueron datos del mundo real de alta calidad y cuidadosamente curados, incluyendo libros y artículos de investigación.

Beneficios potenciales que los datos sintéticos pueden aportar

Cuando los datos sintéticos se utilizan de manera inteligente y se combinan eficazmente con datos del mundo real, tienen el potencial de resolver seis problemas específicos en cuanto a los datos de entrenamiento de inteligencia artificial: escasez, accesibilidad, homogeneidad, sesgo, problemas de privacidad y costo.

Escasez de datos

A medida que las empresas de inteligencia artificial compiten por ganar participación de mercado y lograr nuevos hitos, la insaciable demanda de datos para entrenar a sus LLM aumenta. Los datos sintéticos tienen el potencial de llenar esta brecha, al menos según la investigación de Gartner. Sin embargo, se debe tener en cuenta que se necesitarán cantidades significativas de datos reales en los conjuntos de datos de preentrenamiento y para sincronizar con los datos sintéticos para evitar el colapso del modelo.

Accesibilidad de los datos

Cada vez más, las grandes empresas tecnológicas actúan como guardianes de los datos, creando una barrera de entrada para los jugadores más pequeños. Los datos sintéticos tienen el potencial de democratizar la inteligencia artificial generativa al hacer que grandes cantidades de datos de entrenamiento sean asequibles y accesibles. Sin embargo, esto no eliminará la responsabilidad de las grandes empresas tecnológicas de mejorar el acceso a los datos del mundo real, ya que aún son necesarios para entrenar los modelos que producen datos sintéticos.

Homogeneidad de los datos

En algunos casos de uso específicos, como el entrenamiento de inteligencia artificial para conducir de manera autónoma, los conjuntos de datos del mundo real son demasiado homogéneos. En el caso de la conducción, los desarrolladores pueden generar datos sintéticos para llenar las brechas en los datos para situaciones inusuales. Esto permite que los modelos se entrenen para eventos raros en la carretera.

Sesgo

Algunos conjuntos de datos del mundo real contienen sesgos inherentes, por lo que los datos sintéticos se pueden generar para asegurarse de que los modelos de inteligencia artificial reciban una imagen más equilibrada. Por ejemplo, en las finanzas, la Autoridad de Conducta Financiera del Reino Unido (FCA) ha argumentado que los datos sintéticos tienen el potencial de contrarrestar los posibles sesgos causados por la subrepresentación de ciertos grupos en los conjuntos de datos humanos.

Privacidad

En sectores como la atención médica y las finanzas, los requisitos de privacidad están haciendo que la escasez de datos sea aún más aguda. Con los datos sintéticos, las empresas pueden construir conjuntos de datos de entrenamiento para sus modelos que contienen datos de nicho sin comprometer la privacidad de los clientes. Sin embargo, como un informe encargado por la Royal Society del Reino Unido ha señalado con respecto a los datos sintéticos en la investigación médica, se asume que los datos sintéticos son “inherentemente privados”. Esta es una “falsa creencia”. Como señalan los investigadores, los datos sintéticos pueden filtrar información sobre los datos de los que se derivan.

En particular, los modelos entrenados en datos sensibles son vulnerables a ataques de inversión de modelos, donde los hackers pueden reconstruir partes de un conjunto de datos original.

Costo

En general, los datos sintéticos se generan a un costo menor que los datos del mundo real. También vienen etiquetados, lo que ahorra tiempo y costo. En algunos proyectos de entrenamiento de inteligencia artificial, hasta el 80% del proyecto se dedica a la preparación de datos, incluida la etiquetado. Esto explica por qué han surgido empresas especializadas en obtener mano de obra a bajo costo para satisfacer las necesidades de procesamiento de datos de los gigantes de Silicon Valley.

Complementar en lugar de reemplazar a los datos reales

Estos beneficios de los datos sintéticos se pueden aprovechar, siempre y cuando no se los trate como un reemplazo de los datos reales. En su lugar, su función debe ser complementar los conjuntos de datos reales, proporcionando formas de aumentar la escala de los puntos de datos disponibles.

Para contextualizar, el próximo LLM de Meta, LLAMA Behemoth, se está entrenando con 30 billones de puntos de datos. Claramente, encontrar datos del mundo real a esta escala es un desafío, si no imposible. Sin embargo, como se ha señalado, utilizar datos del mundo real sigue siendo una necesidad, ya sea para entrenar los modelos que producen datos sintéticos o para sincronizar con los datos sintéticos para garantizar la precisión y evitar el colapso del modelo. A la escala en que los LLM están trabajando ahora, incluso si los datos sintéticos constituyen una proporción significativa de los datos de entrenamiento utilizados, seguirá habiendo una demanda sustancial de datos del mundo real. Y esto significa que seguirán existiendo cuestiones complejas que resolver en torno a la custodia, el acceso, el sesgo, el costo y el tiempo.

Durante más de 13 años, Gediminas Rickevicius ha sido una fuerza de crecimiento en empresas líderes en el mercado de TI, publicidad y logística en todo el mundo. Ha estado cambiando el enfoque tradicional para el desarrollo empresarial y las ventas integrando grandes datos en la toma de decisiones estratégicas. Como Vicepresidente Senior de Asociaciones Globales en Oxylabs, Gediminas continúa su misión de empoderar a las empresas con soluciones de recopilación de datos web públicos de vanguardia.