Líderes de opinión

El dilema de datos de la IA: privacidad, regulación y el futuro de la IA ética

mm
Añade Unite.AI a tus fuentes preferidas en Google

Las soluciones impulsadas por IA se están adoptando rápidamente en diversas industrias, servicios y productos todos los días. Sin embargo, su eficacia depende enteramente de la calidad de los datos en los que se entrenan, un aspecto a menudo malentendido o pasado por alto en el proceso de creación de conjuntos de datos.

À medida que las autoridades de protección de datos aumentan la vigilancia sobre cómo las tecnologías de IA se alinean con las regulaciones de privacidad y protección de datos, las empresas enfrentan una creciente presión para obtener, anotar y refinar conjuntos de datos de manera compliant y ética.

¿Existe realmente un enfoque ético para construir conjuntos de datos de IA? ¿Cuáles son los mayores desafíos éticos de las empresas y cómo los abordan? ¿Y cómo impactan los marcos legales en evolución en la disponibilidad y el uso de datos de entrenamiento? Exploraremos estas preguntas.

Privacidad de datos y IA

Por su naturaleza, la IA requiere una gran cantidad de datos personales para ejecutar tareas. Esto ha generado preocupaciones sobre la recopilación, almacenamiento y uso de esta información. Muchas leyes en todo el mundo regulan y limitan el uso de datos personales, desde el GDPR y la recientemente introducida Ley de IA en Europa hasta la HIPAA en EE. UU., que regula el acceso a los datos de los pacientes en la industria médica.

Referencia para saber cuán estrictas son las leyes de protección de datos en todo el mundo / DLA Piper

Por ejemplo, catorce estados de EE. UU. tienen actualmente leyes de privacidad de datos integrales, con seis más que entrarán en vigor en 2025 y principios de 2026. La nueva administración ha señalado un cambio en su enfoque de aplicación de la privacidad de los datos a nivel federal. Un enfoque clave es la regulación de la IA, enfatizando el fomento de la innovación en lugar de imponer restricciones. Este cambio incluye la derogación de las órdenes ejecutivas anteriores sobre la IA y la introducción de nuevas directivas para guiar su desarrollo y aplicación.

La legislación de protección de datos está evolucionando en varios países: en Europa, las leyes son más estrictas, mientras que en Asia o África tienden a ser menos rigurosas.

Sin embargo, la información personal identificable (PII) —como imágenes faciales, documentos oficiales como pasaportes, o cualquier otro dato personal sensible— está generalmente restringida en la mayoría de los países en alguna medida. Según la UNCTAD, la recopilación, uso y compartición de información personal a terceros sin notificación o consentimiento de los consumidores es una preocupación importante para la mayoría del mundo. 137 de 194 países tienen regulaciones que garantizan la protección de datos y la privacidad. Como resultado, la mayoría de las empresas globales toman precauciones extensas para evitar el uso de PII para el entrenamiento de modelos, ya que las regulaciones como las de la UE prohíben estrictamente tales prácticas, con excepciones raras en nichos altamente regulados como la aplicación de la ley.

Con el tiempo, las leyes de protección de datos se están volviendo más integrales y se aplican a nivel global. Las empresas adaptan sus prácticas para evitar desafíos legales y cumplir con los requisitos legales y éticos emergentes.

¿Qué métodos utilizan las empresas para obtener datos?

Así, cuando se estudian los problemas de protección de datos para el entrenamiento de modelos, es esencial entender primero de dónde obtienen las empresas estos datos. Hay tres fuentes principales de datos.

  • Recopilación de datos

Este método permite recopilar datos de plataformas de crowdsourcing, acciones de medios y conjuntos de datos de código abierto.

Es importante tener en cuenta que los medios de acciones públicas están sujetos a diferentes acuerdos de licencia. Incluso una licencia de uso comercial a menudo establece explícitamente que el contenido no se puede utilizar para el entrenamiento de modelos. Estas expectativas difieren de plataforma a plataforma y requieren que las empresas confirmen su capacidad para utilizar el contenido de la manera que necesitan.

Incluso cuando las empresas de IA obtienen contenido legalmente, aún pueden enfrentar algunos problemas. El rápido avance del entrenamiento de modelos de IA ha superado con creces los marcos legales, lo que significa que las reglas y regulaciones que rodean los datos de entrenamiento de IA aún están evolucionando. Como resultado, las empresas deben mantenerse informadas sobre los desarrollos legales y revisar cuidadosamente los acuerdos de licencia antes de utilizar contenido de acciones para el entrenamiento de IA.

  • Creación de datos

Uno de los métodos más seguros de preparación de conjuntos de datos implica crear contenido único, como filmar a personas en entornos controlados como estudios o ubicaciones al aire libre. Antes de participar, los individuos firman un formulario de consentimiento para utilizar su PII, especificando qué datos se están recopilando, cómo y dónde se utilizarán, y quién tendrá acceso a ellos. Esto garantiza una protección legal completa y da a las empresas la confianza de que no enfrentarán reclamos de uso ilegal de datos.

El principal inconveniente de este método es su costo, especialmente cuando los datos se crean para casos de borde o proyectos a gran escala. Sin embargo, las grandes empresas y corporaciones están utilizando cada vez más este enfoque por al menos dos razones. En primer lugar, garantiza el cumplimiento total de todos los estándares y regulaciones legales. En segundo lugar, proporciona a las empresas datos completamente personalizados para sus escenarios y necesidades específicas, lo que garantiza la mayor precisión en el entrenamiento de modelos.

  • Generación de datos sintéticos

Utilizar herramientas de software para crear imágenes, texto o videos basados en un escenario determinado. Sin embargo, los datos sintéticos tienen limitaciones: se generan en función de parámetros predefinidos y carecen de la variabilidad natural de los datos reales.

Esta falta puede afectar negativamente a los modelos de IA. Aunque no es relevante para todos los casos y no siempre sucede, es importante recordar el “colapso del modelo” —un punto en el que la confianza excesiva en los datos sintéticos hace que el modelo se degrade, lo que lleva a salidas de baja calidad.

Los datos sintéticos aún pueden ser muy efectivos para tareas básicas, como reconocer patrones generales, identificar objetos o distinguir elementos visuales fundamentales como caras.

Sin embargo, no es la mejor opción cuando una empresa necesita entrenar un modelo desde cero o tratar con escenarios raros o muy específicos.

Las situaciones más reveladoras ocurren en entornos de cabina, como un conductor distraído por un niño, alguien que parece cansado detrás del volante o incluso casos de conducción temeraria. Estos puntos de datos no están comúnmente disponibles en conjuntos de datos públicos —ni deberían estar— ya que involucran a individuos reales en entornos privados. Dado que los modelos de IA dependen de los datos de entrenamiento para generar salidas sintéticas, luchan por representar escenarios que nunca han encontrado con precisión.

Cuando los datos sintéticos fallan, los datos creados —recopilados a través de entornos controlados con actores reales— se convierten en la solución.

Los proveedores de soluciones de datos como Keymakr colocan cámaras en coches, contratan a actores y graban acciones como cuidar a un bebé, beber de una botella o mostrar signos de fatiga. Los actores firman contratos que consienten explícitamente el uso de sus datos para el entrenamiento de IA, garantizando el cumplimiento de las leyes de privacidad.

Responsabilidades en el proceso de creación de conjuntos de datos

Cada participante en el proceso, desde el cliente hasta la empresa de anotación, tiene responsabilidades específicas definidas en su acuerdo. El primer paso es establecer un contrato, que detalla la naturaleza de la relación, incluyendo cláusulas de no divulgación y propiedad intelectual.

Consideremos la primera opción para trabajar con datos, es decir, cuando se crean desde cero. Los derechos de propiedad intelectual establecen que cualquier dato que cree el proveedor pertenece a la empresa que lo contrata, lo que significa que se crea en su nombre. Esto también significa que el proveedor debe garantizar que los datos se obtengan legalmente y de manera adecuada.

Como empresa de soluciones de datos, Keymakr garantiza el cumplimiento de los datos verificando primero la jurisdicción en la que se crean los datos, obteniendo el consentimiento adecuado de todos los individuos involucrados y garantizando que los datos puedan utilizarse legalmente para el entrenamiento de IA.

También es importante tener en cuenta que una vez que los datos se utilizan para el entrenamiento de modelos de IA, se vuelve casi imposible determinar qué datos específicos contribuyeron al modelo porque la IA los combina todos. Entonces, la salida específica no tiende a ser su salida, especialmente cuando se discuten millones de imágenes.

Debido a su rápido desarrollo, este área aún establece pautas claras para la distribución de responsabilidades. Esto es similar a las complejidades que rodean a los coches autónomos, donde las preguntas sobre la responsabilidad —ya sea del conductor, el fabricante o la empresa de software— aún requieren una distribución clara.

En otros casos, cuando un proveedor de anotación recibe un conjunto de datos para anotar, asume que el cliente ha obtenido los datos legalmente. Si hay signos claros de que los datos se han obtenido ilegalmente, el proveedor debe informarlo. Sin embargo, tales casos aparentes son extremadamente raros.

También es importante tener en cuenta que las grandes empresas, corporaciones y marcas que valoran su reputación son muy cuidadosas sobre dónde obtienen sus datos, incluso si no se crearon desde cero sino que se tomaron de otras fuentes legales.

En resumen, la responsabilidad de cada participante en el proceso de trabajo con datos depende del acuerdo. Podrías considerar este proceso como parte de una cadena de “sostenibilidad” más amplia, donde cada participante tiene un papel crucial en el mantenimiento de los estándares legales y éticos.

¿Qué conceptos erróneos existen sobre el desarrollo de IA en el lado del servidor?

Un concepto erróneo importante sobre el desarrollo de IA es que los modelos de IA funcionan de manera similar a los motores de búsqueda, recopilando y agregando información para presentar a los usuarios en función del conocimiento aprendido. Sin embargo, los modelos de IA, especialmente los modelos de lenguaje, a menudo funcionan en función de probabilidades en lugar de un entendimiento genuino. Predicen palabras o términos en función de la probabilidad estadística, utilizando patrones vistos en datos anteriores. La IA no “sabe” nada; extrapola, adivina y ajusta probabilidades.

Además, muchos asumen que el entrenamiento de IA requiere conjuntos de datos enormes, pero mucho de lo que la IA necesita reconocer —como perros, gatos o humanos— ya está bien establecido. El enfoque ahora es mejorar la precisión y refinar los modelos en lugar de reinventar las capacidades de reconocimiento. Gran parte del desarrollo de IA hoy en día gira en torno a cerrar las pequeñas brechas de precisión en lugar de empezar desde cero.

Desafíos éticos y cómo la Ley de IA de la Unión Europea y la mitigación de las regulaciones de EE. UU. impactarán en el mercado global de IA

Cuando se discute la ética y la legalidad de trabajar con datos, también es importante entender claramente qué define la “ética” de la IA.

El mayor desafío ético que enfrentan las empresas hoy en día en la IA es determinar qué se considera inaceptable para que la IA haga o aprenda. Hay un consenso general de que la IA ética debe ayudar en lugar de dañar a los humanos y evitar el engaño. Sin embargo, los sistemas de IA pueden cometer errores o “alucinar”, lo que desafía la determinación de si estos errores califican como desinformación o daño.

La ética de la IA es un debate importante con organizaciones como la UNESCO involucradas —con principios clave que rodean la auditoría y trazabilidad de las salidas.

Los marcos legales que rodean el acceso a los datos y el entrenamiento de IA desempeñan un papel significativo en la configuración del paisaje ético de la IA. Los países con menos restricciones sobre el uso de datos permiten un acceso más fácil a los datos de entrenamiento, mientras que las naciones con leyes de datos más estrictas limitan la disponibilidad de datos para el entrenamiento de IA.

Por ejemplo, Europa, que adoptó la Ley de IA, y EE. UU., que ha revocado muchas regulaciones de IA, ofrecen enfoques contrastantes que indican el panorama global actual.

La Ley de IA de la Unión Europea está teniendo un impacto significativo en las empresas que operan en Europa. Establece un marco regulatorio estricto, lo que hace que sea difícil para las empresas utilizar o desarrollar ciertos modelos de IA. Las empresas deben obtener licencias específicas para trabajar con ciertas tecnologías, y en muchos casos, las regulaciones efectivamente hacen que sea demasiado difícil para las pequeñas empresas cumplir con estas reglas.

Como resultado, algunas startups pueden optar por dejar Europa o evitar operar allí por completo, similar al impacto visto con las regulaciones de criptomonedas. Las empresas más grandes que pueden permitirse la inversión necesaria para cumplir con los requisitos de cumplimiento pueden adaptarse. Sin embargo, la Ley podría impulsar la innovación de IA fuera de Europa hacia mercados como EE. UU. o Israel, donde las regulaciones son menos estrictas.

La decisión de EE. UU. de invertir importantes recursos en el desarrollo de IA con menos restricciones también puede tener desventajas, pero puede invitar a más diversidad en el mercado. Mientras que la Unión Europea se centra en la seguridad y el cumplimiento regulatorio, EE. UU. probablemente fomentará más la toma de riesgos y la experimentación de vanguardia.

Michael Abramov es el fundador y CEO de Introspector, aportando más de 15 años de experiencia en ingeniería de software y sistemas de visión artificial para la construcción de herramientas de etiquetado de nivel empresarial.

Michael comenzó su carrera como ingeniero de software y gerente de I+D, construyendo sistemas de datos escalables y gestionando equipos de ingeniería multifuncionales. Hasta 2025, ha sido el CEO de Keymakr, una empresa de servicios de etiquetado de datos, donde ha sido pionero en flujos de trabajo de humanos en la bucle, sistemas de control de calidad avanzados y herramientas personalizadas para satisfacer las necesidades de datos de visión artificial y autonomía a gran escala.

Tiene una licenciatura en Ciencias de la Computación y una formación en ingeniería y artes creativas, lo que le permite abordar problemas complejos desde una perspectiva multidisciplinaria. Michael se encuentra en la intersección de la innovación tecnológica, el liderazgo de productos estratégicos y el impacto en el mundo real, impulsando hacia adelante la próxima frontera de los sistemas autónomos y la automatización inteligente.