Líderes de opinión
Cómo el sesgo matará tu estrategia de IA/ML y qué hacer al respecto
‘Sesgo’ en modelos de cualquier tipo describe una situación en la que el modelo responde de manera inexacta a las solicitudes o datos de entrada porque no ha sido entrenado con suficientes datos de alta calidad y diversidad para proporcionar una respuesta precisa. Un ejemplo sería la función de desbloqueo de teléfono con reconocimiento facial de Apple, que falló a una tasa significativamente más alta para personas con tonos de piel más oscuros en comparación con tonos más claros. El modelo no había sido entrenado con suficientes imágenes de personas con piel más oscura. Este fue un ejemplo relativamente de bajo riesgo de sesgo, pero es exactamente por lo que el Reglamento de IA de la UE ha establecido requisitos para demostrar la eficacia del modelo (y los controles) antes de llegar al mercado. Los modelos con salidas que impactan situaciones comerciales, financieras, de salud o personales deben ser de confianza, o no se utilizarán.
Abordar el sesgo con datos
Grandes volúmenes de datos de alta calidad
Entre muchas prácticas importantes de gestión de datos, un componente clave para superar y minimizar el sesgo en los modelos de IA/ML es adquirir grandes volúmenes de datos de alta calidad y diversidad. Esto requiere colaboración con múltiples organizaciones que tienen dichos datos. Tradicionalmente, la adquisición de datos y las colaboraciones están desafiantes debido a preocupaciones de privacidad y/o protección de la propiedad intelectual – los datos sensibles no pueden ser enviados al propietario del modelo, y el propietario del modelo no puede arriesgarse a filtrar su propiedad intelectual a un propietario de datos. Un solución común es trabajar con datos sintéticos o mock, que pueden ser útiles pero también tienen limitaciones en comparación con el uso de datos reales y completos. Es aquí donde las tecnologías de mejora de la privacidad (PETs) proporcionan respuestas muy necesarias.
Datos sintéticos: Cercanos, pero no exactos
Los datos sintéticos son generados artificialmente para imitar datos reales. Esto es difícil de hacer, pero se está volviendo ligeramente más fácil con herramientas de IA. Los datos sintéticos de buena calidad deben tener las mismas distancias de características que los datos reales, o no serán útiles. Los datos sintéticos de calidad pueden ser utilizados para aumentar efectivamente la diversidad de los datos de entrenamiento al llenar los vacíos para poblaciones más pequeñas y marginadas, o para poblaciones para las que el proveedor de IA simplemente no tiene suficientes datos. Los datos sintéticos también pueden ser utilizados para abordar casos de borde que podrían ser difíciles de encontrar en volúmenes adecuados en el mundo real. Además, las organizaciones pueden generar un conjunto de datos sintéticos para satisfacer los requisitos de residencia de datos y privacidad que bloquean el acceso a los datos reales. Esto suena genial; sin embargo, los datos sintéticos son solo una parte del rompecabezas, no la solución.
Una de las limitaciones obvias de los datos sintéticos es la desconexión del mundo real. Por ejemplo, los vehículos autónomos entrenados únicamente con datos sintéticos lucharán con condiciones de carretera reales y no previstas. Además, los datos sintéticos heredan el sesgo de los datos del mundo real utilizados para generarlos – lo que básicamente derrota el propósito de nuestra discusión. En conclusión, los datos sintéticos son una opción útil para afinar y abordar casos de borde, pero mejoras significativas en la eficacia del modelo y la minimización del sesgo aún dependen del acceso a datos del mundo real.
Una mejor forma: Datos reales a través de flujos de trabajo habilitados por PETs
Las PETs protegen los datos mientras están en uso. Cuando se trata de modelos de IA/ML, también pueden proteger la propiedad intelectual del modelo que se ejecuta – “dos pájaros de un tiro”. Las soluciones que utilizan PETs proporcionan la opción de entrenar modelos con conjuntos de datos reales y sensibles que no estaban anteriormente accesibles debido a preocupaciones de privacidad y seguridad de datos. Esta desbloqueo de flujos de datos a datos reales es la mejor opción para reducir el sesgo. Pero, ¿cómo funcionaría en realidad?
Por ahora, las opciones principales comienzan con un entorno de computación confidencial. Luego, una integración con una solución de software basada en PETs que la hace lista para usar fuera de la caja mientras aborda los requisitos de gobernanza y seguridad de datos que no están incluidos en un entorno de ejecución de confianza (TEE) estándar. Con esta solución, los modelos y los datos están todos cifrados antes de ser enviados a un entorno de computación seguro. El entorno puede estar alojado en cualquier lugar, lo que es importante al abordar ciertos requisitos de localización de datos. Esto significa que tanto la propiedad intelectual del modelo como la seguridad de los datos de entrada se mantienen durante la computación – ni siquiera el proveedor del entorno de ejecución de confianza tiene acceso a los modelos o datos dentro de él. Los resultados cifrados se envían de regreso para su revisión y los registros están disponibles para su revisión.
Este flujo desbloquea los mejores datos de alta calidad, sin importar dónde estén o quién los tenga, creando un camino hacia la minimización del sesgo y la creación de modelos de alta eficacia en los que podemos confiar. Este flujo es también lo que el Reglamento de IA de la UE describió en sus requisitos para un sandbox regulatorio de IA.
Facilitar el cumplimiento ético y legal
Adquirir datos de alta calidad y reales es difícil. Los requisitos de privacidad y localización de datos limitan inmediatamente los conjuntos de datos a los que pueden acceder las organizaciones. Para que la innovación y el crecimiento ocurran, los datos deben fluir hacia aquellos que pueden extraer valor de ellos.
El Art. 54 del Reglamento de IA de la UE proporciona requisitos para “tipos de modelos de alto riesgo” en términos de lo que debe ser demostrado antes de que puedan ser llevados al mercado. En resumen, los equipos necesitarán utilizar datos del mundo real dentro de un sandbox regulatorio de IA para demostrar una eficacia del modelo y cumplimiento con todos los controles detallados en el Título III, Capítulo 2. Los controles incluyen monitoreo, transparencia, explicabilidad, seguridad de datos, protección de datos, minimización de datos y protección de modelos – piense en DevSecOps + Data Ops.
El primer desafío será encontrar un conjunto de datos del mundo real para utilizar – ya que este es inherentemente un dato sensible para tales tipos de modelos. Sin garantías técnicas, muchas organizaciones pueden dudar en confiar el modelo al proveedor de datos o no estarán autorizadas a hacerlo. Además, la forma en que el acto define un “sandbox regulatorio de IA” es un desafío en sí mismo. Algunos de los requisitos incluyen una garantía de que los datos se eliminen del sistema después de que se haya ejecutado el modelo, así como los controles de gobernanza, aplicación, y reporte para demostrarlo.
Muchas organizaciones han intentado utilizar salas de datos (DCR) y entornos de ejecución de confianza (TEE) fuera de la caja. Pero, por sí solos, estas tecnologías requieren un gran conocimiento y trabajo para operacionalizar y cumplir con los requisitos regulatorios de datos y IA.
Las DCR son más fáciles de usar, pero todavía no son útiles para necesidades de IA/ML más robustas. Los TEE son servidores seguros y aún necesitan una plataforma de colaboración integrada para ser útiles, rápidamente. Esto, sin embargo, identifica una oportunidad para que las plataformas de tecnología de mejora de la privacidad se integren con los TEE para eliminar ese trabajo, trivializando la configuración y el uso de un sandbox regulatorio de IA, y por lo tanto, la adquisición y el uso de datos sensibles.
Al permitir el uso de conjuntos de datos más diversos y completos de manera que preserve la privacidad, estas tecnologías ayudan a garantizar que las prácticas de IA y ML cumplan con los estándares éticos y los requisitos legales relacionados con la privacidad de los datos (por ejemplo, el RGPD y el Reglamento de IA de la UE en Europa). En resumen, mientras que los requisitos a menudo se encuentran con gruñidos y suspiros audibles, estos requisitos simplemente nos guían hacia la construcción de mejores modelos en los que podemos confiar y depender para la toma de decisiones basadas en datos importantes, mientras protegemos la privacidad de los sujetos de datos utilizados para el desarrollo y la personalización del modelo.
en Europa). En resumen, mientras que los requisitos a menudo se encuentran con gruñidos y suspiros audibles, estos requisitos simplemente nos guían hacia la construcción de mejores modelos en los que podemos confiar y depender para la toma de decisiones basadas en datos importantes, mientras protegemos la privacidad de los sujetos de datos utilizados para el desarrollo y la personalización del modelo.












