Ciberseguridad

CÃģmo proteger los datos de entrenamiento de IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

La inteligencia artificial (IA) necesita datos y muchos de ellos. Recopilar la informaciÃģn necesaria no siempre es un desafío en el entorno actual, con muchos conjuntos de datos pÚblicos disponibles y tanta informaciÃģn generada todos los días. Sin embargo, protegerlos es otro asunto.

El gran tamaÃąo de los conjuntos de datos de entrenamiento de IA y el impacto de los modelos de IA atraen la atenciÃģn de los ciberdelincuentes. A medida que aumenta la dependencia de la IA, los equipos que desarrollan esta tecnología deben tener cuidado para asegurarse de que mantengan sus datos de entrenamiento a salvo.

Por quÃĐ los datos de entrenamiento de IA necesitan una mejor seguridad

Los datos que utiliza para entrenar un modelo de IA pueden reflejar personas, empresas o eventos del mundo real. Como tal, puede estar manejando una cantidad considerable de informaciÃģn personal identificable (PII), lo que causaría violaciones de privacidad significativas si se expusiera. En 2023, Microsoft (MSFT ) sufriÃģ un incidente de este tipo, exponiendo accidentalmente 38 terabytes de informaciÃģn privada durante un proyecto de investigaciÃģn de IA.

Los conjuntos de datos de entrenamiento de IA tambiÃĐn pueden ser vulnerables a ataques adversarios mÃĄs daÃąinos. Los ciberdelincuentes pueden alterar la confiabilidad de un modelo de aprendizaje automÃĄtico manipulando sus datos de entrenamiento si pueden obtener acceso a ellos. Es un tipo de ataque conocido como envenenamiento de datos, y los desarrolladores de IA pueden no notar los efectos hasta que sea demasiado tarde.

La investigaciÃģn muestra que envenenar solo el 0,001% de un conjunto de datos es suficiente para corromper un modelo de IA. Sin las protecciones adecuadas, un ataque como este podría tener implicaciones graves una vez que el modelo se implemente en el mundo real. Por ejemplo, un algoritmo de conducciÃģn autÃģnoma corrupto puede no detectar peatones. Alternativamente, una herramienta de IA para escanear currículos puede producir resultados sesgados.

En circunstancias menos graves, los atacantes podrían robar informaciÃģn confidencial de un conjunto de datos de entrenamiento en un acto de espionaje industrial. TambiÃĐn podrían bloquear a los usuarios autorizados para que no puedan acceder a la base de datos y exigir un rescate.

A medida que la IA se vuelve cada vez mÃĄs importante en la vida y los negocios, los ciberdelincuentes pueden obtener mÃĄs beneficios al atacar las bases de datos de entrenamiento. Todos estos riesgos, a su vez, se vuelven aÚn mÃĄs preocupantes.

5 pasos para proteger los datos de entrenamiento de IA

En vista de estas amenazas, es importante tomar la seguridad en serio al entrenar modelos de IA. Aquí hay cinco pasos para seguir y proteger sus datos de entrenamiento de IA.

1. Minimizar la informaciÃģn sensible en los conjuntos de datos de entrenamiento

Una de las medidas mÃĄs importantes es eliminar la cantidad de detalles sensibles en su conjunto de datos de entrenamiento. Cuanto menos informaciÃģn personal identificable (PII) o otra informaciÃģn valiosa haya en su base de datos, menos serÃĄ el objetivo de los hackers. Una violaciÃģn tambiÃĐn serÃĄ menos impactante si ocurre en estos escenarios.

Los modelos de IA a menudo no necesitan utilizar informaciÃģn del mundo real durante la fase de entrenamiento. Los datos sintÃĐticos son una alternativa valiosa. Los modelos entrenados con datos sintÃĐticos pueden ser tan precisos o incluso mÃĄs precisos que otros, así que no tiene que preocuparse por problemas de rendimiento. Solo asegÚrese de que el conjunto de datos generado se parezca y se comporte como los datos del mundo real.

Alternativamente, puede limpiar los conjuntos de datos existentes de detalles sensibles como nombres de personas, direcciones y informaciÃģn financiera. Cuando estos factores sean necesarios para su modelo, considere reemplazarlos con datos ficticios o intercambiarlos entre registros.

2. Restringir el acceso a los datos de entrenamiento

Una vez que haya compilado su conjunto de datos de entrenamiento, debe restringir el acceso a ÃĐl. Siga el principio de privilegios mínimos, que establece que cualquier usuario o programa solo debe poder acceder a lo que es necesario para completar su trabajo correctamente. Nadie que no estÃĐ involucrado en el proceso de entrenamiento necesita ver o interactuar con la base de datos.

Recuerde que las restricciones de privilegios solo son efectivas si tambiÃĐn implementa una forma confiable de verificar a los usuarios. Un nombre de usuario y una contraseÃąa no son suficientes. La autenticaciÃģn de mÚltiples factores (MFA) es esencial, ya que detiene del 80% al 90% de todos los ataques contra las cuentas, pero no todos los mÃĐtodos de MFA son iguales. La MFA basada en texto y aplicaciÃģn es generalmente mÃĄs segura que las alternativas basadas en correo electrÃģnico.

AsegÚrese de restringir el software y los dispositivos, no solo a los usuarios. Las Únicas herramientas con acceso a la base de datos de entrenamiento deben ser el modelo de IA en sí y cualquier programa que utilice para administrar estas perspectivas durante el entrenamiento.

3. Cifrar y respaldar los datos

El cifrado es otra medida de protecciÃģn crucial. Si bien no todos los algoritmos de aprendizaje automÃĄtico pueden entrenarse activamente con datos cifrados, puede cifrar y descifrar durante el anÃĄlisis. Luego, puede volver a cifrar una vez que haya terminado. Alternativamente, busque estructuras de modelo que puedan analizar la informaciÃģn mientras estÃĄ cifrada.

Mantener copias de seguridad de sus datos de entrenamiento en caso de que algo les suceda es importante. Las copias de seguridad deben estar en una ubicaciÃģn diferente a la copia principal. Dependiendo de lo crítico que sea su conjunto de datos, es posible que deba mantener una copia de seguridad fuera de línea y otra en la nube. Recuerde cifrar todas las copias de seguridad tambiÃĐn.

Al considerar el cifrado, elija su mÃĐtodo con cuidado. Los estÃĄndares mÃĄs altos siempre son preferibles, pero tambiÃĐn puede considerar algoritmos de criptografía resistentes a los ataques cuÃĄnticos a medida que aumenta la amenaza de los ataques cuÃĄnticos.

4. Monitorear el acceso y el uso

Incluso si sigue estos otros pasos, los ciberdelincuentes pueden romper sus defensas. En consecuencia, debe monitorear continuamente los patrones de acceso y uso de sus datos de entrenamiento de IA.

Una soluciÃģn de monitoreo automatizada es probablemente necesaria aquí, ya que pocas organizaciones tienen los niveles de personal para vigilar la actividad sospechosa las 24 horas del día. La automatizaciÃģn tambiÃĐn es mucho mÃĄs rÃĄpida para actuar cuando algo inusual ocurre, lo que lleva a costos de violaciÃģn de datos $2.22 mÃĄs bajos en promedio debido a respuestas mÃĄs rÃĄpidas y efectivas.

Registre cada vez que alguien o algo acceda al conjunto de datos, solicite acceso a ÃĐl, lo modifique o interactÚe con ÃĐl de alguna otra manera. AdemÃĄs de vigilar posibles violaciones en esta actividad, revise regularmente las tendencias generales. El comportamiento de los usuarios autorizados puede cambiar con el tiempo, lo que puede requerir un cambio en los permisos de acceso o la biometría del comportamiento si utiliza dicho sistema.

5. Reevaluar regularmente los riesgos

De manera similar, los equipos de desarrollo de IA deben darse cuenta de que la ciberseguridad es un proceso continuo, no una soluciÃģn de un solo uso. Los mÃĐtodos de ataque evolucionan rÃĄpidamente: algunas vulnerabilidades y amenazas pueden pasar por alto antes de que se note. La Única forma de mantenerse a salvo es reevaluar su postura de seguridad regularmente.

Al menos una vez al aÃąo, revise su modelo de IA, sus datos de entrenamiento y cualquier incidente de seguridad que haya afectado a cualquiera de los dos. Audite el conjunto de datos y el algoritmo para asegurarse de que estÃĐn funcionando correctamente y de que no haya datos envenenados, engaÃąosos o daÃąinos presentes. Ajuste sus controles de seguridad segÚn sea necesario para cualquier cosa inusual que note.

Las pruebas de penetraciÃģn, donde los expertos en seguridad prueban sus defensas intentando superarlas, tambiÃĐn son beneficiosas. Todos menos el 17% de los profesionales de ciberseguridad realizan pruebas de penetraciÃģn al menos una vez al aÃąo, y el 72% de los que lo hacen dicen que cree que ha detenido una violaciÃģn en su organizaciÃģn.

La ciberseguridad es clave para el desarrollo seguro de IA

El desarrollo ÃĐtico y seguro de IA se estÃĄ volviendo cada vez mÃĄs importante a medida que crecen las preocupaciones potenciales sobre la dependencia del aprendizaje automÃĄtico. Proteger su base de datos de entrenamiento es un paso crítico para satisfacer esa demanda.

Los datos de entrenamiento de IA son demasiado valiosos y vulnerables para ignorar los riesgos cibernÃĐticos. Siga estos cinco pasos hoy para mantener su modelo y su conjunto de datos a salvo.

Zac Amos es un escritor de tecnología que se enfoca en inteligencia artificial. TambiÃĐn es el editor de características en ReHack, donde puedes leer mÃĄs de su trabajo.