Líderes de pensamento

AI-First Significa Segurança-Primeiro

mm
Adicione Unite.AI às suas fontes preferidas no Google

Compre uma bicicleta nova para uma criança, e a bicicleta receberá toda a atenção – não o capacete brilhante que a acompanha. Mas os pais apreciam o capacete.

Eu temo que muitos de nós hoje sejam como crianças quando se trata de IA. Estamos focados em como é legal e como podemos ir rápido com ela. Não tanto no que podemos fazer para nos manter seguros enquanto a usamos. É uma pena, porque você não pode ter o benefício de uma coisa sem a outra.

Em resumo, aplicar IA sem planejar cuidadosamente a segurança primeiro não é apenas arriscado. É um caminho reto para fora de um penhasco.

O que Significa Segurança de IA?

A segurança de IA envolve uma série de etapas. Mas talvez o elemento mais importante seja quando tomá-las. Para ser eficaz, a segurança de IA deve ser por design.

Isso significa que consideramos como prevenir danos antes de colocá-la em um teste. Descobrimos como garantir que a IA opere e gere resultados em linha com nossos valores e expectativas sociais primeiro – e não depois de obtermos resultados horríveis.

Projetar para a segurança de IA também inclui pensar em como torná-la robusta, ou capaz de funcionar previsivelmente mesmo em situações adversas. Isso significa tornar a IA transparente, para que as decisões que a IA toma sejam compreensíveis, auditáveis e imparciais.

Mas também inclui dar uma olhada no mundo em que a IA funcionará. Quais salvaguardas institucionais e legais precisamos, especialmente para cumprir com as regulamentações governamentais aplicáveis? E não posso enfatizar o suficiente o componente humano: Qual será o impacto do uso de IA nas pessoas que interagem com ela?

Segurança por design significa incorporar a segurança de IA em todos os nossos processos, fluxos de trabalho e operações antes de digitarmos nossa primeira solicitação.

Os Riscos Superam as Preocupações

Não todos concordam. Quando ouvem “segurança primeiro”, alguns ouvem “dê passos tão cuidadosos e lentos que você fica para trás”. Claro, isso não é o que segurança primeiro significa. Não tem que sufocar a inovação ou retardar o tempo de mercado. E não significa uma corrente interminável de pilotos que nunca escalonam. Pelo contrário.

Isso significa entender os riscos de não projetar segurança na IA. Considere apenas alguns.

  • O Centro de Serviços Financeiros da Deloitte prevê que a GenAI poderia ser responsável por perdas de fraude de US$ 40 bilhões nos EUA sozinho até 2027, a partir de US$ 12,3 bilhões em 2023, um CAGR de 32%.
  • Decisões enviesadas. Casos documentados cuidados médicos enviesados devido à IA que foi treinada em dados enviesados.
  • More decisões ruins que inspiram mais decisões ruins. Pior do que uma decisão inicial ruim estimulada por IA defeituosa, estudos indicam que essas decisões ruins podem se tornar parte de como pensamos e tomamos decisões futuras.
  • Consequências reais. IA que fornece conselhos médicos ruins foi responsável por resultados letais para pacientes. Questões legais resultaram de citar uma alucinação de IA como precedente legal. E erros de software resultantes de uma assistente de IA que forneceu informações erradas contaminaram produtos de empresas e sua reputação e levaram a uma insatisfação generalizada dos usuários.

E as coisas estão prestes a ficar ainda mais interessantes.

A chegada e adaptação rápida de IA agente, IA que pode funcionar de forma autônoma para tomar ações com base em decisões que tomou, aumentará a importância de projetar para a segurança de IA.

Um agente de IA que possa agir em seu nome poderia ser tremendamente útil. Em vez de lhe dizer sobre os melhores voos para uma viagem, ele poderia encontrá-los e reservá-los para você. Se você quiser devolver um produto, o agente de IA de uma empresa poderia não apenas lhe dizer a política de devolução e como arquivar uma devolução, mas também lidar com a transação inteira para você.

Ótimo – desde que o agente não alucine um voo ou lidar mal com suas informações financeiras. Ou obtenha a política de devolução da empresa errada e recuse devoluções válidas.

Não é difícil ver como os riscos atuais de segurança de IA poderiam facilmente se espalhar com uma série de agentes de IA fazendo decisões e agindo, especialmente desde que eles não provavelmente agirão sozinhos. Grande parte do valor real em IA agente virá de equipes de agentes, onde agentes individuais lidam com partes de tarefas e colaboram – agente para agente – para realizar o trabalho.

Então, como você abraça a segurança de IA por design sem prejudicar a inovação e matar seu potencial valor?

Segurança por Design em Ação

Verificações de segurança ad hoc não são a resposta. Mas integrar práticas de segurança em cada fase de uma implementação de IA é.

Comece com os dados. Certifique-se de que os dados sejam rotulados, anotados quando necessário, livres de viés e de alta qualidade. Isso é especialmente verdadeiro para dados de treinamento.

Treine seus modelos com feedback humano, pois o julgamento humano é essencial para moldar o comportamento do modelo. Aprendizado de Reforço com Feedback Humano (RLHF) e outras técnicas semelhantes permitem que os anotadores classifiquem e orientem respostas, ajudando os LLMs a gerar saídas que sejam seguras e alinhadas com os valores humanos.

Em seguida, antes de liberar um modelo, teste-o sob estresse. Equipes vermelhas que tentam provocar comportamento inseguro usando prompts adversários, casos de bordo e tentativas de fuga podem expor vulnerabilidades. Corrigi-los antes que eles cheguem ao público mantém as coisas seguras antes que haja um problema.

Enquanto esse teste garante que seus modelos de IA sejam robustos, continue monitorando-os com um olho em ameaças emergentes e ajustes que possam ser necessários nos modelos.

Da mesma forma, monitore regularmente as fontes de conteúdo e interações digitais em busca de sinais de fraude. Criticamente, use uma abordagem híbrida de IA-humano, permitindo que a automação de IA lide com o enorme volume de dados a ser monitorado e humanos qualificados lidem com revisões para aplicação e garantir precisão.

A aplicação de IA agente requer ainda mais cuidado. Um requisito básico: treine o agente para saber suas limitações. Quando ele encontrar incerteza, dilemas éticos, novas situações ou decisões de alto risco, certifique-se de que ele saiba pedir ajuda.

Além disso, projete a rastreabilidade em seus agentes. Isso é especialmente importante para que suas interações ocorram apenas com usuários verificados, para evitar que atores fraudulentos influenciem as ações de um agente.

Se eles parecerem estar funcionando efetivamente, pode ser tentador soltá-los e deixá-los fazerem seu trabalho. Nossa experiência diz para continuar monitorando-os e as tarefas que eles estão realizando para observar erros ou comportamento inesperado. Use verificações automatizadas e revisão humana.

Na verdade, um elemento essencial da segurança de IA é a participação humana regular. Humanos devem ser intencionalmente envolvidos onde julgamento crítico, empatia ou nuances e ambiguidade estejam envolvidos em uma decisão ou ação.

Novamente, para esclarecer, essas são todas práticas que você constrói na implementação de IA com antecedência, por design. Elas não são o resultado de algo dando errado e então correr para descobrir como minimizar os danos.

Funciona?

Nós temos aplicado uma filosofia de Segurança de IA Primeiro e um quadro de “por design” com nossos clientes em toda a emergência da GenAI e agora na faixa rápida para IA agente. Estamos descobrindo que, contrariamente às preocupações de que isso retardaria as coisas, na verdade ajuda a acelerá-las.

A IA agente tem o potencial de reduzir o custo do suporte ao cliente em 25-50%, por exemplo, enquanto aumenta a satisfação do cliente. Mas isso depende da confiança.

Humanos que usam IA devem confiar nela, e os clientes que interagem com agentes humanos habilitados para IA ou com agentes de IA reais não podem experimentar uma única interação que minaria sua confiança. Uma experiência ruim pode destruir a confiança em uma marca.

Não confiamos no que não é seguro. Então, quando construímos segurança em cada camada da IA que estamos prestes a lançar, podemos fazer isso com confiança. E quando estamos prontos para escaloná-la, podemos fazer isso rapidamente – com confiança.

Embora colocar a Segurança de IA em primeiro lugar na prática possa parecer esmagador, você não está sozinho. Há muitos especialistas para ajudar e parceiros que podem compartilhar o que aprenderam e estão aprendendo para que você possa aproveitar o valor da IA com segurança sem retardá-la.

A IA foi uma corrida emocionante até agora, e à medida que a corrida acelera, eu acho emocionante. Mas também estou feliz por estar usando meu capacete.

Joe Anderson é o Diretor Sênior de Consultoria e Transformação Digital da TaskUs, onde lidera a estratégia de mercado e inovação. Ele se concentra na interseção da IA, experiência do cliente e operações digitais, e lidera a nova prática de consultoria de IA agentic da TaskUs.