Lideri de opinie
Înseamnă AI-First Siguranță pe Primul Loc

Cumpără unui copil o bicicletă nouă, și bicicleta va primi toată atenția – nu cască shinny care o însoțește. Dar părinții apreciază cască.
Mă tem că mulți dintre noi astăzi suntem mai mult ca copiii atunci când vine vorba de IA. Ne concentrăm pe cât de cool este și cât de repede putem merge cu el. Nu prea ne gândim la ce putem face pentru a rămâne în siguranță în timp ce îl folosim. Este un păcat, pentru că nu poți avea beneficiul unuia fără celălalt.
În mod simplu, aplicarea IA fără a planifica cu atenție siguranța în primul rând nu este doar riscantă. Este o cale directă spre o cădere de pe o stâncă.
Ce Înseamnă Siguranța IA?
Siguranța IA implică o serie de pași. Dar poate cel mai important element este când să îi luăm. Pentru a fi eficientă, siguranța IA trebuie să fie prin design.
Aceasta înseamnă că ne gândim la modul de a preveni prejudiciul înainte de a o lua la o tură de probă. Ne gândim la modul de a ne asigura că IA funcționează și generează rezultate în conformitate cu valorile și așteptările noastre sociale, înainte de a obține rezultate oribile.
Proiectarea pentru siguranța IA include, de asemenea, gândirea la modul de a o face robustă, sau capabilă să funcționeze predictibil chiar și în situații adverse. Înseamnă a face IA transparentă, astfel încât deciziile luate de IA să fie inteligibile, verificabile și imparțiale.
Însă include, de asemenea, examinarea lumii în care IA va funcționa. Ce garduri instituționale și legale avem nevoie, în special pentru a respecta reglementările guvernamentale aplicabile? Și nu pot sublinia suficient componenta umană: Care va fi impactul utilizării IA asupra oamenilor care interacționează cu ea?
Siguranța prin design înseamnă încorporarea siguranței IA în toate procesele, fluxurile de lucru și operațiunile noastre înainte de a scrie prima noastră comandă.
Riscurile Depășesc Îngrijorările
Nu toată lumea este de acord. Când auzi “siguranță pe primul loc”, unii auzi “pași atât de precauți și lenti, încât rămâi în urmă”. Desigur, nu este ceea ce înseamnă siguranță pe primul loc. Nu trebuie să împiedice inovația sau să încetinească timpul de piață. Și nu înseamnă o serie interminabilă de teste care nu se extind niciodată. Dimpotrivă.
Înseamnă a înțelege riscurile de a nu proiecta siguranța în IA. Luați în considerare doar câteva.
- Centrul de Servicii Financiare Deloitte prezice că GenIA ar putea fi responsabilă pentru pierderi din fraude de până la 40 de miliarde de dolari în Statele Unite singure, până în 2027, de la 12,3 miliarde de dolari în 2023, o rată anuală compusă de 32%.
- Decizii părtinitoare. Cazurile documentate îngrijiri medicale părtinitoare datorate IA care a fost antrenată pe date părtinitoare.
- Decizii proaste care inspiră mai multe decizii proaste. Mai rău decât o decizie inițială proastă provocată de IA defectuoasă, studiile indică că aceste decizii proaste pot deveni parte a modului în care gândim și luăm decizii viitoare.
- Consecințe reale. IA care oferă sfaturi medicale proaste a fost responsabilă pentru rezultate mortale ale pacienților. Probleme legale au rezultat din citarea unei halucinații a IA ca precedent legal. Și erorile de software care rezultă din furnizarea de informații inexacte de către un asistent IA au afectat produsele companiei și reputația acesteia și au condus la nemulțumirea generală a utilizatorilor.
Și lucrurile sunt pe cale să devină și mai interesante.
Apariția și adoptarea rapidă a IA agenților, IA care poate funcționa autonom pentru a lua decizii pe baza deciziilor pe care le-a luat, va magnifica importanța proiectării pentru siguranța IA.
Un agent IA care poate acționa în numele dvs. poate fi extrem de util. În loc să vă spună despre cele mai bune zboruri pentru o călătorie, el poate găsi și rezerva zborurile pentru dvs. Dacă doriți să returnați un produs, agentul IA al unei companii poate nu numai să vă spună despre politica de returnare și cum să depuneți o cerere de returnare, ci și să gestioneze întreaga tranzacție pentru dvs.
Minunat – atâta timp cât agentul nu halucinează un zbor sau nu manipulează informațiile financiare. Sau nu greșește politica de returnare a companiei și nu refuză returnările valabile.
Nu este prea dificil să vedem cum riscurile actuale de siguranță a IA ar putea ușor cascade cu o serie de agenți IA care iau decizii și acționează, în special având în vedere că nu vor acționa probabil singuri. Mult din valoarea reală a IA agenților va veni din echipe de agenți, unde agenții individuali gestionează părți ale sarcinilor și colaborează – agent cu agent – pentru a finaliza lucrul.
Deci, cum puteți adopta siguranța IA prin design fără a împiedica inovația și a ucide potențialul său valoros?
Siguranța prin Design în Acțiune
Verificările de siguranță ad-hoc nu sunt răspunsul. Însă integrarea practicilor de siguranță în fiecare fază a implementării IA este.
Începeți cu datele. Asigurați-vă că datele sunt etichetate, annotate unde este necesar, lipsite de prejudecăți și de calitate ridicată. Acest lucru este valabil în special pentru datele de antrenament.
Antrenați-vă modelele cu feedback uman, deoarece judecata umană este esențială pentru a modela comportamentul modelului. Învățarea prin întărire cu feedback uman (RLHF) și alte tehnici similare permit annotatorilor să evalueze și să ghideze răspunsurile, ajutând LLM-urile să genereze ieșiri care sunt sigure și aliniate cu valorile umane.
Apoi, înainte de a lansa un model, testați-l sub stres. Echipele roșii care încearcă să provoace un comportament nesigur prin intermediul unor prompturi adverse, cazuri limită și încercări de evadare pot expune vulnerabilități. Remediarea lor înainte de a ajunge la publicul larg menține lucrurile în siguranță înainte de a apărea o problemă.
În timp ce acest test asigură că modelele dvs. de IA sunt robuste, continuați să le monitorizați cu ochiul pe amenințările emergente și ajustările care ar putea fi necesare pentru modele.
În același mod, monitorizați în mod regulat sursele de conținut și interacțiunile digitale pentru semne de fraudă. În mod critic, utilizați o abordare hibridă IA-umană, permițând automatizării IA să se ocupe de volumul enorm de date care trebuie monitorizate, iar oamenilor calificați să se ocupe de revizuiri pentru aplicare și asigurarea acurateței.
Apliarea IA agenților necesită și mai multă atenție. O cerință de bază: antrenați agentul să-și cunoască limitele. Când întâmpină incertitudine, dileme etice, situații noi sau decizii cu risc ridicat, asigurați-vă că știe să ceară ajutor.
De asemenea, proiectați urmărirea în agenții dvs. Acest lucru este deosebit de important, astfel încât interacțiunile sale să aibă loc numai cu utilizatori verificați, pentru a evita ca actori frauduloși să influențeze acțiunile unui agent.
Dacă pare că funcționează eficient, ar putea fi tentant să-i lăsați să-și facă treaba. Experiența noastră spune să continuați să-i monitorizați pe agenți și sarcinile pe care le îndeplinesc pentru a urmări erorile sau comportamentul neașteptat. Utilizați atât verificări automate, cât și revizuiri umane.
De fapt, un element esențial al siguranței IA este implicarea regulată a oamenilor. Oamenii ar trebui să fie implicați intenționat acolo unde sunt implicate judecata critică, empatia sau nuanța și ambiguitatea într-o decizie sau acțiune.
Din nou, pentru a fi clar, acestea sunt toate practici pe care le construiți în implementarea IA în avans, prin design. Nu sunt rezultatul unui lucru care a mers prost și apoi a alergat să figureze cum să minimizeze daunele.
Funcționează?
Am aplicat o filozofie de siguranță IA pe primul loc și un cadru “prin design” cu clienții noștri pe tot parcursul apariției GenIA și acum pe calea rapidă spre IA agenților. Găsim că, contrar îngrijorărilor cu privire la faptul că încetinește lucrurile, de fapt ajută la accelerarea lor.
IA agenților are potențialul de a reduce costul suportului clienților cu 25-50%, de exemplu, în timp ce crește satisfacția clienților. Dar depinde de încredere.
Oamenii care folosesc IA trebuie să o încredințeze, iar clienții care interacționează cu agenții umani IA sau cu agenții IA reali nu pot experimenta o singură interacțiune care ar submina încrederea lor. O experiență proastă poate șterge încrederea într-o marcă.
Nu încredem ceea ce nu este sigur. Deci, atunci când construim siguranța în fiecare strat al IA pe care suntem pe cale să o lansăm, putem face acest lucru cu încredere. Și atunci când suntem gata să o extindem, putem face acest lucru rapid – cu încredere.
În timp ce punerea în practică a siguranței IA pe primul loc poate părea copleșitoare, nu sunteți singuri. Sunt mulți experți care pot ajuta și parteneri care pot împărtăși ceea ce au învățat și sunt în curs de învățare, astfel încât puteți profita de valoarea IA în siguranță, fără a vă încetini.
IA a fost până acum o călătorie interesantă, și pe măsură ce călătoria se accelerează, o găsesc captivantă. Dar sunt și bucuros că port cască.












