Securitate cibernetică

Simbian Lansează o Benchmark pentru Apărare Cibernetică, Dezvăluind o Lacună Majoră în Capabilitățile de Securitate AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă benchmark lansată de Simbian contestă una dintre cele mai răspândite presupuneri în inteligența artificială: că aceleași modele capabile să găsească vulnerabilități pot și să apere împotriva lor.

Compania a introdus recent Cyber Defense Benchmark, dezvoltat de laboratorul de cercetare Simbian, care evaluează cât de bine performează modelele de limbaj mare (LLM) în scenarii reale de apărare cibernetică. Rezultatele sunt îngrijorătoare. În timp ce sistemele moderne de inteligență artificială sunt din ce în ce mai eficiente în descoperirea și exploatarea slăbiciunilor, ele se confruntă cu dificultăți semnificative atunci când li se cere să identifice și să oprească atacurile active.

Modelele de Frontieră Nu Reușesc să Îndeplinească Baremul Minim pentru Apărare

Benchmark-ul a testat modelele de top, incluzând Claude Opus 4.6, GPT-5, Gemini 3.1 Pro și altele, în medii de întreprindere simulate.

Niciunul dintre modele nu a obținut un punctaj de trecere.

Claude Opus 4.6, cel mai puternic performer în test, a detectat doar o parte a probelor de atac din MITRE ATT&CK tactici, în timp ce multe modele nu au reușit să identifice întregi categorii de activități maligne. Cercetarea academică independentă a confirmat aceste constatări, arătând că chiar și modelele de top se confruntă cu dificultăți în vânătoarea de amenințări deschise, detectând doar o fracțiune mică a evenimentelor maligne în scenarii realiste.

Această lacună evidențiază o limitare critică. Sistemele de inteligență artificială de astăzi pot excela în a răspunde la întrebări structurate sau în a rezolva probleme conținute, dar se confruntă cu dificultăți atunci când li se cere să investigheze lanțuri de atac complexe și în evoluție fără îndrumare.

O Schimbare către o Evaluare Realistă, Bazată pe Agenci

Ceea ce diferențiază acest benchmark este designul său.

În contrast cu testele de securitate cibernetică anterioare, care se bazează pe întrebări cu multiple variante sau seturi de date statice, abordarea Simbian utilizează date reale de telemetrie și plasează modelele într-un buclă de investigație agentică. În loc să li se spună ce să caute, inteligența artificială trebuie să exploreze jurnalele, să formeze ipoteze și să identifice amenințări independent.

Acest lucru reflectă modul în care analiștii de securitate umani operează în centrele reale de operațiuni de securitate.

Benchmark-ul incorporează zeci de tehnici de atac în multiple etape, forțând modelele să conecteze semnalele de-a lungul timpului și sistemelor. Prin mutarea contextului și impunerea unui sistem de scorare determinist, reduce și riscul ca modelele să memoreze pur și simplu modele.

Această schimbare către realism este semnificativă. În dezvoltarea inteligenței artificiale, crearea unui benchmark care reflectă cu acuratețe complexitatea lumii reale este adesea primul pas către rezolvarea problemei în sine.

Crescânda Divergență între Inteligența Artificială Ofensivă și Defensivă

Constatarile confirmă o tendință mai largă care apare în industrie.

Inteligența artificială se îmbunătățește rapid în sarcinile cibernetice ofensive. Studiile recente arată că modelele de frontieră pot executa deja atacuri multietapă în medii simulate și o fac din ce în ce mai mult cu unelte minime. În același timp, capacitățile defensive rămân în urmă.

Acest dezechilibru creează o asimetrie în creștere. Atacatorii pot utiliza automatizarea și scala, în timp ce apărătorii se bazează încă puternic pe expertiza umană și pe uneltele fragmentate. Chiar și atunci când inteligența artificială identifică o vulnerabilitate, ea poate interpreta greșit gravitatea sau nu poate acționa corespunzător, subliniind lacuna dintre detectare și înțelegere.

De Ce Inteligența Artificială „Gata de Folosit” Nu Reușește

Concluzia Simbian nu este că inteligența artificială nu poate apăra sistemele, ci că nu poate face acest lucru singură.

Rezultatele benchmark-ului sugerează că LLM-urile necesită ceea ce compania descrie ca un „harness sofisticat” – o combinație de inteligență externă, fluxuri de lucru structurate și integrare la nivel de sistem – pentru a funcționa eficient în medii de securitate.

Acest lucru se aliniază cu cercetările mai ample care arată că adăugarea de unelte, memorie și context îmbunătățește semnificativ performanța inteligenței artificiale în sarcinile de securitate cibernetică.

În medii de producție, Simbian afirmă că a obținut o acuratețe de detectare semnificativ mai mare prin combinarea modelelor cu aceste straturi suplimentare. Implicația este clară: capacitatea brută a modelului este doar o parte a puzzle-ului.

O Nouă Categorie de Benchmark pentru Securitatea AI

Lansarea Cyber Defense Benchmark marchează un pas important în evaluarea sistemelor de inteligență artificială pentru implementarea în lumea reală.

Prin focalizarea pe vânătoarea de amenințări bazată pe dovezi, mai degrabă decât pe răspunsurile la întrebări, reconfigurează problema de la inteligență la execuție. De asemenea, introduce costul ca factor măsurabil, evidențiind compromisurile dintre performanță și eficiență între modele.

Pe măsură ce inteligența artificială continuă să redefinească securitatea cibernetică, benchmark-urile de acest tip pot deveni unelte esențiale pentru înțelegerea nu numai a ceea ce pot face modelele, ci și a locurilor în care ele eșuează—and de ce.

Pentru moment, concluzia este directă. În ciuda progresului rapid în inteligența artificială, apărarea cibernetică complet autonomă rămâne în afara limitei de atins. Următoarea fază a inovației va depinde probabil mai puțin de construirea unor modele mai mari și mai mult de proiectarea sistemelor care combină inteligența artificială cu inteligența structurată, context și supraveghere umană.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.