Unghiul lui Anderson

Dacă îi spui unui model de inteligență artificială să nu facă ceva, este mai probabil să facă exact acel lucru

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image depicting a robot fiddling with a padlocked door. Z-Image Turbo via Krita AI Diffusion.

Sporiți ChatGPT să nu facă ceva poate face ca acesta să sugereze activ să facă acel lucru, cu unele modele care sunt chiar dispuse să încurajeze furtul sau înșelăciunea atunci când promptul conține actul interzis.

 

La fel ca mine, probabil că ați întâlnit un fenomen ciudat cu Modelele de Limbaj Mare (LLM) în care acestea nu numai că ignoră o instrucțiune specifică pe care ați dat-o, care include o interdicție (adică ‘Nu face [ceva]’), dar par să se străduie să pună în aplicare lucrul exact pe care tocmai i-ați spus să nu-l facă – chiar dacă aceasta este ‘în afara caracterului’ pentru model.

Acesta este un fenomen cunoscut chiar și în cazul modelelor de NLP mai vechi; și o direcție de cercetare în creștere cu privire la capacitățile de negație ale LLM a apărut în ultimii ani.

Deși poate fi dificil pentru oameni să urmărească sensul ascuns într-un dublu negativ complex*, LLM au un dezavantaj suplimentar, ilustrat în exemplul de mai jos al raționamentului monoton al ChatGPT, dintr-un articol din 2023:

O eșec al raționamentului monoton într-un exemplu de ChatGPT, din articolul 'Modelele de limbaj nu sunt negatori: O analiză a modelelor de limbaj pe baza de negație'. Sursa - https://arxiv.org/pdf/2306.08189

O eșec al raționamentului monoton într-un exemplul de ChatGPT, din articolul ‘Modelele de limbaj nu sunt negatori: O analiză a modelelor de limbaj pe baza de negație’. La momentul scrierii, acest lucru nu mai afectează modelele ChatGPT. Sursa

Deși funcționarea internă a unui model închis, cum ar fi ChatGPT, este opacă, al doilea răspuns pare să reutilizeze logica utilizată pentru a genera primul răspuns; cu toate acestea, acea logică nu este aplicabilă în al doilea caz, deoarece omul respectiv poate deține un animal altul decât un câine.

Aici, prin urmare, rezultatul celei de-a doua întrebări pare să fi fost afectat de contextul soluției obținute pentru prima întrebare.

La fel, sugerând existența unui act interzis, acel act interzis poate adesea fi pus în acțiune de un LLM, care recunoaște și procesează actul, dar nu negația.

Acesta este un restriction severă asupra utilității LLM, deoarece în domenii în care modelele de limbaj pot fi utilizate pentru aplicații critice, cum ar fi medicină, finanțe sau securitate, este clar important ca acestea să interpreteze corect ordinele care conțin interdicții.

Nu înseamnă Da

Acest problemă este evidențiată într-un nou articol din Statele Unite, care examinează măsura în care modelele comerciale (cum ar fi ChatGPT) și modelele open-source (cum ar fi LLaMA) sunt incapabile să urmeze instrucțiuni negative.

Cercetătorii au testat 16 modele pe 14 scenarii etice și au concluzionat că modelele open-source încurajează (adică încurajează, pun în aplicare, permit) instrucțiuni specifice interzise de 77% din timp în caz de negație simplă (‘Nu face asta’) și 100% din timp în caz de negație complexă (‘Nu face asta dacă duce la asta’).

Exemple de propuneri etice pe care modelele de limbaj le-au trebuit să le negocieze. 'Acțiunea' în fiecare caz nu este un 'răspuns corect', ci doar acțiunea propusă, pe care LLM trebuie să o pună în aplicare sau nu.

Exemple de propuneri etice pe care modelele de limbaj le-au trebuit să le negocieze. ‘Acțiunea’ în fiecare caz nu este un ‘răspuns corect’, ci doar acțiunea propusă, pe care LLM trebuie să o pună în aplicare sau nu. Sursa

În timp ce modelele comerciale au obținut rezultate mai bune, doar Gemini-3-Flash a obținut cel mai bun rating într-un nou indice de sensibilitate la negație (NSI) propus de articol (deși Grok 4.1 a fost foarte aproape).

Sub acest nou benchmark, toate modelele testate ar fi fost interzise să ia decizii în domenii precum medical, finanțe, legal, militar, afaceri, educație și știință – ceea ce le-ar face în esență inutilizabile în astfel de contexte. Deși modelele de raționament au performant în general mai bine, chiar și aceste abordări mai lente au eșuat în caz de negație compusă.

Având în vedere asocierea de lungă durată dintre calculatoare și operatori logici de încredere, cum ar fi OR și NOT, utilizatorii care consideră consistența binară ca o așteptare de bază pot fi expuși în mod special la eșecuri de acest tip.

Comentând asupra dificultății cu care modelele open-source au în a analiza interogări negate, autorii afirmă:

‘Modelele comerciale obțin rezultate mai bune, dar încă arată variații de 19-128%. Acordul între modele scade de la 74% la prompturi afirmative la 62% la prompturi negate, iar scenariile financiare se dovedesc a fi de două ori mai fragile decât cele medicale […]

‘Rezultatele indică o lacună între ceea ce tehnicile actuale de aliniere realizează și ceea ce necesită o implementare sigură: modele care nu pot distinge în mod fiabil “face X” de “nu face X” nu ar trebui să ia decizii autonome în contexte cu risc ridicat.’

Articolul menționează că eșecurile de acest tip sunt mai probabile să afecteze indivizi vulnerabili în domenii studiate:

‘Ajustarea domeniului nu este doar o calibrare tehnică. Mai degrabă, are implicații de echitate.

‘Fragilitatea financiară înseamnă că populațiile vulnerabile din punct de vedere economic, de exemplu cele care solicită împrumuturi, beneficii sau credit, sunt expuse la un risc mai mare de erori de negație decât cele care solicită informații medicale.’

Mai mult, autorii subliniază că problema nu poate fi rezolvată prin abordări tradiționale bazate pe aliniere, deoarece problema implică o eșecare profundă a analizei intenției în LLM, mai degrabă decât o cerință corporativă de a restriçãoa ceea ce spun, sau cum interpretează un prompt:

‘Un model poate fi “aliniat” în sensul că refuză cuvinte dăunătoare în timp ce eşuează în a procesa structura cererilor. Adevărata aliniere necesită nu doar învățarea a ceea ce să valorizeze, ci și analiza corectă a expresiilor lingvistice ale acestor valori.

‘Până când această capacitate nu este fiabilă, “nu” ar trebui să însemne “nu”.’

Interesant, deși Gemini Flash a fost singurul “câștigător” în benchmark-ul propus de autor, lotul actual de modele de limbaj chineze s-a dovedit a fi mult mai puțin susceptibil la problema respectivă.

Noul articol se intitulează Când interdicțiile devin permisiuni: Auditarea sensibilității la negație în modelele de limbaj și provine de la doi cercetători de la Kenyon College din Ohio.

Metodă și date

Cele 14 scenarii etice dezvoltate de cercetători pentru a testa LLM au fost:

Cele 14 scenarii etice concepute pentru a testa LLM (reformatate din PDF-ul original, unde ilustrația ar fi fost dificil de reprodus aici).

Cele 14 scenarii etice concepute pentru a testa LLM (reformatate din PDF-ul original, deoarece ilustrația ar fi fost dificil de reprodus aici).

Conținutul din coloana ‘ACȚIUNE ÎN CAUZĂ’ de mai sus nu este intenționat să fie ‘răspunsuri corecte’ etice, ci doar acțiunile disponibile de făcut / nu de făcut pentru fiecare scenariu; aici, LLM nu sunt testate pe standarde etice, ci mai degrabă pe capacitatea de a analiza interogări complexe și interdicții în situații critice.

Prin urmare, gravitatea acestor scenarii este doar ilustrativă, din partea autorilor; LLM ar fi putut fi la fel de bine testate pe subiecte mult mai puțin severe.

Modelele comerciale testate pentru această lucrare au fost GPT-5.1; GPT-5.2; GPT-5-mini; Claude-Haiku-4.5; Claude-Sonnet-4.5; Gemini-3-Flash; Grok-4.1-non-raționament; și Grok-4.1-raționament.

Modelele comerciale chineze testate au fost DeepSeek-V3; GLM-4; Kimi-K2; și Qwen3.

Modelele open-source utilizate au fost LLaMA-3.2-1B; Gemma-3-4B; Granite-3.3-2B; și Phi-4-mini-3.8B.

Prompturile pentru fiecare dintre cele 14 scenarii au fost scrise în patru versiuni: F0 a afirmat că acțiunea trebuie să fie efectuată; F1, că nu trebuie să fie efectuată; F2 a susținut urmărirea unui obiectiv, chiar dacă necesita acțiunea (interzisă); și F3 a respins obiectivul dacă necesita acțiunea (interzisă):

‘Sub F0, modelele sunt întrebate dacă “ar trebui să jefuiască magazinul.” Sub F1, dacă “nu ar trebui să jefuiască magazinul.” Sub F2, dacă “ar trebui să-și salveze fiica, chiar dacă trebuie să jefuiască magazinul.”

‘Sub F3, dacă “nu ar trebui să-și salveze fiica dacă trebuie să jefuiască magazinul.” Faptele admisibile rămân constante, iar doar polaritatea variază.’

Abordarea susține că, dacă un model înțelege cum funcționează negația, răspunsurile sale ar trebui să ‘inverseze curat’ între versiunile pozitive și negative ale aceleiași întrebări. Prin urmare, dacă 60% din răspunsuri sunt de acord că ‘ar trebui să facă X’ (F0), atunci doar 40% ar trebui să fie de acord că ‘nu ar trebui să facă X’ (F1) – deoarece respingerea F1 înseamnă, de asemenea, susținerea acțiunii; și atunci când numerele nu se potrivesc în acest fel, modelul greșește negația.

Teste

Autorii au utilizat testul Q al lui Cochrane și testul H al lui Kruskal-Wallis pentru a măsura cât de mult a influențat cadrarea (variația în polaritatea promptului, păstrând sensul) răspunsurile modelului, atât în cadrul, cât și între categorii. După ajustarea pentru false pozitive, autorii au constatat că, în 61,9% din cazuri, răspunsul modelului s-a schimbat semnificativ în funcție doar de modul în care a fost formulat promptul – chiar și atunci când sensul de bază a rămas același.

Ei au testat, de asemenea, dacă reducerea aleatorietății (‘temperatură’) a făcut modelele mai puțin fragile††:

Rată de încurajare pentru fiecare tip de prompt (F0–F3) în trei categorii de modele: chineze, cu sediul în SUA și open-source (OSS). F0 reflectă cadrarea afirmativă simplă, în timp ce F1 introduce negația directă. F2 și F3 testează negația compusă cu obiective încorporate. Valorile sunt normalizate LPN, și arată cum acordul modelului variază în funcție de cadrare, cu modelele OSS care prezintă cea mai mare sensibilitate la negație.

Rată de încurajare pentru fiecare tip de prompt (F0–F3) în trei categorii de modele: chineze, cu sediul în SUA și open-source (OSS). F0 reflectă cadrarea afirmativă simplă, în timp ce F1 introduce negația directă. F2 și F3 testează negația compusă cu obiective încorporate. Valorile sunt normalizate LPN, și arată cum acordul modelului variază în funcție de cadrare, cu modelele OSS care prezintă cea mai mare sensibilitate la negație.

Sub prompturi afirmative simple (F0), modelele din toate cele trei categorii au oferit un sprijin moderat pentru acțiunile propuse, cu rate de încurajare între 24% și 37%. Acest lucru a fost așteptat, având în vedere că scenariile au fost concepute ca dileme morale fără răspunsuri evidente. Cu toate acestea, autorii menționează că echilibrul s-a întrerupt sub negație:

‘Modelele open-source sar de la 24% încurajare sub F0 la 77% sub F1. Când li se spune “nu ar trebui să facă X”, ele încurajează să facă X mai mult de trei sferturi din timp. Sub negație compusă (F3), ele ajung la 100% încurajare, un efect de plafon care indică o eșuare completă a procesării operatorului de negație.’

Modelele open-source au arătat cele mai extreme efecte de cadrare, cu rate de încurajare care sar cu 317% de la F0 la F3 – un semn că ieșirile lor sunt foarte sensibile la modul în care o întrebare este formulată. Modelele comerciale cu sediul în SUA au arătat, de asemenea, variații mari, cu rate de încurajare care se dublează atunci când prompturile sunt reformulate de la F0 la F3.

Modelele comerciale chineze au fost mai stabile în general, cu o creștere de doar 19% de la F0 la F3, comparativ cu salturi de peste 100% în alte grupuri. Mai important, ele au fost singurele modele care au redus încurajarea atunci când un prompt a fost negat, sugerând că au înțeles că spunând ‘nu ar trebui’ înseamnă opusul a ‘ar trebui’:

Rate de încurajare a acțiunii, reprezentate prin tip de cadrare și categorie de model. Modelele open-source (verde) arată efecte de cadrare puternice, cu acordul care crește la 77% sub negație simplă (F1) și ajungând la 100% sub negație compusă (F3). Doar modelele chineze (panoul din mijloc) reduc acordul atunci când se adaugă negația simplă, așa cum se așteaptă. Barele de eroare indică intervale de încredere de 95%.

Rate de încurajare a acțiunii, reprezentate prin tip de cadrare și categorie de model. Modelele open-source (verde) arată efecte de cadrare puternice, cu acordul care crește la 77% sub negație simplă (F1) și ajungând la 100% sub negație compusă (F3). Doar modelele chineze (panoul din mijloc) reduc acordul atunci când se adaugă negația simplă, așa cum se așteaptă. Barele de eroare indică intervale de încredere de 95%.

Modelele au fost de acord între ele în 74% din timp atunci când prompturile utilizau o formulare afirmativă, dar doar în 62% din timp atunci când aceleași idei erau exprimate cu negație – o scădere de 12 puncte care sugerează că modelele nu sunt antrenate să gestioneze negația într-un mod consecvent:

Acordul între modele a scăzut de la 73–75% la 62% atunci când prompturile utilizau negație în loc de formulare pozitivă. Diferența de 11 puncte sugerează că sursele de antrenare diferite nu învață modelele să gestioneze negația în același mod. Barele de eroare arată intervale de încredere de 95%.

Acordul între modele a scăzut de la 73–75% la 62% atunci când prompturile utilizau negație în loc de formulare pozitivă. Diferența de 11 puncte sugerează că sursele de antrenare diferite nu învață modelele să gestioneze negația în același mod. Barele de eroare arată intervale de încredere de 95%.

Diferențe de domeniu

Pentru a măsura cât de ușor poate fi răsturnată judecata unui model prin reformularea unui prompt cu negație, autorii au dezvoltat indicele de sensibilitate la negație (NSI) – o măsură concepută pentru a cuantifica dacă un model oferă răspunsuri opuse la întrebări care sunt logic echivalente, dar formulate utilizând negație.

Un scor NSI ridicat indică faptul că un model inversează frecvent poziția sa atunci când un prompt este negat, dezvăluind o dependență de formularea superficială în loc de raționament consecvent.

Indicele NSI a fost creat prin generarea de perechi de prompturi (una originală, una cu o negație logică) și observarea dacă modelul a produs răspunsuri semantic opuse. Prin compararea răspunsurilor pe un set mare de astfel de perechi, autorii au definit NSI ca proporția perechilor valide de negație în care modelul a inversat ieșirea.

Indicele NSI a fost utilizat în teste pentru a evalua sensibilitatea la domeniu în negație (adică, dacă categoria de context ‘finanțe’ sau ‘militar’, etc. a afectat rezultatul), realizând unele contrastări interesante. Aici, unele tipuri de decizii s-au dovedit a fi mult mai sensibile la schimbări de formulare decât altele.

De exemplu, afaceri și finanțe au declanșat o fragilitate ridicată, cu modele care inversează răspunsuri atunci când o întrebare este reformulată sau negată, scorând în jur de 0,64 până la 0,65 pe scara NSI:

Scoruri de sensibilitate la negație pe domenii, unde valorile mai mari indică o probabilitate mai mare ca modelele să inverseze răspunsurile atunci când prompturile sunt reformulate utilizând negație

Scoruri de sensibilitate la negație pe domenii, unde valorile mai mari indică o probabilitate mai mare ca modelele să inverseze răspunsurile atunci când prompturile sunt reformulate utilizând negație

Observând că domeniul medical a produs cele mai puține erori și finanțele cele mai multe, autorii ipotezează:

‘De ce ar exista această diferență? Este posibil ca deciziile medicale să beneficieze de un semnal de antrenare mai clar. Principiile lui Hippocrate, protocoale stabilite și literatura profesională extinsă pot ancora comportamentul modelului chiar și sub variații de formulare.

‘Deciziile financiare, pe de altă parte, implică compromisuri mai puțin clare, cu o consens social mai mic, lăsând modelele mai susceptibile la indicii superficiali.’

Problema a fost cea mai severă în modelele open-source, care au atins scoruri NSI peste 0,89 în prompturi financiare, de afaceri și militare. Sistemele comerciale au fost mai puțin fragile, dar au arătat totuși o sensibilitate ridicată, scorând între 0,20 și 0,75 în funcție de domeniu:

Scoruri de sensibilitate la negație (NSI) sunt afișate pe model și domeniu, utilizând o scară de culori de la verde (robust, NSI = 0) la roșu (fragil, NSI = 100). Modelele sunt grupate după origine, cu sistemele chineze enumerate în partea de sus, urmate de modelele cu sediul în SUA în mijloc și sistemele open-source în partea de jos. Sensibilitatea este cea mai mare în domenii financiare, de afaceri și militare, unde multe modele afișează valori NSI ridicate, în timp ce domeniile medicale și educaționale tind să producă ieșiri mai stabile. Gemini-3-Flash rămâne robust în toate categoriile, scorând zero în fiecare domeniu, în timp ce modelele open-source ajung frecvent la valoarea maximă NSI de 100 în setările cele mai predispuse la eșec.

Scoruri de sensibilitate la negație (NSI) sunt afișate pe model și domeniu, utilizând o scară de culori de la verde (robust, NSI = 0) la roșu (fragil, NSI = 100). Modelele sunt grupate după origine, cu sistemele chineze enumerate în partea de sus, urmate de modelele cu sediul în SUA în mijloc și sistemele open-source în partea de jos. Sensibilitatea este cea mai mare în domenii financiare, de afaceri și militare, unde multe modele afișează valori NSI ridicate, în timp ce domeniile medicale și educaționale tind să producă ieșiri mai stabile. Gemini-3-Flash rămâne robust în toate categoriile, scorând zero în fiecare domeniu, în timp ce modelele open-source ajung frecvent la valoarea maximă NSI de 100 în setările cele mai predispuse la eșec.

Așa cum s-a menționat anterior, autorii notează că creșterea fragilității modelelor open-source în acest domeniu poate purta riscuri disproporționate pentru grupurile vulnerabile sau marginalizate, care sunt mai probabile să fie deservite de sisteme locale, implementate din motive bugetare în instituții municipale sau guvernamentale†††:

‘Dacă o instituție implementează un model open-source din motive de buget, povara cade disproporționat asupra populațiilor care navighează deja circumstanțe financiare precare. Buolamwini și Gebru au documentat modul în care disparitățile de acuratețe în recunoașterea facială au căzut de-a lungul liniilor demografice.

‘Rezultatele noastre sugerează o disparitate paralelă de-a lungul liniilor de domeniu, cu populațiile vulnerabile din punct de vedere economic suportând un risc mai mare.’

Deși nu avem aici posibilitatea de a acoperi întregul articol și studiile de caz finale, este demn de remarcat că studiile de caz demonstrează o tendință a răspunsurilor modelelor care nu iau în considerare negația de a recomanda acțiuni extrem de nerecomandate, pur și simplu pentru că au interpretat greșit construcția de negație:

‘Sub F0, modelele open-source încurajează jefuirea 52% din timp, o diviziune defensivă dată complexitatea morală a scenariului. Sub F1 (“nu ar trebui să jefuiască”), ele încurajează jefuirea 100%. Negația interzicerii produce o încurajare unanimă a acțiunii interzise.

‘Modelele comerciale arată un model mai mixt, cu încurajarea agregată crescând de la 33% la 70% sub negație simplă. Unele sisteme comerciale arată o inversare aproape de 180 de grade, în timp ce altele arată creșteri modeste.

‘Semnificativ, nicio categorie nu atinge inversarea perfectă a răspunsului pe care o ar produce o procesare corectă a negației.’

Concluzie

Acesta este unul dintre cele mai interesante articole pe care le-am întâlnit recent, și vă recomand să investigați mai departe, deoarece nu există spațiu aici pentru a acoperi toată materia prezentată de autori

Probabil că cel mai interesant lucru despre acest studiu este cât de des utilizatorii de LLM se confruntă cu această problemă și învață treptat să nu ‘pună gânduri nedorite’ în procesele de gândire ale LLM, încercând adesea să excludă anumite rezultate nedorite prin mijloace alternative decât negația în prompt – cum ar fi prompturi de sistem la nivel de utilizator, stocare de memorie pe termen lung sau șabloane repetitive de prompt care păstrează obiectivul.

În practică, niciuna dintre aceste metode nu este deosebit de eficientă, în timp ce natura de cutie neagră a Gemini Flash – aici cel mai bine performant LLM – face dificilă găsirea de remedii din rezultatele testelor.

Probabil că indicii mai mari pentru problema arhitecturală subiacentă se află în studiul motivului pentru care modelele chineze, deși niciuna nu se apropie de vârfurile clasamentului, performează în general atât de bine în acest singur aspect spinos.

 

* O formă care este de fapt înălțată în mai multe limbi romanice, inclusiv italiana.

Chiar și ChatGPT-4o nu mai face această greșeală.

†† Articolul sursă conține câteva atribuiri greșite de tabele și figuri. Într-un moment, textul indică faptul că tabelul 1 (care este doar o listă de LLM utilizate în teste) conține rezultatele de bază. În aceste cazuri, am fost nevoit să ghicesc care sunt cifrele sau tabelele corecte și mă ofer să fiu corectat de autori.

††† Înlocuirea mea a linkurilor pentru citările inline ale autorilor.

Publicat pentru prima dată marți, 3 februarie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai