Modele și platforme AI

Nu, ei nu au limitat Claude – a fost de fapt mai rău

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Hai să vorbim despre ce s-a întâmplat cu Claude, pentru că dacă ați folosit-o în ultima lună, probabil ați observat că ceva nu era în regulă.

În ultimele șase săptămâni, utilizatorii Claude au fost pe punctul de a-și pierde mințile. Începând cu începutul lunii august, plângerile au început să curgă pe Reddit, X și forumurile dezvoltatorilor. Problemele erau peste tot:

  • Codul care funcționa perfect a început brusc să nu mai funcționeze
  • Claude afirma că a făcut modificări la fișiere când de fapt nu a făcut-o
  • Caractere thailandeze sau chinezești au apărut aleatoriu în răspunsurile în engleză
  • Instructiunile au fost complet ignorate
  • Aceeași întrebare a primit răspunsuri de calitate foarte diferite
  • Utilizatorii Claude Code au spus că se simțea “lobotomizat” în comparație cu perioada anterioară

Plângerile au devenit atât de grave încât, până la sfârșitul lunii august, oamenii erau convinși că Anthropic reducea intenționat calitatea Claude pentru a economisi bani. Teoriile conspirației erau peste tot – poate că reduceau calitatea în orele de vârf, poate că înlocuiseră secret modelul cu unul mai ieftin, poate că această degradare intenționată era pentru a gestiona costurile serverelor.

Utilizatorii plăteau pentru Claude Pro și primeau ce părea a fi Claude Lite. Dezvoltatorii care construiseră fluxuri de lucru în jurul Claude își vedeau productivitatea scăzută brusc. Cu toate acestea, unii utilizatori nu experimentau nicio problemă, ceea ce făcea totul și mai confuz.

Anthropic Admite în Final: Da, Am Avut Probleme

După săptămâni de plângeri ale utilizatorilor și o frustrare crescândă, Anthropic a publicat o post-mortem tehnică masivă care spune practic: “Ați avut dreptate. Claude era stricat. Iată ce s-a întâmplat.”

Și răspunsul este interesant.

S-a dovedit că nu a fost o singură problemă. Au fost trei buguri de infrastructură complet separate, toate apărând în același timp, creând o furtună perfectă de degradare a IA. Nu au redus calitatea. Nu au făcut colțuri. Au avut doar trei lucruri stricate simultan, în moduri care le-au luat șase săptămâni pentru a le înțelege și repara pe deplin.

Să vă explic exact ce s-a întâmplat, pentru că acesta este de fapt un exemplu util despre cum sistemele de IA pot eșua în moduri pe care nimeni nu le anticipă.

Prăbușirea Triple-Bug: O Cronologie a Haosului

Sursă: Anthropic

Bug #1: Problema Serverului Greșit

Acesta este aproape amuzant dacă nu ați fost cel care a experimentat-o. Claude Sonnet 4 a fost proiectat pentru a gestiona 200.000 de contexte de token. Însă, începând cu 5 august, unele solicitări au fost redirecționate către servere configurate pentru 1 milion de contexte de token.

Inițial, doar 0,8% din solicitări au fost afectate. Nu pare a fi o problemă mare, nu-i așa? Greșit.

La 29 august, o actualizare a echilibratorului de încărcare a transformat această problemă minoră într-o problemă majoră. Brusc, la vârf, 16% din solicitările Sonnet 4 au fost redirecționate către serverele greșite. Și redirecționarea era “lipicioasă”. Odată ce ați fost redirecționat, ați rămas redirecționat.

Impactul:

  • Aproximativ 30% din utilizatorii Claude Code care au fost activi în timpul ferestrei de timp au avut cel puțin o solicitare redirecționată
  • Timpul de răspuns a scăzut pentru utilizatorii afectați
  • Același utilizator a experimentat problema repetat, în timp ce alții nu au avut nicio problemă

Bug #2: Generatorul de Caractere Aleatorii

La 25 august, Anthropic a implementat o configurație greșită pe serverele TPU. Rezultatul a fost că Claude a început să insereze aleatoriu caractere thailandeze și chinezești în răspunsurile în engleză.

Imaginați-vă cerând lui Claude să depaneze codul dvs. Python și primind acest răspuns:

def calculate_total(items):

total = 0

for item in items:

總計 += item.price # <- Ce?

return ผลรวม

Acest lucru a afectat:

  • Opus 4.1 și Opus 4: 25-28 august
  • Sonnet 4: 25 august – 2 septembrie

Cauza tehnică a fost o eroare de generare a tokenului care a atribuit o probabilitate ridicată caracterelor care nu aveau nicio legătură cu contextul.

Bug #3: Bugul Compilatorului Invizibil

Acesta este cel mai înfricoșător din punct de vedere al ingineriei. A existat un bug latent în compilatorul XLA al Google (GOOGL ) care zăcea dormant. Când Anthropic a implementat cod pentru a îmbunătăți selectarea tokenului la 25 august, a declanșat accidental bugul.

Ce a făcut acest bug a fost cu adevărat ciudat – a făcut ca Claude să excludă intenționat tokenul cel mai probabil atunci când genera text. Claude știa răspunsul corect, dar a fost fizic împiedicat să-l spună.

Partea cu adevărat încurcată? Ei au lucrat în jurul acestui bug în decembrie 2024 fără să-și dea seama. Când “au reparat” ceea ce credeau că este cauza principală în august, au eliminat soluția și au lansat problema reală.

De Ce A Durat Șase Săptămâni Pentru A Repara

S-ar putea să vă întrebați: cum poate o companie ca Anthropic, cu ingineri de clasă mondială, să ia șase săptămâni pentru a rezolva această problemă?

Răspunsul revelează cât de complexe sunt aceste sisteme:

1. Controalele de Confidențialitate Au Împiedicat Depanarea

“Controalele noastre interne de confidențialitate și securitate limitează modul și momentul în care inginerii pot accesa interacțiunile utilizatorilor cu Claude, în special atunci când aceste interacțiuni nu sunt raportate către noi ca feedback.”

Literalmente, nu puteau vedea ce se strica, dacă utilizatorii nu raportau explicit cu feedback. Bun pentru confidențialitate, teribil pentru depanare.

2. Bugurile S-au Ascuns

Claude adesea se recupera de la greșeli individuale, făcând ca degradarea să pară o varianță normală și nu o eșuare sistematică. Testele și evaluările lor nu prindeau problema, deoarece modelul se corecta suficient pentru a trece testele.

3. Haos Multi-Platformă

Claude rulează pe AWS Trainium, NVIDIA GPUs și Google TPUs – trei platforme de hardware complet diferite. Fiecare bug s-a manifestat diferit pe fiecare platformă:

  • AWS Bedrock: 0,18% din solicitările Sonnet 4 afectate la vârf
  • Google Vertex AI: Sub 0,0004% afectate
  • API Direct: Până la 16% afectate

Acest lucru a făcut ca problema să pară multiple probleme nelegate.

4. Simptome Suprapuse

Cu trei buguri active simultan, simptomele erau peste tot. Un utilizator putea primi caractere thailandeze, altul putea primi răspunsuri degradate, al treilea putea vedea o performanță perfectă. Nu a existat niciun model clar de urmat.

Ce Înseamnă Acest Lucru Pentru Fiabilitatea IA

Această întreagă saga revelează ceva crucial despre starea actuală a sistemelor de IA: ele sunt mult mai fragile decât par.

Nu vorbim doar despre modelul de IA în sine. Vorbim despre:

  • Infrastructura de routing care poate trimite solicitări în locuri greșite
  • Implementări specifice hardware-ului care se comportă diferit
  • Buguri de compilator care pot rămâne dormante timp de luni
  • Echilibratoare de încărcare care pot amplifica probleme minore în întreruperi majore

O singură configurație greșită, o singură eroare de compilator, o singură eroare de routing – și brusc asistentul dvs. de IA uită cum să codifice sau începe să vorbească limbi pe care nu ar trebui să le vorbească.

Este Reparată Cu Adevărat?

Anthropic spune că a rezolvat toate cele trei probleme până la 16 septembrie. Ei au:

  • Reparat logica de routing
  • Revenit la configurațiile anterioare problematice
  • Trecut de la operațiuni top-k aproximative la exacte (acceptând o lovitură de performanță pentru acuratețe)
  • Adăugat monitorizarea continuă a producției

Dar utilizatorii încă raportează probleme. Unii dezvoltatori susțin că Claude Code încă se simte degradat în comparație cu performanța sa anterioară. Indiferent dacă este:

  • Efecte reziduale ale bugurilor
  • Probleme noi care nu au fost identificate
  • Predispoziție psihologică după săptămâni de probleme
  • Sau degradare continuă reală

…nu știm încă.

Concluzia

Această situație este un studiu de caz perfect despre cum sistemele de IA complexe pot eșua în moduri complet neașteptate. Trei buguri separate, toate declanșate în decurs de săptămâni, au creat o percepție de degradare masivă a calității care a durat șase săptămâni pentru a fi diagnosticată și reparată.

Putem acorda credit lui Anthropic pentru transparență. Publicarea unei post-mortem tehnice detaliate este mai mult decât ar face majoritatea companiilor. Dar arată și cât de mult poate merge prost sub capotă în aceste sisteme pe care le folosim din ce în ce mai mult.

Pentru oricine construiește pe baza Claude sau oricărui model de limbaj mare: aveți nevoie de redundanță, validare și planuri de rezervă. Pentru că, așa cum am văzut, chiar și cele mai bune sisteme de IA pot avea trei probleme simultan, și poate dura săptămâni până când cineva va înțelege ce se întâmplă cu adevărat.

Infrastructura care susține aceste modele de IA este la fel de importantă ca și modelele însele. Și, în acest moment, această infrastructură prezintă dureri de creștere serioase.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.