AI-modeller och plattformar

Nej, de höll inte tillbaka Claude – det var faktiskt värre

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Låt oss prata om vad som har hänt med Claude, eftersom du förmodligen märkt att något var fel om du har använt den under den senaste månaden.

Under de senaste sex veckorna har Claude-användare förlorat sina sinnen. I början av augusti började klagomål strömma in på Reddit, X och utvecklarforum. Problemen var överallt:

  • Kod som tidigare fungerade perfekt var plötsligt trasig
  • Claude påstod att den gjort ändringar i filer när den inte gjort det
  • Slumpmässiga thailändska eller kinesiska tecken som dyker upp i engelska svar
  • Instruktioner som helt ignorerades
  • Samma prompt gav helt olika kvalitetsnivåer på svaren
  • Claude Code-användare sa att det kändes “lobotomerat” jämfört med tidigare

Klagomålen blev så allvarliga att i slutet av augusti var människor övertygade om att Anthropic hemligen bromsade Claude för att spara pengar. Konspirations teorier var överallt – kanske de minskade kvaliteten under topp timmar, kanske de tyst bytte ut till en billigare modell, kanske detta var avsiktlig försämring för att hantera serverkostnader.

Användare betalade för Claude Pro och fick vad som kändes som Claude Lite. Utvecklare som byggt arbetsflöden runt Claude såg plötsligt sin produktivitet sjunka. Med det sagt var vissa användare inte upplevde några problem alls, vilket gjorde allt mer förvirrande.

Anthropic Medger Till Slut: Ja, Vi Hade Problem

Efter veckor av användarklagomål och växande frustration, Anthropic släppte just en massiv teknisk post-mortem som i princip säger: “Ni hade rätt. Claude var trasig. Här är vad som hände.”

Och svaret är intressant.

Det visade sig att det inte var ett problem. Det var tre helt separata infrastrukturbuggar, alla som slog till samtidigt, och skapade en perfekt storm av AI-försämring. De bromsade inte. De skar inte hörntorn. De hade bara tre olika saker som gick sönder samtidigt på sätt som tog dem sex veckor att fullständigt förstå och fixa.

Låt mig bryta ner exakt vad som gick fel, eftersom detta faktiskt är en hjälpsam titt på hur dessa AI-system kan misslyckas på sätt som ingen förväntar sig.

Trippel-Bugg-Kollapsen: En Tidsaxel Av Kaos

Källa: Anthropic

Bugg #1: Fel Server-Problem

Detta är nästan roligt om du inte var den som upplevde det. Claude Sonnet 4 var utformad för att hantera 200 000 tokenkontexter. Men från och med den 5 augusti, skickades vissa förfrågningar till servrar konfigurerade för 1 miljon tokenkontexter.

Initialt var det bara 0,8% av förfrågningarna som påverkades. Inget stort problem, eller hur? Fel.

Den 29 augusti, en rutinmässig uppdatering av lastbalanseraren förvandlade detta lilla problem till ett stort problem. Plötsligt, under topp, skickades 16% av Sonnet 4-förfrågningarna till fel servrar. Och routningen var “klibbig”. När du väl hamnade på fel väg, fortsatte du att hamna på fel väg.

Påverkan:

  • Ungefär 30% av Claude Code-användare som var aktiva under fönstret hade minst en förfrågan som skickades till fel server
  • Svarstider försämrades för påverkade användare
  • Samma användare upplevde problemet upprepade gånger medan andra hade noll problem

Bugg #2: Slumpmässig Tecken-Generator

Den 25 augusti, distribuerade Anthropic en felkonfiguration till sina TPU-servrar. Resultatet var att Claude började slumpmässigt infoga thailändska och kinesiska tecken i engelska svar.

Tänk dig att be Claude att felsöka din Python-kod och få det här:

def calculate_total(items)

total = 0

for item in items:

總計 += item.price # <- Vad?

return ผลรวม

Detta påverkade:

  • Opus 4.1 och Opus 4: 25-28 augusti
  • Sonnet 4: 25 augusti – 2 september

Den tekniska orsaken var ett token-genereringsfel som tilldelade hög sannolikhet till tecken som inte borde finnas där. Det bröt faktiskt den grundläggande mekanismen för hur Claude väljer nästa ord att säga.

Bugg #3: Den Osynliga Kompilator-Buggen

Detta är det farliga från ett ingenjörsperspektiv. Det fanns en latent bugg i Googles XLA-kompilator som hade legat latent. När Anthropic distribuerade kod för att förbättra token-val på den 25 augusti, utlöste de den av misstag.

Vad denna bugg gjorde var genuint konstigt – den skulle orsaka att Claude oavsiktligt uteslöt den mest sannolika token när den genererade text. Claude visste rätt svaret men var fysiskt förhindrad från att säga det.

Det riktigt förvirrande delen? De hade faktiskt arbetat runt denna bugg i december 2024 utan att inse det. När de “fixade” vad de trodde var roten till problemet i augusti, tog de bort workarounden och släppte ut det riktiga problemet.

Varför Det Toog Sex Veckor Att Fixa

Du undrar kanske: hur kan ett företag som Anthropic, med världsklass-ingenjörer, ta sex veckor på sig att lista ut detta?

Svaret avslöjar hur komplexa dessa system faktiskt är:

1. Sekretesskontroller Blockerade Felsökning

“Våra interna sekretess- och säkerhetskontroller begränsar hur och när ingenjörer kan komma åt användarinteraktioner med Claude, i synnerhet när dessa interaktioner inte rapporteras till oss som feedback.”

De kunde bokstavligen inte se vad som bröt om användare inte uttryckligen rapporterade det med feedback. Bra för sekretess, fruktansvärt för felsökning.

2. Buggarna Dolde Sig

Claude kunde ofta återhämta sig från enskilda misstag, vilket gjorde att försämringen såg ut som normal variation snarare än systematiskt misslyckande. Deras benchmark-tester och utvärderingar fångade inte det eftersom modellen skulle självkorrigera tillräckligt för att klara testerna.

3. Multi-Plattforms-Kaos

Claude körs på AWS Trainium, NVIDIA-GPU:er och Google (GOOGL ) TPUs – tre helt olika hårdvaruplattformar. Varje bugg manifesterade sig annorlunda på varje plattform:

  • AWS Bedrock: 0,18% av Sonnet 4-förfrågningar påverkades under topp
  • Google Vertex AI: Under 0,0004% påverkades
  • Direkt API: Upp till 16% påverkades

Detta gjorde att det såg ut som flera orelaterade problem snarare än tre specifika buggar.

4. Överlappande Symptom

Med tre buggar aktiva samtidigt var symptomen överallt. En användare kunde få thailändska tecken, en annan kunde få försämrade svar, en tredje kunde se perfekt prestanda. Det fanns inget tydligt mönster att följa.

Vad Detta Verkligen Betyder För AI-Tillförlitlighet

Denna saga avslöjar något avgörande om den nuvarande tillståndet för AI-system: de är mycket mer ömtåliga än de verkar.

Vi pratar inte bara om AI-modellen i sig. Vi pratar om:

  • Routnings-infrastruktur som kan skicka förfrågningar till fel plats
  • Hårdvaru-specifika implementationer som beter sig annorlunda
  • Kompilator-buggar som kan ligga latent i månader
  • Lastbalanserare som kan förstora små problem till stora avbrott

En enda felkonfiguration, en enda kompilator-bugg, ett enda routningsfel – och plötsligt glömmer din AI-assistent bort hur man kodar eller börjar prata språk den inte borde.

Är Det Verkligen Fixat?

Anthropic säger att de har löst alla tre problem den 16 september. De har:

  • Fixat routings-logiken
  • Rullat tillbaka de problematiska konfigurationerna
  • Bytt från approximativ till exakt top-k-operationer (med en prestanda-nedgång för noggrannhet)
  • Lagt till kontinuerlig produktionsövervakning

Men användare rapporterar fortfarande problem. Vissa utvecklare hävdar att Claude Code fortfarande känns försämrad jämfört med dess tidigare prestanda. Om detta är:

  • Kvarstående effekter från buggarna
  • Nya problem som inte har identifierats
  • Psykologisk bias efter veckor av problem
  • Eller faktisk fortsatt försämring

…vet vi inte än.

Slutsatsen

Denna situation är en perfekt fallstudie i hur komplexa AI-system kan misslyckas på helt oväntade sätt. Tre separata buggar, alla som utlöses inom veckor från varandra, skapade en uppfattning om massiv kvalitetsförsämring som tog sex veckor att diagnostisera och fixa.

Vi kan ge Anthropic cred för transparensen. Att publicera en detaljerad teknisk post-mortem är mer än de flesta företag skulle göra. Men det visar också hur mycket som kan gå fel under huven på dessa system vi är alltmer beroende av.

För alla som bygger på Claude eller någon LLM: du behöver redundans, validering och reservplaner. Eftersom vi just sett att även de bästa AI-systemen kan ha tre olika problem samtidigt, och det kan ta veckor innan någon förstår vad som faktiskt händer.

Infrastrukturen som stöder dessa AI-modeller är lika viktig som modellerna själva. Och just nu visar den infrastrukturen några allvarliga tillväxtsmärtor.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.