Μοντέλα και πλατφόρμες AI

Όχι, Δεν Έκαναν Throttling στο Claude – Ήταν Πραγματικά Χειρότερο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Όλα καλά, μιλήστε για αυτό που συνέβη με το Claude, γιατί αν το χρησιμοποιούσατε το τελευταίο μήνα, πιθανότατα να έχετε παρατηρήσει ότι κάτι δεν πήγαινε καλά.

Για έξι εβδομάδες, οι χρήστες του Claude έχουν χάσει την ψυχραιμία τους. Από τις αρχές Αυγούστου, παρατηρήθηκαν καταγγελίες σε Reddit, X και φόρουμ προγραμματιστών. Τα προβλήματα ήταν παντού:

  • Κώδικας που λειτουργούσε τέλεια προηγουμένως, ξαφνικά ήταν κατεστραμμένος
  • Το Claude ισχυριζόταν ότι έκανε αλλαγές σε αρχεία όταν δεν το έκανε
  • Τυχαία ταϊλανδέζικα ή κινεζικά χαρακτήρες εμφανίζονταν σε αγγλικές απαντήσεις
  • Οδηγίες αγνοούνταν πλήρως
  • Η ίδια πρόκληση έδινε εξαιρετικά διαφορετικές απαντήσεις
  • Χρήστες του Claude Code έλεγαν ότι ένιωθαν “λοβοτομημένοι” σε σύγκριση με πριν

Οι καταγγελίες έγιναν τόσο κακές που μέχρι τα τέλη Αυγούστου, οι άνθρωποι πείστηκαν ότι η Anthropic είχε κρυφά μειώσει την απόδοση του Claude για να σώσει χρήματα. Θεωρίες συνωμοσίας ήταν παντού – μπορεί να μειώνουν την ποιότητα κατά τις ώρες αιχμής, μπορεί να είχαν αντικαταστήσει μυστικά ένα φθηνότερο μοντέλο, μπορεί αυτό να ήταν σκόπιμη υποβάθμιση για να διαχειριστούν το κόστος των διακομιστών.

Οι χρήστες πλήρωναν για Claude Pro και έπαιρναν αυτό που ένιωθε σαν Claude Lite. Οι προγραμματιστές που είχαν χτίσει ροές εργασίας γύρω από το Claude βλέπανταν να βυθίζονται στην παραγωγικότητά τους. Με αυτό που ειπώθηκε, κάποιοι χρήστες δεν έβλεπαν κανένα πρόβλημα, το οποίο έκανε mọiTHING πιο μπερδεμένο.

Η Anthropic Ομολογεί Τέλος: Ναι, Έχασε τον Έλεγχο

Μετά από εβδομάδες καταγγελιών χρηστών και αυξανόμενης απογοήτευσης, η Anthropic δημοσίευσε ένα τεράστιο τεχνικό post-mortem που基本ικά λέει: “Σας έπιασα. Το Claude ήταν κατεστραμμένο. Αυτό συνέβη.”

Και η απάντηση είναι ενδιαφέρουσα.

Αποδείχθηκε ότι δεν ήταν ένα πρόβλημα. Ήταν τρία完全 διαφορετικά προβλήματα υποδομής, όλα συμβαίνουν την ίδια στιγμή, δημιουργώντας μια τέλεια θύελλα υποβάθμισης του AI. Δεν έκαναν throttling. Δεν έκοψαν γωνίες. Απλά είχαν τρία διαφορετικά πράγματα που σπάσανε ταυτόχρονα με τρόπους που τους πήραν έξι εβδομάδες για να κατανοήσουν και να διορθώσουν.

Ας σας εξηγήσω genau τι πήγε λάθος, γιατί αυτό είναι πραγματικά ένα χρήσιμο βλέμμα σε πώς αυτά τα συστήματα AI μπορούν να αποτύχουν με τρόπους που κανείς δεν προβλέπει.

Η Τριπλή-Βουβή Καταστροφή: Μια Χρονολογική Αναφορά του Χάους

Πηγή: Anthropic

Σφάλμα #1: Το Λάθος Πρόβλημα του Διακομιστή

Αυτό είναι σχεδόν αστείο αν δεν ήσαστε αυτός που το βίωσε. Το Claude Sonnet 4 σχεδιάστηκε για να χειριστεί 200.000 περιπτώσεις. Από τις 5 Αυγούστου, κάποιες αιτήσεις στάλθηκαν σε διακομιστές που είχαν ρυθμιστεί για 1 εκατομμύριο περιπτώσεις.

Αρχικά, μόνο το 0,8% των αιτήσεων επηρεάστηκαν. Δεν ήταν μεγάλο πρόβλημα, σωστά; Λάθος.

Στις 29 Αυγούστου, μια κανονική ενημέρωση του load balancer μετέτρεψε αυτό το μικρό πρόβλημα σε ένα μεγάλο πρόβλημα. Ξαφνικά, στο peak, το 16% των αιτήσεων του Sonnet 4 πήγαν στον λάθος διακομιστή. Και η διαδρομή ήταν “sticky”. Μόλις σας στάλθηκε στον λάθος διακομιστή, συνέχιζε να σας στέλνει στον λάθος διακομιστή.

Η επίδραση:

  • Περίπου το 30% των χρηστών του Claude Code που ήταν ενεργοί κατά το διάστημα είχαν τουλάχιστον μια αίτηση που στάλθηκε στον λάθος διακομιστή
  • Οι χρόνοι απόκρισης μειώθηκαν δραματικά για τους επηρεαζόμενους χρήστες
  • Ο ίδιος χρήστης θα έβλεπε το πρόβλημα επανειλημμένα ενώ άλλοι δεν θα είχαν κανένα πρόβλημα

Σφάλμα #2: Ο Τυχαίος Γεννήτωρ Χαρακτήρων

Στις 25 Αυγούστου, η Anthropic αναπτύσσει μια λανθασμένη ρύθμιση στους διακομιστές TPU. Το αποτέλεσμα ήταν ότι το Claude άρχισε να εισάγει τυχαία ταϊλανδέζικους και κινεζικούς χαρακτήρες σε αγγλικές απαντήσεις.

Φανταστείτε να ζητήσετε από το Claude να διορθώσει τον κώδικα Python σας και να λάβετε αυτό:

def calculate_total(items):

    total = 0

    for item in items:

        總計 += item.price  # <- Τι;

    return ผลรวม

Αυτό επηρέασε:

  • Opus 4.1 και Opus 4: 25-28 Αυγούστου
  • Sonnet 4: 25 Αυγούστου – 2 Σεπτεμβρίου

Η τεχνική αιτία ήταν ένα σφάλμα γεννήτωρα token που έδωσε υψηλή πιθανότητα σε χαρακτήρες που δεν είχαν κανένα λόγο να υπάρχουν. ΛITERALLY έσπασε τον βασικό μηχανισμό του πώς το Claude επιλέγει την επόμενη λέξη να πει.

Σφάλμα #3: Το Αόρατο Σφάλμα του Compiler

Αυτό είναι το φοβερό από την πλευρά της μηχανικής. Υπήρχε ένα λανθάνων σφάλμα στον compiler XLA της Google (GOOGL ) που είχε μείνει αδρανές. Όταν η Anthropic αναπτύσσει κώδικα για να βελτιώσει την επιλογή token στις 25 Αυγούστου, τυχαία ενεργοποίησε.

Αυτό που έκανε αυτό το σφάλμα ήταν πραγματικά παράξενο – θα προκαλούσε το Claude να αποκλείει ανεπρόσκλητα το πιο πιθανό token όταν γεννούσε κείμενο. Το Claude γνώριζε τη σωστή απάντηση αλλά ήταν φυσικά αποκλεισμένο από το να τη πει.

Το πραγματικά μπερδεμένο μέρος; Έχουν δουλέψει γύρω από αυτό το σφάλμα τον Δεκέμβριο του 2024 χωρίς να το καταλάβουν. Όταν “διόρθωσαν” αυτό που νόμιζαν ότι ήταν η ρίζα του προβλήματος τον Αύγουστο, αφαίρεσαν το γύρω και απελευθέρωσαν το πραγματικό πρόβλημα.

Γιατί Πήρε Έξι Εβδομάδες για να Διορθωθεί

Μπορείτε να αναρωτηθείτε: πώς μια εταιρεία όπως η Anthropic, με εξαιρετικούς μηχανικούς, πήρε έξι εβδομάδες για να καταλάβει αυτό;

Η απάντηση αποκαλύπτει πόσο複잡ες είναι πραγματικά αυτές οι υποδομές:

1. Οι Έλεγχοι Ιδιωτικότητας Εμπόδισαν τον Διορθωτικό

“Οι εσωτερικοί έλεγχοι ιδιωτικότητας και ασφάλειας μας περιορίζουν πώς και πότε οι μηχανικοί μπορούν να έχουν πρόσβαση στις αλληλεπιδράσεις των χρηστών με το Claude, ιδιαίτερα όταν αυτές οι αλληλεπιδράσεις δεν αναφέρονται σε εμάς ως ανατροφοδότηση.”

ΛITERALLY δεν μπορούσαν να δουν τι σπάει trừ khi οι χρήστες το αναφέρουν ρητά με ανατροφοδότηση. Καλό για την ιδιωτικότητα, τρομερό για τον διορθωτικό.

2. Τα Σφάλματα Κρύβονταν

Το Claude συχνά ανακτούσε από ατομικά λάθη, κάνοντας την υποβάθμιση να φαίνεται σαν κανονική διακύμανση και όχι συστηματικό σφάλμα. Οι επιταγές και οι αξιολογήσεις τους δεν το πήγαιναν να πιάνουν γιατί το μοντέλο θα αυτοδιορθωνόταν αρκετά για να περάσει τις δοκιμές.

3. Χάος σε Πολλαπλά Πλαίσια

Το Claude τρέχει σε AWS Trainium, NVIDIA (NVDA ) GPUs και Google TPUs – τρία完全 διαφορετικά υλικά πλαίσια. Κάθε σφάλμα εκφράστηκε διαφορετικά σε κάθε πλαίσιο:

  • AWS Bedrock: 0,18% των αιτήσεων του Sonnet 4 επηρεάστηκαν στο peak
  • Google Vertex AI: Κάτω από 0,0004% επηρεάστηκαν
  • Direct API: μέχρι 16% επηρεάστηκαν

Αυτό έκανε να φαίνεται σαν πολλαπλά μη σχετιζόμενα προβλήματα και όχι τρία συγκεκριμένα σφάλματα.

4. Επικαλυπτόμενες Συμπτώματα

Με τρία σφάλματα ενεργά ταυτόχρονα, τα συμπτώματα ήταν παντού. Ένας χρήστης μπορεί να έπαιρνε ταϊλανδέζικους χαρακτήρες, ένας άλλος μπορεί να έπαιρνε υποβαθμισμένες απαντήσεις, ένας τρίτος μπορεί να έβλεπε τέλεια απόδοση. Δεν υπήρχε κανένα σαφές μοτίβο να ακολουθήσει.

Τι Αυτό Σημαίνει Πραγματικά για την Αξιοπιστία του AI

Αυτή η ολόκληρη ιστορία αποκαλύπτει κάτι κρίσιμο για την τρέχουσα κατάσταση των συστημάτων AI: είναι πολύ πιο εύθραυστα από ότι φαίνονται.

Δεν μιλάμε μόνο για το ίδιο το μοντέλο AI. Μιλάμε για:

  • Υποδομή διαδρομής που μπορεί να στείλει αιτήσεις στον λάθος τόπο
  • Υλοποιήσεις υλικού που συμπεριφέρονται διαφορετικά
  • Σφάλματα compiler που μπορούν να παραμείνουν αδρανή για μήνες
  • Διακομιστές φόρτου που μπορούν να μεγεθύνουν μικρά προβλήματα σε μεγάλα αποτυχία

Ένα λάθος ρύθμιση, ένα σφάλμα compiler, ένα σφάλμα διαδρομής – και ξαφνικά το βοηθό AI σας ξεχνάει πώς να κωδικοποιήσει ή αρχίζει να μιλάει γλώσσες που δεν πρέπει.

Είναι Πραγματικά Διορθωμένο;

Η Anthropic λέει ότι έχει διορθώσει όλα τα τρία προβλήματα από τις 16 Σεπτεμβρίου. Έχουν:

  • Διόρθωσαν τη λογική διαδρομής
  • Πήγαν πίσω στις προβληματικές ρυθμίσεις
  • Άλλαξαν από προσεγγιστικές σε ακριβείς λειτουργίες top-k (παίρνοντας ένα χτύπημα απόδοσης για ακρίβεια)
  • Προσθέσανε συνεχείς παραγωγικές παρακολούθησης

Αλλά οι χρήστες εξακολουθούν να αναφέρουν προβλήματα. Κάποιοι προγραμματιστές ισχυρίζονται ότι το Claude Code εξακολουθεί να feels υποβαθμισμένο σε σύγκριση με την προηγούμενη απόδοση. Είτε:

  • Υπολείψεις από τα σφάλματα
  • Νέα προβλήματα που δεν έχουν αναγνωριστεί
  • Ψυχολογική προκατάληψη μετά από εβδομάδες προβλημάτων
  • Πραγματική συνεχής υποβάθμιση

…δεν ξέρουμε ακόμη.

Η Κύρια Ιδέα

Αυτή η κατάσταση είναι μια ιδανική μελέτη περίπτωσης για το πώς τα σύνθετα συστήματα AI μπορούν να αποτύχουν με τρόπους που κανείς δεν προβλέπει. Τρία ξεχωριστά σφάλματα, όλα ενεργά μέσα σε εβδομάδες, δημιούργησαν μια εντύπωση μεγάλης υποβάθμισης ποιότητας που πήρε έξι εβδομάδες για να διαγνώσει και να διορθώσει.

Μπορούμε να δώσουμε κάποια πίστωση στην Anthropic για τη διαφάνεια. Η δημοσίευση ενός λεπτομερούς τεχνικού post-mortem είναι περισσότερο από ότι θα έκανε η περισσότερη εταιρεία. Αλλά επίσης δείχνει πόσο μπορεί να πάει λάθος κάτω από το καπό αυτών των συστημάτων στα οποία βασίζουμε ολοένα και περισσότερο.

Για όποιον χτίζει πάνω στο Claude ή οποιοδήποτε LLM: χρειάζεστε αναπαραγωγή, επαλήθευση και σχέδια αναπτύξεως. Γιατί όπως μόλις είδαμε, ακόμη και τα καλύτερα συστήματα AI μπορούν να έχουν τρία διαφορετικά προβλήματα ταυτόχρονα, και μπορεί να πάρει εβδομάδες πριν κανείς καταλάβει τι συμβαίνει πραγματικά.

Η υποδομή που υποστηρίζει αυτά τα μοντέλα AI είναι εξίσου σημαντική με τα ίδια τα μοντέλα. Και αυτή τη στιγμή, αυτή η υποδομή δείχνει κάποια σοβαρά προβλήματα.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.