Ηγέτες σκέψης

Η συζήτηση για το “Nerfing” του Claude δεν αφορά το Claude. Αφορά τι συμβαίνει όταν οι λειτουργίες σας βασίζονται σε αποφάσεις κάποιου άλλου.

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

Νωρίτερα αυτό το έτος, η Stella Laurenzo, Senior Director of AI tại AMD, δημοσίευσε τηλεμετρία από σχεδόν 7.000 συνεδρίες Claude Code που τεκμηρίωνε κάτι που οι μηχανικοί είχαν感到 αλλά είχαν δυσκολία να εξηγήσουν: μεταξύ Ιανουαρίου και Μαρτίου, το ορατό βάθος συλλογισμού φαινόταν να μειώνεται κατά 73%, οι κλήσεις API ανά εργασία αυξήθηκαν ογδόντα φορές και το μοντέλο διάβαζε πολύ λιγότερα αρχεία πριν κάνει επεξεργασίες. Τα νούμερα εξαπλώθηκαν γρήγορα. Η ερμηνεία εξαπλώθηκε ακόμη πιο γρήγορα.

Η Anthropic αμφισβητεί το πλαίσιο. Η εταιρεία λέει ότι οι αλλαγές αντανακλούν σκόπιμες αποφάσεις προϊόντος, συμπεριλαμβανομένης μιας νέας προσαρμοστικής μηχανισμού σκέψης και μιας μετατόπισης προς μεσαία προσπάθεια ως προεπιλογή. Ανεξάρτητοι αναλυτές έχουν επίσης αντιταχθεί σε μέρη της μεθοδολογίας. Η συζήτηση είναι σε εξέλιξη και οι λογικοί άνθρωποι διαφωνούν για τι συνέβη πραγματικά.

Αλλά εδώ είναι το μέρος που έχει σημασία αν εκτελείτε μια επιχείρηση πάνω από αυτά τα συστήματα: αν αυτό ήταν υποβάθμιση ή σκόπιμη ρύθμιση δεν αλλάζει τι οι επιχειρηματίες βίωσαν. Δεν μπορούσαν να το προβλέψουν. Δεν μπορούσαν να το ελέγξουν. Και κάποιοι από αυτούς το ένιωσαν στην παραγωγή πριν κατανοήσουν τι συνέβαινε. Αυτή είναι η πραγματική ιστορία και δεν έχει καμία σχέση με την Anthropic ειδικά.

Αυτό είναι ένα πρόβλημα εξάρτησης, όχι πρόβλημα μοντέλου.

Τι περιγράφουμε έχει ένα όνομα: ευσπλαχνία μοντέλου. Είναι η κατάσταση στην οποία κρίσιμες λειτουργίες είναι στενά συνδεδεμένες με τη συμπεριφορά ενός μοντέλου, ώστε οποιαδήποτε αλλαγή στο επίπεδο μοντέλου, είτε是一 Tuning απόφαση, μια νέα προεπιλογή, μια αλλαγή δρομολόγησης που οδηγείται από ικανότητα, ή μια σιωπηλή απώλεια, χτυπά την επιχείρηση απευθείας, χωρίς缓衝 και χωρίς προειδοποίηση.

Αυτό δεν είναι ένα νέο μοτίβο. Το GPT-4 πέρασε από μια έκδοση του το 2023. Το Claude 3.5 πέρασε από μια έκδοση του το 2024. Το Claude Opus περνάει από μια έκδοση τώρα. Θα συμβεί ξανά με το επόμενο μοντέλο και αυτό μετά. Όχι επειδή κάποιος προμηθευτής ενεργεί με κακή πίστη, αλλά επειδή η βελτιστοποίηση ενός μοντέλου για κόστος, καθυστέρηση και κλίμακα σε παγκόσμιο όγκο είναι ακριβώς αυτό που πρέπει να κάνουν οι προμηθευτές. Τα κίνητρα και τα κίνητρα μιας επιχείρησης που εκτελεί λειτουργίες παραγωγής πάνω από αυτά είναι σχετικά. Δεν είναι ταυτόσημα. Ποτέ δεν θα είναι.

Ξεκινήσαμε το Qurrent το 2023 και έχουμε τις ιστορικές γνώσεις για να γνωρίζουμε πώς οι κύκλοι λογισμικού επιχείρησης διαδραματίζονται: μια εταιρεία επενδύει σε AI. Η διαδήλωση δουλεύει. Η πιλότος δουλεύει. Στη συνέχεια, πηγαίνει ζωντανά, κάτι μετατοπίζεται στο επίπεδο μοντέλου και ξαφνικά ο πελάτης κατέχει το πρόβλημα. Είναι αυτοί που διατηρούν τις ροές εργασιών, κυνηγούν τις υποβαθμίσεις, απορροφούν την διαταραχή. Αυτό ποτέ δεν είχε νόημα για μένα ως βιώσιμο μοντέλο για επιχειρηματικές λειτουργίες.

Η εταιρική έκδοση αυτής της ιστορίας είναι λειτουργική, όχι τεχνική.

Για τους dévelopπερα, η τρέχουσα κατάσταση είναι άβολη. Τα προϋπολογισμένα token καίγονται γρηγορότερα. Οι συνεδρίες κωδικοποίησης σταματούν. Τα benchmarks απογοητεύουν. Αυτό είναι ένα πραγματικό πρόβλημα, αλλά είναι ένα ανακτήσιμο.

Για τις επιχειρήσεις που εκτελούν οικονομικές λειτουργίες, ροές συμμόρφωσης, λογαριασμούς που λαμβάνονται και πληρώνονται, και σύνθετες διαδικασίες πίσω από την πόρτα, τα στοιχήματα είναι διαφορετικά. Αυτές οι ροές δεν μπορούν να απορροφήσουν μια κακή εβδομάδα. Οι λάθη συσσωρεύονται. Το όγκο συσσωρεύεται. Οι SLA είναι δεσμεύσεις σε πραγματικούς πελάτες, όχι εσωτερικές προτιμήσεις. Η στιγμή που ένα μοντέλο αρχίζει να υποβαθμίζεται σε μια διαδικασία υψηλών στοιχείων, η ζημία συσσωρεύεται ανεξάρτητα από το αν κάποιος έχει παρατηρήσει ακόμη.

Τι κάνει αυτό πιο δύσκολο είναι ότι οι περισσότερες εταιρείες που προσπάθησαν να προηγηθούν του AI κατασκευάζοντας εσωτερικούς πράκτορες σε ένα μοντέλο ανακαλύπτουν τώρα πώς η βάση ήταν ελλιπής. Ο πρώτος πράκτορας ήταν το εύκολο μέρος. Τι δεν χτίστηκε ήταν η περιβάλλουσα υποδομή: πλαισια που αξιολογούν τη συμπεριφορά πριν φτάσει σε πελάτη, λογική αποτυχίας που ανακατευθύνει το έργο αυτόματα όταν ένα μοντέλο αρχίζει να υποβαθμίζεται, και συνεχής διακυβέρνηση που μπορεί να跟ovat με ένα τοπίο που αλλάζει κάθε τρίμηνο. Αυτά τα τρία κενά δεν παραμένουν διαχειρίσιμα. Μεγαλώνουν σε μια μόνιμη λειτουργία μηχανικής που κανείς δεν προόρισε, από άτομα deren εργασία είναι ουσιαστικά να跟ovat τις αποφάσεις που λαμβάνονται από προμηθευτές που δεν έχουν επίδραση.

Τι πραγματικά μοιάζει η ανθεκτικότητα στην παραγωγή.

Στο Qurrent, κατασκευάσαμε την ψηφιακή εργατική δύναμη να είναι αδιάκριτη από το μοντέλο από την αρχή, όχι ως θέση μάρκετινγκ αλλά ως αρχιτεκτονική απαίτηση. Κάθε εργασία δρομολογείται στο καλύτερο εκτελούμενο μοντέλο για αυτήν την εργασία, αξιολογούμενο συνεχώς. Όταν ένα καλύτερο μοντέλο αποστέλλεται, οι πελάτες το λαμβάνουν αυτόματα. Όταν ένα τρέχον μοντέλο υποβαθμίζεται σε μια συγκεκριμένη ροή εργασίας, το επίπεδο ορχήστρας ανακατευθύνει αυτήν την εργασία σε δευτερόλεπτα, χωρίς ανθρώπινη παρέμβαση και χωρίς κανείς να ξυπνά σε ένα νήμα Slack στις 2 π.μ.

Κάτω από αυτό, αυτόματες προσομοιώσεις τρέχουν ενάντια στις ροές εργασιών παραγωγής σε όλη τη διάρκεια της ημέρας, μετρώντας αν οι εξόδους αντιστοιχούν στην αναμενόμενη συμπεριφορά. Η ολίσθηση ανιχνεύεται στο επίπεδο υποδομής, πριν η ομάδα λειτουργιών το νιώσει και πολύ πριν ένας πελάτης το κάνει. Και κάθε απόφαση που λαμβάνεται από κάθε ψηφιακό εργάτη είναι καταγεγραμμένη και αναθεωρήσιμη, ένα πλήρες γυάλινο κουτί, γιατί δεν μπορείτε να διακυβερνήσετε αυτό που δεν μπορείτε να δείτε.

Αυτά δεν είναι premium χαρακτηριστικά. Είναι το τίμημα εισόδου για την εκτέλεση AI σε παραγωγή σε κλίμακα επιχείρησης. Οι περισσότερες εταιρείες μαθαίνουν ότι στο μέσο ενός κύκλου ειδήσεων, που είναι ο дорогός τρόπος για να το ανακαλύψουν.

Η ερώτηση που αξίζει να ρωτήσετε αυτό το τρίμηνο.

Αν το μοντέλο στις οποίες βασίζονται οι λειτουργίες σας περισσότερο είχε μια κακή εβδομάδα το επόμενο τρίμηνο, πόσες από τις ροές εργασιών σας θα το νιώσουν; Πώς θα το γνωρίζετε; Και πόσο γρήγορα θα μπορούσατε να το ανακατευθύνετε;

Αν η απάντηση στη δεύτερη ερώτηση είναι “θα ακούσουμε από einen πελάτη”, η λειτουργία δεν είναι έτοιμη για παραγωγή. Είναι μια πιλότος που εκτελείται σε κλίμακα, και η διάκριση έχει περισσότερη σημασία από ότι οι περισσότεροι ηγέτες αντιλαμβάνονται μέχρι να μην το κάνουν.

Η τρέχουσα συζήτηση είναι, με έναν ανάποδο τρόπο, χρήσιμη. Κάθε CFO και COO που παρακολουθεί αυτό το σενάριο μόλις έλαβε ένα δωρεάν προεπισκόπηση του τι μοιάζει η ευσπλαχνία μοντέλου υπό πραγματική λειτουργική φόρτωση, χωρίς να το πληρώσει ο ίδιος. Η σωστή απάντηση δεν είναι να αλλάξετε μοντέλα. Είναι να κατασκευάσετε λειτουργίες που δεν εξαρτώνται από ένα μοντέλο.

Η τεχνολογία θα συνεχίσει να αλλάζει. Αυτό είναι το μόνο που είναι βέβαιο σε αυτήν την αγορά. Οι επιχειρήσεις που θα βγουν από αυτήν την δεκαετία πιο ισχυρές δεν θα είναι αυτές που επέλεξαν το σωστό μοντέλο. Θα είναι αυτές οι οποίες οι λειτουργίες τους δεν χρειάζεται να φροντίσουν.

Ο Colin Wiel, CEO και συνιδρυτής της Qurrent, είναι ένας έμπειρος επιχειρηματίας που εργάζεται sâuτά με την τεχνητή νοημοσύνη από τη δεκαετία του 1990. Οι προηγούμενες επιχειρηματικές του δραστηριότητες περιλαμβάνουν τη Mynd, μια τεχνολογικά εξοπλισμένη πλατφόρμα για επενδύσεις σε μονοκατοικίες, που ονομάστηκε η ταχύτερα αναπτυσσόμενη εταιρεία της περιοχής του Κόλπου το 2020, και τη Waypoint Homes, η οποία raised πάνω από 3,5 δισεκατομμύρια δολάρια και διαχειρίστηκε 17.000 σπίτια πριν από το πουlisting στο NYSE το 2014. Αναγνωρισμένος για τις καινοτομίες του στην τεχνητή νοημοσύνη, ο Colin κατέχει πολλά πατέντα, κέρδισε μια θέση στο Top 100 των πιο καινοτόμων επιχειρηματιών της Goldman Sachs και ονομάστηκε Επιχειρηματίας της Χρονιάς από την Ernst & Young.