Thought leaders

De Claude “Nerfing”-Debat Is Niet Over Claude. Het Gaat Over Wat Er Gebeurt Als Uw Operaties Draaien Op Iemands Anders’ Beslissingen.

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

Vroeg dit jaar publiceerde Stella Laurenzo, Senior Director of AI bij AMD, telemetrie van bijna 7.000 Claude Code-sessies waarin iets werd gedocumenteerd dat ingenieurs hadden gevoeld maar moeite hadden om onder woorden te brengen: tussen januari en maart nam de zichtbare redeneringsdiepte met 73% af, API-aanroepen per taak namen met een factor tachtig toe en het model las minder bestanden voordat het bewerkingen uitvoerde. De cijfers verspreidden zich snel. De interpretatie verspreidde zich nog sneller.

Anthropic betwist de framing. Het bedrijf zegt dat de veranderingen het resultaat zijn van bewuste productbeslissingen, waaronder een nieuwe adaptieve denkmethode en een verschuiving naar medium inspanning als standaard. Onafhankelijke analisten hebben ook delen van de methodologie in twijfel getrokken. De discussie is gaande en redelijke mensen zijn het oneens over wat er werkelijk is gebeurd.

Maar hier is het deel dat ertoe doet als u een bedrijf runt op basis van deze systemen: of dit nu een achteruitgang of een bewuste afstelling was, verandert niets aan wat ondernemingsoperatoren hebben meegemaakt. Ze konden het niet voorspellen. Ze konden het niet controleren. En sommigen van hen voelden het in productie voordat ze begrepen wat er gebeurde. Dat is het echte verhaal en het heeft niets te maken met Anthropic in het bijzonder.

Dit Is Een Afhankelijkheidsprobleem, Niet Een Modelprobleem.

Wat we hier beschrijven heeft een naam: modelkwetsbaarheid. Het is de toestand waarin mission-critische operaties nauw verbonden zijn met het gedrag van één model, zodat elke verandering op modelniveau, of het nu een afstellingbeslissing, een nieuwe standaard, een capaciteitsgestuurd routeringsverandering of een stille afkeuring is, het bedrijf rechtstreeks treft, zonder buffer en zonder waarschuwing.

Dit is geen nieuw patroon. GPT-4 ging door een soortgelijke situatie in 2023. Claude 3.5 ging door een soortgelijke situatie in 2024. Claude Opus gaat nu door een soortgelijke situatie. Het zal weer gebeuren met het volgende frontiermodel en het model daarna. Niet omdat een leverancier met slechte bedoelingen handelt, maar omdat het optimaliseren van een frontiermodel voor kosten, latentie en schaal op mondiaal volume precies is wat frontierleveranciers moeten doen. Hun stimulansen en de stimulansen van een onderneming die productieoperaties op hen uitvoert, zijn verwant. Ze zijn niet identiek. Ze zullen nooit identiek zijn.

We zijn Qurrent in 2023 begonnen en hebben de historische kennis om te weten hoe ondernemingssoftwarecycli uitpakken: een bedrijf investeert in AI. De demo werkt. De pilot werkt. Dan gaat het live, iets verandert op modelniveau en plotseling is de klant de eigenaar van het probleem. Ze zijn degene die de workflows onderhoudt, de regressies najagt, de verstoring absorbeert. Dat heeft nooit zin gehad voor mij als een duurzaam model voor ondernemingsoperaties.

De Ondernemingsversie Van Dit Verhaal Is Operationeel, Niet Technisch.

Voor ontwikkelaars is de huidige situatie ongemakkelijk. Tokenbudgets branden sneller op. Codeersessies stagneren. Benchmarks zijn teleurstellend. Dat is een echt probleem, maar het is een herstelbaar probleem.

Voor ondernemingen die financiële operaties, compliance-workflows, accounts receivable en payable en complexe back-officeprocessen uitvoeren, zijn de inzet en de risico’s anders. Deze workflows kunnen geen slechte week absorberen. Fouten accumuleren. Volume accumuleert. SLA’s zijn toezeggingen aan echte klanten, niet interne voorkeuren. Het moment dat een model begint te onderpresteren op een high-stakesproces, begint de schade te accumuleren, of iemand het nu heeft opgemerkt of niet.

Wat dit moeilijker maakt, is dat de meeste bedrijven die probeerden om voorop te lopen met AI door interne agenten op één model te bouwen, nu ontdekken hoe onvolledig die basis was. De eerste agent was het makkelijke deel. Wat niet werd gebouwd, was de omliggende infrastructuur: evaluatiekaders die gedragsafwijking detecteren voordat het een klant bereikt, failoverlogica die werk automatisch omleidt wanneer een model begint te onderpresteren en voortdurende governance die in staat is om gelijke tred te houden met een landschap dat elke kwartaal verandert. Die drie lacunes blijven niet beheersbaar. Ze groeien uit tot een permanente engineeringsfunctie die niemand heeft begroot, bemand door mensen wiens taak het is om bij te blijven met beslissingen die worden genomen door leveranciers waarop ze geen invloed hebben.

Wat Resilientie Echt Lijkt In Productie.

Bij Qurrent hebben we de digitale workforce vanaf het begin modelagnostisch gebouwd, niet als een marketingpositie maar als een architecturale vereiste. Elke taak wordt gerouteerd naar het best presterende model voor die taak, continu geëvalueerd. Wanneer een beter model wordt geleverd, krijgen klanten het automatisch. Wanneer een huidig model regresseert op een specifiek workflow, wordt de orchestratielaag omgeleid in seconden, zonder menselijke tussenkomst en zonder dat iemand wakker wordt voor een Slack-thread om 2 uur ‘s nachts.

Onder dat alles draaien geautomatiseerde simulaties tegen productieworkflows de klok rond, metingen of de uitvoer overeenkomt met het verwachte gedrag. Drift wordt gedetecteerd op het infrastructuurniveau, voordat het operatieteam het voelt en lang voordat een klant het merkt. En elke beslissing die elke digitale werknemer neemt, wordt gelogd en kan worden herzien, een volledig glazen doos, omdat je niets kunt reguleren wat je niet kunt zien.

Dit zijn geen premiumfuncties. Ze zijn de toegangsprijs voor het draaien van AI in productie op ondernemingsniveau. De meeste bedrijven leren dat in het midden van een nieuws cyclus, wat de dure manier is om erachter te komen.

De Vraag Die Waard Is Om Deze Kwartaal Te Stellen.

Als het model waarop uw operaties het meest afhankelijk zijn, een slechte week zou hebben volgend kwartaal, hoeveel van uw workflows zouden dat voelen? Hoe zouden u dat weten? En hoe snel zouden u kunnen omleiden?

Als het antwoord op de tweede vraag is “we zouden het van een klant horen”, dan is de operatie niet productieready. Het is een pilot die op grote schaal draait, en het onderscheid is belangrijker dan de meeste leiders beseffen totdat het niet meer zo is.

De huidige discussie is, op een omweg, nuttig. Elke CFO en COO die dit spektakel gadeslaat, kreeg net een gratis voorbeeld van wat modelkwetsbaarheid eruitziet onder echte operationele last, zonder het zelf te hoeven betalen. De juiste reactie is niet om van model te wisselen. Het is om operaties te bouwen die niet afhankelijk zijn van één model.

Technologie zal blijven veranderen. Dat is de enige zekerheid in deze markt. De ondernemingen die deze decennium het sterkst uitkomen, zullen niet degene zijn die het juiste model hebben gekozen. Ze zullen degene zijn wiens operaties nooit hebben hoeven te zorgen.

Colin Wiel, CEO en mede-oprichter van Qurrent, is een ervaren ondernemer die sinds de jaren 90 diep gewerkt heeft met AI. Colin's eerdere ondernemingen omvatten Mynd, een technologie-gedreven platform voor single-family rental investments dat in 2020 de snelst groeiende Bay Area-bedrijf werd genoemd, en Waypoint Homes, dat meer dan $3,5 miljard ophaalde en 17.000 woningen beheerde voordat het in 2014 naar de beurs ging op de NYSE. Vanwege zijn innovaties op het gebied van AI, heeft Colin meerdere octrooien, een plek op de Top 100 meest innovatieve ondernemers van Goldman Sachs en werd hij door Ernst & Young uitgeroepen tot Ondernemer van het Jaar.