Myslitelé

Debata o “Nerfování” Claude není o Claude. Je o tom, co se stane, když vaše operace běží na základě rozhodnutí někoho jiného.

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A series of glowing hexagonal glass modules containing microchips in a dark server room; one module on the left is cracked and glowing blue, while others remain intact and glowing amber, connected by flowing data cables.

V počátku tohoto roku publikovala Stella Laurenzo, Senior Director of AI ve společnosti AMD, telemetrii z téměř 7 000 relací Claude Code, které dokumentují něco, co inženýři cítili, ale měli problém to vyjádřit: mezi lednem a březnem se zdánlivá hloubka rozumu snížila o 73 %, počet volání API na úkol se zvýšil osmdesátkrát a model četl mnohem méně souborů, než provedl editaci. Čísla se rychle rozšířila. Interpretace se rozšířila ještě rychleji.

Anthropic popírá interpretaci. Společnost tvrdí, že změny odrážejí úmyslná produktová rozhodnutí, včetně nového adaptivního mechanismu myšlení a přechodu na střední úsilí jako výchozí. Nezávislí analytici také zpochybnili části metodologie. Debata pokračuje a rozumní lidé nesouhlasí s tím, co se skutečně stalo.

Ale zde je část, která záleží, pokud provozujete podnik na základě těchto systémů: zda to byla degradace nebo úmyslné ladění, nemění to, co zažili provozovatelé podniku. Nemohli to předpovědět. Nemohli to ovládat. A někteří z nich to pocítili v produkci, než pochopili, co se děje. To je skutečný příběh a nemá nic společného s Anthropic konkrétně.

To je problém závislosti, ne problém modelu.

Co popisujeme, má název: křehkost modelu. Je to stav, ve kterém jsou kritické operace úzce spojeny s chováním jediného modelu, takže jakékoli změny na úrovni modelu, ať už se jedná o rozhodnutí o ladění, nové výchozí hodnoty, směrování založené na kapacitě nebo tichou degradaci, přímo zasáhnou podnik, bez žádného vyrovnávacího prostoru a bez varování.

To není nový vzorec. GPT-4 prošel touto fází v roce 2023. Claude 3.5 prošel touto fází v roce 2024. Claude Opus prochází touto fází nyní. To se stane znovu s dalším modelovým modelem a tím, který bude následovat. Ne proto, že by některý z dodavatelů jednal v špatné víře, ale protože optimalizace modelu pro náklady, latenci a měřítko na globální úrovni je přesně to, co musí dodavatelé dělat. Jejich pobídky a pobídky podniku, který provozuje produkční operace na jejich základě, jsou související. Není identické. Nikdy nebudou.

Založili jsme Qurrent v roce 2023 a máme historické znalosti, abychom věděli, jak se odvíjejí cykly podnikového softwaru: společnost investuje do umělé inteligence. Demo funguje. Pilotní projekt funguje. Pak se spustí, něco se změní na úrovni modelu a najednou zákazník vlastní problém. Oni jsou ti, kteří udržují pracovní postupy, pronásledují regrese, absorbují narušení. To nikdy nedávalo smysl jako udržitelný model pro podnikové operace.

Podniková verze této příběhu je provozní, ne technická.

Pro vývojáře je současná situace nepříjemná. Rozpočty tokenů se rychle vyčerpávají. Relace kódování se zastavují. Benchmarky zklamávají. To je skutečný problém, ale je to problém, který lze obnovit.

Pro podniky, které provozují finanční operace, workflowy dodržování předpisů, účty pohledávek a závazků a komplexní back-office procesy, jsou sázky jiné. Tyto workflowy nemohou absorbovat špatný týden. Chyby se sčítají. Objem se sčítá. SLA jsou závazky vůči skutečným zákazníkům, ne vnitřním preferencím. Okamžik, kdy model začne podávat horší výkon na vysoce rizikovém procesu, je škoda nahromaděna, zda si to někdo všiml nebo ne.

Co to dělá ještě obtížnějším, je to, že většina společností, které se snažily získat náskok v oblasti umělé inteligence vytvořením interních agentů na základě jediného modelu, nyní zjišťují, jak neúplná byla tato základna. První agent byl snadnou částí. Co nebylo postaveno, byla okolní infrastruktura: evaluační rámce, které detekují behaviorální drift předtím, než dosáhne zákazníka, logika selhání, která automaticky přesměruje práci, když model začne podávat horší výkon, a pokračující správa, která je schopna držet krok s krajinou, která se mění každým čtvrtletím. Tyto tři mezery se nezůstávají říditelné. Rostou do trvalé inženýrské funkce, pro kterou nikdo ne rozpočetoval, obsazené lidmi, jejichž práce je v podstatě držet krok s rozhodnutími učiněnými dodavateli, na které nemají žádný vliv.

To, co skutečná odolnost vypadá v produkci.

V Qurrentu jsme postavili digitální pracovní sílu tak, aby byla od počátku nezávislá na modelu, ne jako marketingovou pozici, ale jako architektonický požadavek. Každá úloha se směruje na nejlepší výkonný model pro tuto úlohu, hodnocenou nepřetržitě. Když je dodán lepší model, zákazníci ho automaticky získají. Když aktuální model regresuje na konkrétním workflow, orchestrace vrstvy přesměruje tuto práci v sekundách, bez lidského zásahu a bez probuzení se uprostřed noci.

Pod tím běžící automatizované simulace proti produkčním workflow měří, zda výstupy odpovídají očekávanému chování. Drift se detekuje na úrovni infrastruktury, předtím, než operativní tým to pocítí, a dlouho předtím, než to pocítí zákazník. A každé rozhodnutí učiněné každým digitálním pracovníkem je protokolováno a přezkoumatelné, plná skleněná krabice, protože nelze řídit to, co nelze vidět.

Toto nejsou prémiové funkce. Jsou to cena vstupu pro běh umělé inteligence v produkci na podnikové úrovni. Většina společností se učí, že uprostřed zpravodajského cyklu, což je drahý způsob, jak to zjistit.

Otázka, která stojí za to položit tento kvartál.

Pokud by model, na kterém závisí vaše operace nejvíce, měl špatný týden příští kvartál, kolik vašich workflow by to pocítilo? Jak byste to věděli? A jak rychle byste mohli to obejít?

Pokud je odpověď na druhou otázku “slyšíme od zákazníka”, operace není produkčně připravená. Je to pilotní projekt běžící v měřítku, a rozlišení má větší význam, než si většina lídrů uvědomí, dokud to nebude.

Současná debata je, v zádech, užitečná. Každý CFO a COO, kteří sledují, co se děje, právě dostal bezplatný náhled na to, co vypadá křehkost modelu pod skutečnou operační zátěží, bez toho, aby za to musel platit. Správná odpověď není přepnout modely. Je postavit operace, které nezávisí na jediném modelu.

Technologie bude pokračovat v změně. To je jediná jistota na tomto trhu. Podniky, které vyjdou z tohoto desetiletí nejsilnější, nebudou ty, které vybraly správný model. Budou to ty, jejichž operace nikdy nemusely dbát.

Colin Wiel, CEO a spoluzakladatel společnosti Qurrent, je zkušený podnikatel, který hluboce pracuje s umělou inteligencí již od 90. let. Mezi jeho předchozí podniky patří Mynd, technologicky vybavená platforma pro investice do rodinných domů, která byla v roce 2020 označena jako nejrychleji rostoucí společnost v oblasti zálivu, a Waypoint Homes, která získala více než 3,5 miliardy dolarů a spravovala 17 000 domů předtím, než byla uvedena na newyorskou burzu cenných papírů (NYSE) v roce 2014. Colin je uznávaný za své inovace v oblasti umělé inteligence, drží několik patentů, získal místo mezi 100 nejvíce inovativními podnikateli Goldman Sachs a byl jmenován podnikatelem roku Ernst & Young.