Rozhovory
Nikunj Bajaj, spoluzakladatel a CEO TrueFoundry – rozhovorová série

Pracoval jste napříč výzkumem strojového učení, produkční umělou inteligencí ve Facebooku a velkými doporučeními systémů, než jste založil TrueFoundry — co zkušenosti vás nejvíce přiměly k budování podnikové infrastruktury pro umělou inteligenci, a jaký bolestivý problém jste cítil, že nebyl řešen v té době?
V Meta jsme považovali strojové učení za speciální případ softwaru a GenAI jako speciální případ strojového učení, což vedlo k vertikálnímu stacku se softwarem na dně, strojovým učením uprostřed a GenAI na vrcholu. V tomto nastavení, pokud jsem vývojář strojového učení, modely, které buduji, následují stejný vzor nasazení jako zbytek softwaru, což činí škálování systémů velmi přímočarým.
Většina podniků však nasazovala paralelní stacky, což znamená, že měly samostatné stacky pro software, strojové učení a GenAI. Okamžik, kdy máte tyto paralelní stacky, škálování se stává složitějším kvůli předávání mezi strojovým učením a světem softwaru.
Náš tým vždy pracoval na průsečíku budování modelů strojového učení a infrastruktury strojového učení, takže jsme měli jedinečný pohled, který jsme mohli přinést podobné vertikální stacky do podniků a přizpůsobit je pro jejich specifické požadavky. Měli jsme také hypotézu na konci roku 2021, že strojové učení se blíží inflexnímu bodu, a když k tomu dojde, více společností bude potřebovat vertikálně integrovaný stack pro nasazení a škálování těchto systémů efektivně. To nás nakonec vedlo k založení TrueFoundry, a naše hypotéza byla správná. Adopce umělé inteligence se urychlila po spuštění ChatGPT na konci roku 2022.
Jak systémy umělé inteligence přecházejí z experimentů do každodenních operací, co se změnilo v tom, jak by organizace měly uvažovat o spolehlivosti a selhání?
Sázky s Gen AI jsou podstatně vyšší ve srovnání s tradičními systémy strojového učení. Když tyto systémy přecházejí do produkce, organizace se potýkají s mnohem vyšší úrovní nejistoty a nedeterminismu, protože LLM jsou stochastické povahy. Agentní systémy postavené na nich přidávají další nejistotu.
Kromě toho nejsou selhání již binární. Místo toho, aby systémy prostě selhaly nebo nefungovaly, mnoho problémů se objevuje jako částečná selhání nebo tichá degradace. Systémy mohou reagovat s vyšší latencí, degradovanou kvalitou nebo nesprávným chováním v průběhu času. V mnoha případech mohou být tyto degradace obtížněji detekovatelné a někdy dokonce více škodlivé než tvrdé výpadek.
Organizace potřebují uvažovat o spolehlivosti nejen z hlediska dostupnosti, ale také degradace výkonu v průběhu času.
TrueFailover byl spuštěn uprostřed vlny vysokoprofilových výpadků cloudových a služeb umělé inteligence. Jaké nedávné události ukázaly, že spolehlivost umělé inteligence se posunula z „hezké věci“ na základní architektonický požadavek?
Jeden z našich zdravotnických zákazníků, který zpracovává reálné, časově citlivé požadavky pacientů související s předpisy, byl postižen výpadkem způsobeným selháním modelu. Jejich pracovní postupy generují tisíce dolarů příjmů za sekundu, a výpadek narušil některé z těchto kritických pracovních postupů. Jako raný zákazník TrueFailover jsme mohli pomoci s rychlým zotavením, a dopad byl omezen.
Incidenty jako tento vyvolávají důležitou otázku. Když se sázky systému Gen AI zvyšují, proč jsou procesy zotavení stále převážně manuální? To posílilo myšlenku, že systémy by měly být navrženy s předpokladem, že selhání nastane, a měly by být navrženy tak, aby se automaticky opravovaly. Spolehlivost musí být také vestavěna do stacku umělé inteligence prostřednictvím použití bran umělé inteligence, které mohou poskytnout centralizovanou směrování, pozorovatelnost, zábrany a inteligentní přepínání modelů napříč poskytovateli.
Mnoho výpadků umělé inteligence je stále prezentováno jako technické závady. Kde vidíte skutečné ekonomické a lidské náklady začínající se objevovat, když systémy umělé inteligence selžou?
Podniková umělá inteligence se vyvinula do bodu, kdy tyto závady již neovlivňují pouze vnitřní pracovní postupy. Dnes výpadek a degradace přímo a okamžitě ovlivňují vnímání veřejnosti a zisky, protože produkční použití jsou nyní zákaznicky orientovaná. Tento posun z interního testování na vysokou sázku, zákaznicky orientované aplikace je důvodem, proč vidíme zvýšenou poptávku po pozornosti a dohledu vedení.
Jak systémy umělé inteligence se více zapojují do operačních pracovních postupů, výpadek již není pouze technickou otázkou. Stále více mají přímé obchodní, zákaznické a reputační důsledky.
V kritických prostředích, jako jsou lékárny, zdravotnické operace nebo zákaznická podpora, jak rychle může výpadek umělé inteligence eskalovat do operačního nebo reputačního rizika?
V kritických prostředích eskalace nastává téměř okamžitě, protože tyto systémy podporují reálné, časově citlivé pracovní postupy. I krátký výpadek může zastavit kritické procesy, zpozdit doručování služeb nebo přerušit následné systémy, které závisí na těchto výstupech, vytvářející kaskádové operační účinky napříč organizací.
V sektorech, jako je zdravotnictví, dopad sahá za operační narušení až k zákaznickému prožitku a výsledkům služeb. Pokud pacient nemůže vyplnit svůj předpis včas, mohou nastat skutečné důsledky. Nejenže je to problém pro pacienta, ale může také poškodit reputaci lékárny nebo zdravotnického poskytovatele. V kritických prostředích, kde je důvěra faktorem, je zásadní, aby systémy zůstaly online. To je důvod, proč organizace stále více uznávají, že systémy umělé inteligence musí být navrženy s předpokladem, že selhání nastane, a že mechanismy zotavení potřebují aktivovat automaticky, aby se minimalizovalo riziko.
Řekl jste, že mnoho týmů architekturuje pro schopnost spíše než pro kontinuitu. Proč si myslíte, že odolnost byla historicky podceňována v návrhu systému umělé inteligence?
To se převážně týká pobídek uvnitř organizací. Nové schopnosti jsou viditelné a zajímavé. Odblokovávají demonstrace, funkce a produktové možnosti, které vedení může okamžitě vidět.
Kontinuita, podle definice, je neviditelná, když věci fungují dobře. Proto jsou systémy odměn skloněny směrem k dopravě nových funkcí spíše než zajištění, že nic nepraskne. V důsledku toho organizace často investují nerovnoměrně do vývoje schopností spíše než do inženýrství odolnosti.
Jak podniky stále více spoléhají na externí modely a API, jaké nové křehkosti jsou zavedeny do stacku umělé inteligence, které vedení nemusí dosud plně ocenit?
LLM jsou fundamentalně sdílené zdroje, a podniky je nevlastní, jako tradiční infrastrukturu. Kromě toho důležité podnikové kritické systémy běží na externích systémech, které nejsou plně časově testovány. LLM sami se vyvíjejí rychle, což znamená, že poskytovatel modelu nemůže být zodpovědný za věci, jako je latence nebo mírné snížení kvality modelu, protože rychle iterují na svém výzkumu.
Protože LLM jsou sdílené zdroje, latence může prudce vzrůst, protože jiný spotřebitel těchto LLM provede konkrétní akci. Existuje mnoho těchto bodů selhání, které jsou zavedeny kvůli fundamentální povaze LLM, a podniky v tomto novém světě jednoduše nemají plnou kontrolu. Bez plné kontroly může podnik nejlépe vytvořit dostatečné systémové redundance, aby navrhl odolný systém.
Bez zaměřování se na konkrétní produkty, jak by organizace měly přehodnotit architekturu umělé inteligence, aby předpokládaly selhání spíše než považovaly výpadek za vzácné hraniční případy?
Organizace by se měly vrátit k základním principům návrhu distribuovaných systémů. Softwarové systémy byly postaveny na předpokladu, že síťové komponenty a stroje selžou, a že celý region může jít dolů.
Systémy umělé inteligence by neměly být jiné. Měli bychom předpokládat, že poskytovatelé modelů budou mít problémy s latencí, degradací nebo výpadky, a zahrnout redundanci, aby aplikace zůstaly odolné napříč různými scénáři selhání.
Očekáváte, že odolnost umělé inteligence se stane rozhodujícím faktorem při výběru platformy a dodavatele, podobně jako to, jak dostupnost a redundance formovaly rozhodnutí o cloudové infrastruktuře?
Jakmile se více systémů umělé inteligence přesune do produkce, odolnost se stane základním předpokladem. Pokud dodavatel nemůže ukázat své grafy a metriky dostupnosti a celkové odolnosti, nebude ani zvažován. Jakmile se odolnost stane základním očekáváním napříč dodavateli, rozhodující faktory se posunou směrem k uživatelskému prožitku, optimalizaci výkonu, pozorovatelnosti a vyšších produktových schopnostem. V průběhu času se komponenty, jako je brána umělé inteligence a automatizované funkce selhání, stanou základními prvky podnikové infrastruktury pro umělou inteligenci.
Pohledem do budoucnosti, co „produkční připravenost“ umělé inteligence skutečně znamená ve světě, kde se od umělé inteligence očekává nepřetržitá dostupnost, ne pouze občasná užitečnost?
Systémy umělé inteligence připravené pro produkci by měly být pozorovatelné, kontrolovatelné a zotavitelné. Všechny tři tyto podmínky musí být splněny.
Pro produkční umělou inteligenci, aby byla pozorovatelná, týmy potřebují hlubokou viditelnost do chování modelu, latence, míry chyb, využití tokenů, driftu a vzorců selhání. Bez silné pozorovatelnosti se stává velmi obtížným detekovat degradaci, než uživatelé začnou zaznamenávat.
Pro systémy, aby byly kontrolovatelné, zahrnuje to tvarování provozu, omezení rychlosti, zábrany, vynucování zásad a inteligentní směrování napříč modely a poskytovateli. To je místo, kde brána umělé inteligence se stává základním prvkem, působí jako centralizovaná řídicí rovina, která vynucuje zábrany, poskytuje konzistentní správu a umožňuje dynamické přepínání modelů, když výkon nebo spolehlivost klesá.
A nakonec, co se týče zotavení, systémy by měly být navrženy s předpokladem, že komponenty mohou být částečně nebo úplně poškozeny, ať už kvůli výpadkům poskytovatele, degradované kvalitě modelu, omezení rychlosti nebo neočekávaným vstupům od škodlivých aktérů. Automatizované funkce selhání a samoobnovující se mechanismy by měly být rodící se architektuře, ne manuálním playbookům spuštěným po selhání.
Toto je směr, ve kterém pracujeme v TrueFoundry. Dodavatelé, kteří definují produkční připravenost tímto způsobem, kombinují pozorovatelnost, centralizovanou kontrolu a automatizované zotavení, získají dlouhodobou důvěru zákazníků a budou moci pokračovat v řešení nových problémů, jakmile se objeví.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit TrueFoundry.












