Rozhovory

Rob May, CEO a spoluzakladatel NeuroMetric – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Rob May, CEO a spoluzakladatel NeuroMetric, je zkušený podnikatel a investor s dlouholetou historií sahající od cloud computingu, startupů v oblasti umělé inteligence a venture capital, v současné době vede Neurometric AI a zároveň působí jako manažer v HalfCourt Ventures, kde podpořil přes 100 technologických společností. Vedle svých provozních a investičních rolí spoluzaložil komunitu AI Innovators a dříve vybudoval a prodal společnosti, jako je Backupify, což mu dalo hluboké zkušenosti napříč několika technologickými cykly. Je také široce známý díky svému dlouhodobému newsletteru Investing in AI, který začal psát před více než deseti lety, aby analyzoval vznikající trendy v oblasti umělé inteligence, investiční strategie a změny na trhu, a který se od té doby vyvinul v platformu pro hlubší vhled do rychle se vyvíjejícího prostředí umělé inteligence.

NeuroMetric AI se zaměřuje na řešení jedné z nejzávažnějších výzev v oblasti umělé inteligence dnes: nákladů a efektivity inferencí ve velkém měřítku. Platforma dynamicky vyhodnocuje zátěže umělé inteligence a aplikuje optimalizační strategie – jako je kombinace menších, specializovaných modelů s pokročilými technikami výpočtu v době testování – pro zlepšení výkonu, zatímco dramaticky snižuje náklady, což umožňuje podnikům dosáhnout lepší návratnosti investic z nasazení umělé inteligence. Orchestrací zátěží a přizpůsobením využití modelů konkrétním úkolům se Neurometric snaží učinit systémy umělé inteligence významně rychlejšími a dostupnějšími, přičemž se umístila na rozhraní infrastruktury umělé inteligence, efektivity a reálné škálovatelnosti, zatímco organizace přecházejí z experimentování do produkční fáze.

Máte zkušenosti s zakládáním a vedením více společností v oblasti umělé inteligence, investovali jste do více než 100 startupů prostřednictvím HalfCourt Ventures a dříve jste vybudoval a prodal Backupify. Jak tyto zkušenosti ovlivnily váš pohled na to, kde je vytvářena trvalá hodnota v oblasti umělé inteligence?

Dумаю, že většina investorů a podnikatelů pronásleduje krátkodobé výhody – věci, které vypadají jako zjevné mezery na trhu dnes, ale které budou rychle uzavřeny stávajícími společnostmi. Umělá inteligence bude dělat podnikání kolaps do série pravděpodobnostních rozhodnutí. Společnosti, do kterých je třeba investovat nebo je budovat, jsou ty, které mají nejlepší celkové odhady těchto pravděpodobností. Někdy to bude pocházet z vertikální integrace a někdy z horizontální škálovatelnosti – záleží na trhu.

V Ihrem newsletteru Investing in AI jste argumentoval, že modely se stávají stále více zaměnitelnými a že skutečná defenzivita se přesouvá do systémové vrstvy. Jak vypadá skutečný “systémový příkop” v praxi?

Skutečný systémový příkop má tři vlastnosti: kumuluje se s použitím, je specifický pro zákazníka a nemůže být replikován výměnou za lepší model.

Defenzivita žije ve “Systému kontextu” – integrované architektuře, která spojuje základní modely se vším, co dělá společnost jedinečnou: její data, pracovní postupy, doménové znalosti, historie rozhodnutí. Systém zachycuje signál z každé interakce – které modely se daří při kterých úkolech, kde je důležitá latence, jaké podnikové specifické vzorce se objevují – a krmit to zpět do zlepšení sebe sama.

Klíčový vhled je, že to vytváří násobící setrvačník, ne aditivní. Neshromažďujete pouze vyhledatelný log minulých rozhodnutí. Generujete tréninkový signál, který produkuje specializované modely, které zlepšují směrování, které zachycuje více cenných dat. Příkop se rozšiřuje s každým odvozováním.

V praxi vypadá systémový příkop jako hluboká integrace pracovních postupů, kde náklady na přepnutí nejsou o rozhraních API – jsou o přepisování obchodního logiky. Vypadá to jako proprietární kontext, který žádný konkurent nemůže replikovat, protože byl vygenerován prostřednictvím měsíců produkční fáze uvnitř konkrétního podniku. A vypadá to jako kontinuální specializační smyčka, kde se systém stává významně lepším pro tohoto zákazníka způsoby, kterými generický poskytovatel modelu nikdy nebude.

Éra modelů nám dala surovou schopnost. Éra systémů je tam, kde se tato schopnost stává reálnou hodnotou.

Jak by měly podniky uvažovat o budování multi-modelové strategie, včetně směrovací logiky, eskalačních cest a kontinuální evaluace, místo toho, aby se spoléhaly na jediný model?

První věc, kterou podniky potřebují internalizovat, je, že “použít nejlepší model” je prohraná strategie ve velkém měřítku. Je to ekvivalent běhu každého dotazu prostřednictvím nejseniornějšího inženýra. Je to drahé, je to pomalé a – protichůdně – často nevytváří nejlepší výsledky.

To se týká toho, co nazývám “Zubatou hranou inferencí”: výkon modelu je specifický pro úkol a nepředvídatelný. Modely na hranici prohrávají se menšími, specializovanými modely na specifických úkolech neustále. Viděli jsme kompozitní multi-modelové systémy, které dosáhly 72,7% přesnosti na úkolech CRM, zatímco modely na hranici dosáhly 58%. Povrch výkonu nekoreluje jasně s počtem parametrů. Takže skutečná otázka není “Který model je nejlepší?” – je “Který model je nejlepší pro tento specifický podúkol?”

Tato reformulace je základem skutečné multi-modelové strategie. Zde je, jak bych řekl podnikům, aby o tom uvažovaly ve třech vrstvách.

Směrovací logika začíná mapováním vašeho inferenčního krajiny. Katalogujte každý bod ve vašem systému, kde je proveden volání LLM, a pro každý z nich dokumentujte typ úkolu, složitost vstupu/výstupu, požadavky na latenci, prahovou hodnotu přesnosti a objem volání. To vám dá heatmap. Brzy zjistíte, že většina vašeho objemu je vysokofrekvenční, úzký rozsah práce – klasifikace, extrakce entit, směrování intentů, generování šablon – kde jemně vyškolený menší model odpovídá nebo překonává model na hranici za zlomek nákladů. Rezervujte vaše drahá volání modelu na hranici pro úkoly, které skutečně vyžadují komplexní myšlení. Agent, který provádí 50 volání na úkol, nepotřebuje GPT-4 pro všechna 50.

Eskalační cesty jsou o budování inteligentních fallbacků, ne jen failover. Systém potřebuje rozpoznat, kdy menší model vrací výsledky s nízkou jistotou, a eskalovat na schopnější model – nebo na jinou kombinaci modelu-strategie. To je místo, kde vstupují strategie výpočtu v době testování. Někdy není správná odpověď lepší model – je stejný model s chain-of-thought, beam search nebo best-of-N sampling. Optimální konfigurace se mění nejen podle modelu, ale také podle algoritmu myšlení, který s ním pairujete.

Kontinuální evaluace je kus, který většina podniků úplně vynechává, a je to místo, kde se objevuje skutečná defenzivita. Výběr modelu není jednorázové rozhodnutí – je kontinuální optimalizační problém. Nové modely se uvolňují neustále, vaše případy použití se vyvíjejí, a výkon se zhoršuje způsoby, které selhávají tiše. Nevíte, že váš zákaznický servisní bot dal 40% horší odpověď, protože jste použili špatný model pro tento typ dotazu – budete vidět pouze fluktuaci o tři měsíce později. Potřebujete infrastrukturu, která kontinuálně měří, co skutečně funguje napříč kombinacemi model-úkol, a upravuje směrování na základě skutečných výkonových dat, ne benchmarků.

Důvod, proč většina společností neprovedla tuto změnu, je, že nikdo není propuštěn za výběr modelu na hranici – je to “nikdo není propuštěn za nákup IBM” v oblasti umělé inteligence. Ekosystém dodavatelů tlačí modely na hranici, protože tam jsou marže. A orchestrace infrastruktury vyžadovaná pro skutečné spuštění multi-modelové architektury – směrovací logika, fallback mechanismy, model management, pozorovatelnost – prostě neexistuje u většiny společností. Jsou uvězněny v lokálním optimu, kde náklady na přepnutí a nejistota multi-modelu vypadají vyšší než pokračující přeplatky za inference modelu na hranici.

Jaké jsou největší chyby, které vidíte u společností, když přecházejí z pilotních projektů do produkčních systémů?

Předpokládají, že jejich volby mohou být statické a dlouhodobé. Ve skutečnosti se každá vrstva technického stacku pro umělou inteligenci mění rychle. Společnosti potřebují učinit rozhodnutí, která poskytují možnost a flexibilitu.

V jakých typech pracovních postupů jste viděl menší, úkol-specifické modely překonat velké modely na hranici, a proč je to důležité strategicky?

Viděli jsme to téměř ve všech běžných denních pracovních úkolech – jako je základní účetnictví, shrnutí textu, extrakce entit z různých dokumentů. Prozkoumali jsme SLM pro stovky pracovních úkolů a téměř vždy vyhrávají, pokud je problém správně strukturován.

Napsal jste o klesajícím marginálním nákladu nasazení umělé inteligence do nových případů použití. Jak tato změna ovlivňuje dlouhodobou ekonomiku přijetí umělé inteligence pro podniky?

Narrativa bubliny předpokládá, že příjem z umělé inteligence vyžaduje proporcionální investice do výzkumu a vývoje nových modelů. Není tomu tak. Modely jsou postaveny. Infrastruktura existuje. Každý další případ použití je pouze prompt, spojení dat, možná lehké jemné doladění – ne další 100milionový běh tréninku. Marginální nákladová křivka se ohýbá dolů, jak se platforma zraje.

To je opak železnic nebo telekomunikací, kde každá nová trať byla drahá. V oblasti umělé inteligence bylo budování motoru drahé. Připojování věcí k motoru je levné a stále levnější – náklady na inference klesly zhruba 1000krát za dva roky. Otázkou pro podniky není, zda se umělá inteligence vyplatí. Je to, kolik případů použití můžete naskladnit na stejné infrastruktuře, než se výnosová křivka překryje s nákladovou křivkou.

Jaké signály by měly technické týmy použít k určení, kdy přepnout modely, jemně doladit nebo postavit specializované malé úkoly modely?

Signály nejsou nutně technické. Jsou více výkonem nebo ekonomicky řízené. Například přepnutí modelu nebo jemné doladění modelu nebo postavení vlastního SLM by mohly všechny fungovat. Rozhodnutí závisí na tom, zda optimalizujete pro latenci nebo náklady, jak často je úkol prováděn a jak dlouho trvá postavit a nasadit každé řešení.

Jak navrhujete zábrany, monitorování a řízení v způsobem, který skutečně škáluje s použitím, místo toho, aby se stal úzkým místem?

Chyba, kterou většina podniků dělá, je, že zachází s řízením jako s kontrolním bodem – manuálním kontrolním vrstvem připevněným k AI pracovním postupům. To neškáluje. Stává se úzkým místem okamžitě, jakmile se použití zvýší.

Rízení musí být vloženo do orchestrace samotné. Když vaše směrovací infrastruktura již vyhodnocuje každý inferenční volání – který model, který úkol, jaká úroveň jistoty – přidání zábran je marginální náklad, ne nový systém. Stejná vrstva, která rozhoduje, který model zpracuje dotaz, může vynucovat zásady: filtrování PII před voláním, validace výstupu po, auditní stopy zachycené automaticky, alokace nákladů podle oddělení.

Klíčový vhled je, že podniky ne selhávají uvnitř systémů umělé inteligence. Selhávají mezi nimi – v předávkách, eskalacích a výjimkách. Rízení, které škáluje, vypadá jako řídicí rovina, která dělá každý AI čin bezpečným, auditovatelným a opakovaným jako vedlejší produkt provedení, ne překážkou.

Porovnáváte dnešní krajinu umělé inteligence s přechodem z mainframů na PC. Co tato decentralizace znamená pro startupy budující v systémové vrstvě?

Jíme v hlavní fázi umělé inteligence právě teď. Velké, centralizované modely na hranici od OpenAI, Anthropic a Google (GOOGL ) byly nezbytné pro soustředění úsilí a demonstraci toho, co může umělá inteligence udělat. Tato fáze fungovala. Schopnosti jsou dobře pochopeny. Ale stejně jako výpočetní technika nezůstala centralizovaná, ani umělá inteligence nezůstane. Vstupujeme do éry PC – decentralizovaného ekosystému, kde menší, specializované modely běží blíže k práci.

Data o výdajích již odrážejí tuto změnu. Investice podniků do umělé inteligence jsou nyní rozděleny téměř stejně mezi infrastrukturu a aplikace, a podíl aplikací roste rychleji. Rozšíření je laterální – napříč HR, právními, marketingovými, provozními, finančními – ne vertikální do větších modelů.

Pro startupy budující v systémové vrstvě je to příležitost století. V centralizovaném světě zachycuje poskytovatel modelu většinu hodnoty. V decentralizovaném světě se hodnota přesouvá do společností, které řeší orchestraci, směrování, evaluaci a specializaci – provozní výzvy nasazení heterogenního modelového ekosystému ve velkém měřítku.

Moje projekce je, že zhruba 25% inference umělé inteligence bude vyžadovat modely na hranici. Tyto společnosti budou v pořádku – to je pár bilionů dolarů v TAM. Ale 75% bude běžet na open-source a malé specializované úkoly modely. Školovali jsme 4miliardový parametr model, který překonal modely na hranici na specifickém CRM úkolu, a je tak levný na běh, že je téměř zdarma. To je budoucnost – a potřebuje zcela novou systémovou vrstvu, aby ji spravovala.

Analogie platí všude: hlavní dodavatelé mainframů byli v pořádku, ale skutečná tvorba bohatství se odehrála v ekosystému PC. Stejně bude tomu i v oblasti umělé inteligence.

Pohledem do pěti let, myslíte, že poskytovatelé modelů na hranici zachytí většinu hodnoty, nebo bude většina ekonomického dopadu pocházet z orchestrace, optimalizace a aplikovaných systémů postavených kolem nich?

Myslím, že trh s inferencí umělé inteligence bude jedním z největších trhů v historii světa. To znamená, že laboratoře modelů na hranici budou fungovat neuvěřitelně dobře a stále budou existovat obrovské příležitosti pro společnosti budující kolem nich. Když máte triliony dolarů na trhu, řešení malých okrajových případů v těchto trzích se může stát společnostmi v hodnotě miliard dolarů.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit NeuroMetric AI, nebo by se měli přihlásit k odběru newsletteru Investing in AI.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.