Wywiady

Rob May, CEO i współzałożyciel NeuroMetric – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Rob May, CEO i współzałożyciel NeuroMetric, to doświadczony przedsiębiorca i inwestor z długim stażem, obejmującym chmurę obliczeniową, startupy AI i venture capital, obecnie kierujący Neurometric AI, a także pełniący funkcję dyrektora zarządzającego w HalfCourt Ventures, gdzie wspierał ponad 100 firm technologicznych. Wraz z rolami operacyjnymi i inwestycyjnymi, współzałożył społeczność AI Innovators i wcześniej budował i wycofywał się z firm, takich jak Backupify, co odzwierciedla głębokie doświadczenie w wielu cyklach technologicznych. Jest również powszechnie znany ze swojego długotrwałego biuletynu Investing in AI, który rozpoczął pisać ponad dekadę temu, aby analizować wschodzące trendy AI, strategie inwestycyjne i zmiany rynkowe, i który ewoluował w platformę dla głębszych spostrzeżeń na temat szybko ewoluującego krajobrazu AI.

NeuroMetric AI koncentruje się na rozwiązywaniu jednego z najbardziej krytycznych wyzwań w sztucznej inteligencji dzisiaj: kosztu i wydajności inferencji w skali. Platforma dynamicznie ocenia obciążenia AI i stosuje strategie optymalizacji – takie jak łączenie mniejszych, wyspecjalizowanych modeli z zaawansowanymi technikami obliczeniowymi w czasie testów – w celu poprawy wydajności, jednocześnie dramatycznie redukując koszty, umożliwiając przedsiębiorstwom osiągnięcie lepszego zwrotu z inwestycji w wdrożenia AI. Poprzez orchestrację obciążeń i dostosowanie użycia modeli do konkretnych zadań, Neurometric AI ma na celu uczynienie systemów AI znacznie szybszymi i bardziej przystępnymi, umieszczając się na przecięciu infrastruktury AI, wydajności i rzeczywistej skalowalności, gdy organizacje przechodzą od eksperymentów do produkcji.

Założyłeś i prowadziłeś wiele firm AI, zainwestowałeś w ponad 100 startupów za pośrednictwem HalfCourt Ventures i wcześniej budowałeś i wycofywałeś się z Backupify. Jak te doświadczenia ukształtowały twoją perspektywę na temat miejsca, w którym powstaje trwała wartość w AI dzisiaj?

Myślę, że większość inwestorów i przedsiębiorców goni krótkoterminowe przewagi – rzeczy, które wyglądają jak oczywiste luki na rynku dzisiaj, ale luki, które zostaną szybko zamknięte przez istniejące firmy. AI sprawi, że prowadzenie biznesu skurczy się do serii probabilistycznych decyzji. Firmy, w które warto inwestować lub budować, to te, które mają najlepsze ogólne szacunki tych prawdopodobieństw. Czasami będzie to wynikało z integracji pionowej, a czasami z horyzontalnej skali – zależy to od rynku.

W swoim biuletynie Investing in AI argumentowałeś, że modele stają się coraz bardziej wymiennymi i że prawdziwa defensywność przechodzi do warstwy systemowej. Co wygląda prawdziwa „przewaga systemowa” w praktyce?

Prawdziwa przewaga systemowa ma trzy właściwości: kumuluje się z użyciem, jest specyficzna dla klienta i nie może być replikowana przez wymianę na lepszy model.

Defensywność żyje w tym, co nazywam „Systemem Kontekstu” – zintegrowanej architekturze, która łączy podstawowe modele z wszystkim, co czyni firmę unikalną: jej danymi, przepływami pracy, wiedzą branżową, historią decyzji. System przechwytuje sygnał z każdej interakcji – które modele są skuteczne w których zadaniach, gdzie opóźnienia mają znaczenie, jakie wzorce przedsiębiorstwa pojawiają się – i karmi to z powrotem, aby udoskonalić się.

Kluczowe spostrzeżenie polega na tym, że tworzy to wielokrotny efekt, a nie addytywny. Nie tylko gromadzisz wyszukiwalny rejestr przeszłych decyzji. Generujesz sygnał szkoleniowy, który produkuje wyspecjalizowane modele, które poprawiają routing, co przechwytuje więcej cennych danych. Przewaga poszerza się z każdą inferencją.

W praktyce przewaga systemowa wygląda jak głęboka integracja przepływu pracy, gdzie koszty przełączania nie dotyczą API – dotyczą one ponownego zapisania logiki biznesowej. Wygląda to jak własny kontekst, który żaden konkurent nie może replikować, ponieważ został wygenerowany przez miesiące użytkowania w środowisku produkcyjnym w ramach określonej firmy. I wygląda to jak ciągła specjalizacja, gdzie system staje się znacznie lepszy dla tego klienta w sposób, w jaki dostawca modelu ogólnego nigdy nie będzie.

Era modeli dała nam surową zdolność. Era systemowa to miejsce, w którym ta zdolność staje się rzeczywistą wartością.

Jak powinny firmy myśleć o budowaniu strategii wielomodelowej, w tym logiki routingu, ścieżek eskalacji i ciągłej oceny, zamiast polegania na jednym modelu?

Pierwszą rzeczą, którą firmy muszą wewnętrznie zaakceptować, jest to, że „po prostu użyj najlepszego modelu” to przegrana strategia w skali. To tak jak uruchamianie każdego zapytania przez najbardziej doświadczonego inżyniera. To drogo, to wolno i – paradoksalnie – często nie daje najlepszych wyników.

To dotyka tego, co nazywam Nierównym Frontem Inferencji: wydajność modelu jest specyficzna dla zadania i nieprzewidywalna. Modele na froncie tracą z mniejszymi, wyspecjalizowanymi modelami w konkretnych zadaniach cały czas. Widzieliśmy, jak kompozytowe systemy wielomodelowe osiągają 72,7% dokładności w zadaniach CRM, podczas gdy modele na froncie uzyskały 58%. Powierzchnia wydajności nie koreluje ładnie z liczbą parametrów. Tak więc prawdziwe pytanie nie brzmi „jaki model jest najlepszy?” – brzmi „jaki model jest najlepszy dla tego konkretnego podzadania?”

To przedefiniowanie jest podstawą prawdziwej strategii wielomodelowej. Oto, jak bym powiedział firmom, aby o tym myśleć w trzech warstwach.

Logika routingu zaczyna się od mapowania krajobrazu inferencji. Zapisz każdy punkt w systemie, w którym wywołanie LLM jest wykonywane, i dla każdego z nich udokumentuj typ zadania, złożoność wejścia/wyjścia, wymagania dotyczące opóźnień, próg dokładności i objętość połączeń. To daje ci mapę cieplną. Szybko odkryjesz, że twoja większość objętości to wysokoczęstotliwość, wąska przestrzeń pracy – klasyfikacja, wyodrębnianie encji, routing intencji, generowanie szablonów – gdzie dobrze dopasowany mniejszy model pasuje lub bije model na froncie przy ułamku kosztu. Zarezerwuj swoje drogie wywołania modelu na froncie dla zadań, które rzeczywiście wymagają złożonego rozumowania. Agent, który wykonuje 50 połączeń na zadanie, nie potrzebuje GPT-4 do wszystkich 50.

Ścieżki eskalacji dotyczą budowania inteligentnych awaryjnych połączeń, a nie tylko przełączania. System musi rozpoznać, kiedy mniejszy model zwraca wyniki o niskim poziomie ufności i eskalować do bardziej zdolnego modelu – lub do kombinacji modelu i strategii myślenia. To tam wkraczają strategie obliczeniowe w czasie testów. Czasami odpowiedź nie jest lepszym modelem – to ten sam model z łańcuchem myśli, wyszukiwaniem wiązki lub najlepszym z N prób.

Ciągła ocena to kawałek, który większość firm całkowicie pomija, i to tam pojawia się prawdziwa defensywność. Wybór modelu nie jest jednorazową decyzją – to ciągły problem optymalizacji. Nowe modele są wydawane ciągle, twoje przypadki użycia ewoluują, a wydajność pogarsza się w sposób, który niezauważalnie zawodzi. Nie będziesz wiedzieć, że twój bot obsługi klienta dał o 40% gorszą odpowiedź, bo użyłeś niewłaściwego modelu dla tego typu zapytania – zobaczysz tylko spadek za trzy miesiące. Potrzebujesz infrastruktury, która ciągle mierzy, co naprawdę działa w połączeniach modelu i zadania, i dostosowuje routing na podstawie rzeczywistych danych wydajności, a nie benchmarków.

Jakie są największe błędy, które widzisz w firmach, gdy przechodzą od pilotów AI do systemów produkcyjnych?

Zakładają, że ich wybory mogą być statyczne i długotrwałe. W rzeczywistości każda warstwa stosu technologicznego dla AI zmienia się szybko. Firmy muszą podejmować decyzje, które zapewniają opcjonalność i elastyczność.

W jakich typach przepływów pracy widziałeś mniejsze, specyficzne dla zadania modele, które przewyższają duże modele na froncie, i dlaczego to ma znaczenie strategiczne?

Widzieliśmy to w niemal każdym powszechnym codziennym zadaniu – rzeczach takich jak podstawowe księgowanie, podsumowanie tekstu, wyodrębnianie encji z różnych dokumentów. Eksplorowaliśmy mniejsze modele dla setek zadań i prawie zawsze wygrywają, jeśli problem jest poprawnie sformułowany.

Napisałeś o malejącym marginalnym koszcie wdrożenia AI w nowe przypadki użycia. Jak to zmienia długoterminową ekonomię adopcji AI dla firm?

Narracja bańki zakłada, że przychód AI wymaga proporcjonalnych inwestycji w badania i rozwój nowych modeli. Nie jest tak. Modele są zbudowane. Infrastruktura istnieje. Każdy dodatkowy przypadek użycia to tylko podpowiedź, połączenie danych, może lekkie dostrajanie – nie kolejny 100-milionowy przebieg szkoleniowy. Krzywa kosztu marginalnego zagina się w dół, gdy platforma dojrzewa.

To jest odwrotność kolei lub telekomunikacji, gdzie każdy nowy kilometr toru był drogi. W AI budowanie silnika było drogie. Łączenie rzeczy z silnikiem jest tanie i staje się coraz tańsze – koszty inferencji spadły o około 1000 razy w ciągu dwóch lat. Pytanie dla firm nie brzmi „czy AI się opłaca”. To „ile przypadków użycia możesz nałożyć na tę samą infrastrukturę, zanim krzywa przychodu zdominuje krzywą kosztów”.

Jakie sygnały powinny zespoły techniczne używać, aby określić, kiedy przełączyć modele, dostrajać lub budować specjalistyczne małe modele zadaniowe?

Sygnały nie są koniecznie techniczne. Są bardziej wydajnościowo lub ekonomicznie napędzane. Na przykład przełączenie modelu lub dostrajanie modelu lub budowanie niestandardowego mniejszego modelu zadaniowego mogą wszystko działać. Decyzja zależy od tego, czy optymalizujesz pod kątem opóźnień czy kosztów, jak często zadanie jest wykonywane i jak długo trwa budowanie i wdrożenie każdego rozwiązania.

Jak projektujesz barierki, monitorowanie i zarządzanie w sposób, który naprawdę skaluje z użyciem, zamiast stawać się wąskim gardłem?

Błąd, który popełniają większość firm, polega na traktowaniu zarządzania jako punktu kontrolnego – warstwy manualnej kontroli nałożonej na górze przepływów pracy AI. To nie skaluje. Staje się wąskim gardłem w momencie, gdy użycie wzrasta.

Zarządzanie musi być wbudowane w samą warstwę orchestracji. Gdy twoja infrastruktura routingu już ocenia każde wywołanie inferencji – który model, które zadanie, jaki poziom ufności – dodanie barierek jest marginalnym kosztem, a nie nowym systemem. Ta sama warstwa, która decyduje, który model obsłuży zapytanie, może egzekwować politykę: filtrowanie PII przed wywołaniem, walidacja wyjścia po, ślady audytu przechwycone automatycznie, alokacja kosztów według departamentu.

Kluczowe spostrzeżenie polega na tym, że firmy nie zawodzą wewnątrz systemów AI. Zawodzą między nimi – w przekazach, eskalacjach i wyjątkach. Zarządzanie, które skaluje, wygląda jak warstwa kontrolna, która sprawia, że każda akcja AI jest bezpieczna, audytowalna i powtarzalna jako produkt uboczny wykonania, a nie przeszkodą dla niego.

Porównałeś dzisiejszy krajobraz AI do przejścia od mainframe’ów do PC. Co to decentralizacja oznacza dla startupów budujących w warstwie systemowej?

Jesteśmy obecnie w fazie mainframe’ów AI. Duże, scentralizowane modele na froncie od OpenAI, Anthropic i Google (GOOGL ) były niezbędne, aby skoncentrować wysiłki i pokazać, co AI może zrobić. Ta faza działała. Możliwości są dobrze zrozumiane. Ale tak jak obliczenia nie pozostały scentralizowane, AI też nie pozostanie. Wkraczamy w erę PC – zdecentralizowany ekosystem, w którym mniejsze, specjalistyczne modele działają bliżej pracy.

Dane wydatków już to odzwierciedlają. Inwestycje przedsiębiorstw AI są teraz podzielone niemal równo między infrastrukturę i aplikacje, a udział aplikacji rośnie szybciej. Rozszerzenie jest lateralne – w całym HR, prawie, marketingu, operacjach, finansach – a nie pionowe w kierunku większych modeli.

Dla startupów budujących w warstwie systemowej jest to szansa na pokolenie. W świecie scentralizowanym dostawca modelu przechwytuje większość wartości. W świecie zdecentralizowanym wartość migruje do firm, które rozwiązują orchestrację, routing, ocenę i specjalizację – operacyjne wyzwania wdrożenia heterogenicznego ekosystemu modeli w skali.

Moja projekcja jest taka, że około 25% inferencji AI będzie wymagało modeli na froncie. Te firmy będą w porządku – to kilka bilionów dolarów w TAM. Ale 75% będzie działać na modelach open-source i małych specjalistycznych modelach zadaniowych. Wytrenowaliśmy model 4-miliardów parametrów, który pokonał modele na froncie w określonym zadaniu CRM, i jest tak tanio, że jest prawie za darmo. To jest przyszłość – i potrzebuje całkowicie nowej warstwy systemowej do jej zarządzania.

Analoga trzyma się przez cały czas: producenci mainframe’ów radzili sobie dobrze, ale prawdziwa kreacja bogactwa miała miejsce w ekosystemie PC. To samo będzie prawdą w AI.

Spójrzając pięć lat do przodu, uważasz, że dostawcy modeli na froncie przechwytają większość wartości, czy większość wpływu ekonomicznego pochodzi z orchestracji, optymalizacji i zastosowanych systemów zbudowanych wokół nich?

Myślę, że rynek inferencji AI będzie jednym z największych rynków w historii świata. To oznacza, że laboratoria modeli na froncie będą działać niezwykle dobrze i nadal będą ogromne możliwości dla firm budujących wokół nich. Gdy masz rynki o wartości bilionów dolarów, rozwiązywanie małych przypadków brzegowych w tych rynkach może przerodzić się w firmy o wartości bilionów dolarów.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić NeuroMetric AI, lub powinni subsrybować biuletyn Investing in AI.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.