Interviuri
Rob May, CEO și Co-Fondator al NeuroMetric – Seria de Interviuri

Rob May, CEO și Co-Fondator al NeuroMetric, este un antreprenor și investitor experimentat, cu o lungă experiență în domeniul cloud computing, startup-uri de inteligență artificială și capital de risc, în prezent conducând Neurometric AI și servind în calitate de Director General la HalfCourt Ventures, unde a sprijinit peste 100 de companii tehnologice. Alături de rolurile sale de operare și investiții, el a co-fondat Comunitatea Inovatorilor AI și a construit și a ieșit din companii precum Backupify, reflectând o experiență profundă în multiple cicluri tehnologice. El este, de asemenea, cunoscut pentru newsletter-ul său Investing in AI, pe care l-a început să-l scrie în urmă cu peste un deceniu pentru a analiza tendințele emergente ale inteligenței artificiale, strategiile de investiții și schimbările de piață, și care a evoluat de atunci într-o platformă pentru insight-uri mai profunde în peisajul inteligenței artificiale în rapidă evoluție.
NeuroMetric AI se concentrează pe rezolvarea uneia dintre cele mai critice provocări ale inteligenței artificiale de astăzi: costul și eficiența inferenței la scară. Platforma evaluează dinamic sarcinile de lucru ale inteligenței artificiale și aplică strategii de optimizare – cum ar fi combinarea modelelor mai mici, specializate, cu tehnici avansate de calcul la momentul testării – pentru a îmbunătăți performanța în timp ce reduce dramatic costurile, permițând întreprinderilor să obțină un randament mai bun din implementările de inteligență artificială. Prin orchestrarea sarcinilor de lucru și adaptarea utilizării modelului la sarcini specifice, Neurometric își propune să facă sistemele de inteligență artificială semnificativ mai rapide și mai accesibile, poziționându-se la intersecția infrastructurii de inteligență artificială, eficienței și scalabilității în lumea reală, pe măsură ce organizațiile trec de la experimentare la producție.
Ați fondat și condus multiple companii de inteligență artificială, ați investit în peste 100 de startup-uri prin HalfCourt Ventures și ați construit și ați ieșit din Backupify. Cum v-au influențat aceste experiențe perspectiva asupra locului în care se creează valoarea durabilă în inteligența artificială astăzi?
Cred că majoritatea investitorilor și antreprenorilor urmăresc avantaje pe termen scurt – lucruri care par a fi lacune evidente pe piață în prezent, dar care vor fi rapid închise de companiile existente. Inteligența artificială va face ca operarea unei afaceri să se reducă la o serie de decizii probabilistice. Companiile în care trebuie să investești sau să construiești sunt cele care au cele mai bune estimări generale ale acestor probabilități. Uneori, acest lucru va veni din integrare verticală și uneori din scală orizontală – depinde de piață.
În newsletter-ul dvs. Investing in AI, ați argumentat că modelele devin din ce în ce mai interschimbabile și că adevărata defensivitate se deplasează către stratul de sisteme. Ce arată o “barieră de sisteme” adevărată în practică?
O barieră de sisteme adevărată are trei proprietăți: se compune odată cu utilizarea, este specifică clientului și nu poate fi replicată prin înlocuirea unui model mai bun.
Defensivitatea trăiește în ceea ce numesc un “Sistem de Context” – o arhitectură integrată care conectează modelele de bază la tot ceea ce face o companie unică: datele sale, fluxurile de lucru, cunoașterea sa de domeniu, istoricul deciziilor sale. Sistemul capturează semnal de la fiecare interacțiune – care modele au succes la care sarcini, unde contează latența, care modele emergente specifice întreprinderii – și alimentează înapoi în îmbunătățirea sa.
Cheia insight-ului este că acest lucru creează un efect de flywheel multiplicativ, nu aditiv. Nu cumulați doar un jurnal de căutare a deciziilor trecute. Generați semnal de antrenament care produce modele specializate care îmbunătățesc rutarea, care capturează date mai valoroase. Barierele se lărgesc odată cu fiecare inferență.
În practică, o barieră de sisteme arată ca o integrare profundă a fluxului de lucru, unde costurile de commutare nu sunt despre API-uri – sunt despre rescrierea logicii de afaceri. Arată ca un context proprietar pe care niciun competitor nu-l poate replica, deoarece a fost generat prin luni de utilizare în producție în cadrul unei întreprinderi specifice. Și arată ca o buclă continuă de specializare, unde sistemul devine semnificativ mai bun pentru acel client în moduri în care un furnizor de model generic nu va face niciodată.
Epoca modelului ne-a oferit capacitatea brută. Epoca sistemelor este unde acea capacitate devine valoare reală în lumea reală.
Cum ar trebui întreprinderile să gândească despre construirea unei strategii multi-model, incluzând logica de rutare, căi de escaladare și evaluare continuă, în loc de a se baza pe un singur model de frontieră?
Prima lucru pe care întreprinderile trebuie să-l internalizeze este că “folosiți cel mai bun model” este o strategie care pierde la scară. Este echivalentul rulării fiecărei interogări prin cel mai senior inginer. Este scump, este lent și – contrar intuiției – adesea nu produce cele mai bune rezultate.
Acest lucru se referă la ceea ce numesc “Frontiera Jagged a Inferenței”: performanța modelului este specifică sarcinii și imprevizibilă. Modelele de frontieră pierd în fața modelelor mai mici, specializate, pe sarcini specifice, de multe ori. Am văzut sisteme compozite multi-model care au atins 72,7% acuratețe pe sarcini CRM, unde modelele de frontieră au obținut 58%. Suprafața de performanță nu se corelează îndeaproape cu numărul de parametri. Așadar, întrebarea reală nu este “care model este cel mai bun?” – este “care model este cel mai bun pentru această sarcină specifică?”
Această reîncadrare este fundamentul unei strategii multi-model reale. Iată cum aș spune întreprinderilor să gândească despre asta în trei straturi.
Logica de rutare începe cu cartografierea peisajului de inferență. Catalogați fiecare punct din sistemul dvs. unde se face o chemare LLM și, pentru fiecare, documentați tipul de sarcină, complexitatea intrării/ieșirii, cerințele de latență, pragul de acuratețe și volumul de apeluri. Acest lucru vă oferă o hartă de căldură. Veți găsi rapid că majoritatea volumului dvs. este muncă de înaltă frecvență, cu scop îngust – clasificare, extragere de entități, rutare de intenție, generare de șabloane – unde un model mai mic, reglat, se potrivește sau bate modelul de frontieră la o fracțiune din cost. Rezervați apelurile dvs. scumpe de frontieră pentru sarcinile care necesită într-adevăr raționament complex. Un agent care face 50 de apeluri pe sarcină nu are nevoie de GPT-4 pentru toate cele 50.
Căile de escaladare sunt despre construirea unor fallback-uri inteligente, nu doar failover. Sistemul trebuie să recunoască când un model mai mic returnează rezultate cu încredere scăzută și să escaladeze către un model mai capabil – sau către o combinație de model și strategie diferită. Aici intră în joc strategiile de calcul la momentul testării. Uneori, răspunsul corect nu este un model mai mare – este același model cu lanț de gândire, căutare cu fascicul sau eșantionare best-of-N. Configurația optimă se schimbă nu doar după model, ci și după algoritmul de gândire pe care îl asociați cu acesta.
Evaluarea continuă este piesa pe care majoritatea întreprinderilor o ratează complet, și este locul unde apare defensivitatea reală. Selectarea modelului nu este o decizie unică – este o problemă de optimizare continuă. Noi modele sunt lansate constant, cazurile dvs. de utilizare evoluează, iar performanța se degradează în moduri care nu dau greș. Nu veți ști niciodată că botul dvs. de servicii pentru clienți a oferit un răspuns cu 40% mai slab pentru că ați folosit modelul greșit pentru acea interogare – veți vedea doar scăderea ratei de reținere a clienților trei luni mai târziu. Aveți nevoie de infrastructură care măsoară continuu ce funcționează cu adevărat pe combinații de model și sarcină și ajustează rutarea pe baza datelor de performanță reale, nu a benchmark-urilor.
Motivul pentru care majoritatea companiilor nu au făcut acest salt este că nimeni nu este dat afară pentru alegerea modelului de frontieră – este “nimeni nu este dat afară pentru cumpărarea de la IBM” al inteligenței artificiale. Ecosistemul de furnizori promovează frontieră pentru că acolo sunt marjele. Și infrastructura de orchestrare necesară pentru a rula cu adevărat o arhitectură multi-model – logica de rutare, mecanismele de fallback, managementul modelului, observabilitatea – pur și simplu nu există la majoritatea companiilor. Sunt blocate într-un optimum local în care costurile de comutare și incertitudinea multi-model par mai mari decât cheltuielile continue pentru inferența de frontieră.
Care sunt cele mai mari greșeli pe care le vedeți companiile să le facă atunci când trec de la proiecte-pilot de inteligență artificială la sisteme de producție?
Ele presupun că alegerile lor pot fi statice și de durată. În realitate, fiecare strat al stivei tehnologice pentru inteligența artificială se schimbă rapid. Companiile trebuie să ia decizii care oferă opțiuni și flexibilitate.
În ce tipuri de fluxuri de lucru ați văzut modele mai mici, specializate pe sarcini, să performeze mai bine decât modelele de frontieră mari, și de ce contează acest lucru strategic?
Am văzut acest lucru în aproape fiecare sarcină comună zilnică – lucruri precum contabilitatea de bază, rezumarea textului, extragerea entităților din diverse documente. Am explorat SLM-uri pentru sute de sarcini de lucru și ele câștigă aproape întotdeauna dacă problema este structurată corect.
Ați scris despre scăderea costului marginal de implementare a inteligenței artificiale în noi cazuri de utilizare. Cum schimbă acest lucru economia pe termen lung a adoptării inteligenței artificiale pentru întreprinderi?
Narativa bulei presupune că veniturile din inteligența artificială necesită investiții de cercetare și dezvoltare proporționale în noi modele. Nu este așa. Modelele sunt construite. Infrastructura există. Fiecare caz de utilizare suplimentar este un prompt, o conexiune de date, poate o ușoară reglare – nu o altă cursă de antrenament de 100 de milioane de dolari. Curba costului marginal se îndreaptă în jos pe măsură ce platforma maturizează.
Acesta este opusul căilor de fier sau telecomunicațiilor, unde fiecare milă de cale ferată sau fibră era scumpă. În inteligența artificială, construirea motorului a fost scumpă. Conectarea lucrurilor la motor este ieftină și devine și mai ieftină – costurile de inferență au scăzut aproximativ 1.000 de ori în doi ani. Întrebarea pentru întreprinderi nu este dacă inteligența artificială se plătește. Este câte cazuri de utilizare puteți stivuiți pe aceeași infrastructură înainte ca curba de venituri să depășească curba de costuri.
Care sunt semnalele pe care echipele tehnice ar trebui să le folosească pentru a determina când să schimbe modele, să regleze sau să construiască modele specializate mici pentru sarcini?
Semnalele nu sunt neapărat tehnice. Sunt mai degrabă conduse de performanță sau economic. De exemplu, schimbarea unui model sau reglarea unui model sau construirea unui SLM specializat ar putea funcționa cu toate. Decizia depinde de faptul dacă optați pentru latență sau cost, de cât de des se execută sarcina și de cât timp ia să construiți și să implementați fiecare soluție.
Cum proiectați baraje, monitorizare și guvernanță astfel încât să se extindă cu adevărat cu utilizarea, în loc de a deveni un blocaj?
Greșeala pe care majoritatea întreprinderilor o fac este să trateze guvernanța ca pe un punct de control – un strat de revizuire manuală atașat deasupra fluxurilor de lucru ale inteligenței artificiale. Acest lucru nu se extinde. Devine blocajul în momentul în care utilizarea crește.
Guvernanța trebuie să fie încorporată în stratul de orchestrare în sine. Când infrastructura dvs. de rutare evaluează deja fiecare apel de inferență – care model, care sarcină, ce nivel de încredere – adăugarea de baraje este un cost marginal, nu un sistem nou. Același strat care decide care model gestionează o interogare poate impune politica: filtrare PII înainte de apel, validare a ieșirii după, urme de audit capturate în mod automat, alocare de cost pe departament.
Cheia insight-ului este că întreprinderile nu eşuează în interiorul sistemelor de inteligență artificială. Ele eşuează între ele – în predări, escaladări și excepții. Guvernanța care se extinde arată ca un plan de control care face fiecare acțiune de inteligență artificială sigură, auditabilă și reproductibilă ca un produs al execuției, nu o piedică în calea acesteia.
Ați comparat peisajul actual de inteligență artificială cu trecerea de la mainframe-uri la PC-uri. Ce înseamnă această descentralizare pentru startup-urile care construiesc în stratul de sisteme?
Suntem în faza mainframe a inteligenței artificiale în prezent. Modelele de frontieră mari, centralizate, de la OpenAI, Anthropic și Google (GOOGL ), au fost necesare pentru a concentra eforturile și a demonstra ce poate face inteligența artificială. Acea fază a funcționat. Capabilitățile sunt bine înțelese. Dar, la fel cum calcularea nu a rămas centralizată, nici inteligența artificială nu va rămâne. Intrăm în era PC-urilor – un ecosistem descentralizat în care modelele mai mici, specializate, rulează mai aproape de lucru.
Datele de cheltuieli reflectă deja acest lucru. Investiția în inteligență artificială a întreprinderilor este acum împărțită aproape în mod egal între infrastructură și aplicații, iar cota de aplicații crește mai rapid. Extinderea este laterală – în domenii precum resurse umane, juridic, marketing, operațiuni, finanțe – și nu vertical în modele mai mari.
Pentru startup-urile care construiesc în stratul de sisteme, aceasta este oportunitatea unei generații. Într-o lume centralizată, furnizorul de model capturează majoritatea valorii. Într-o lume descentralizată, valoarea migrează către companiile care rezolvă orchestrarea, rutarea, evaluarea și specializarea – provocările operaționale de implementare a unui ecosistem de model eterogen la scară.
Proiecția mea este că aproximativ 25% din inferența de inteligență artificială va necesita modele de frontieră. Acele companii vor fi bine – aceasta este o piață de câteva trilioane de dolari. Dar 75% vor rula pe modele deschise și modele specializate mici pentru sarcini. Am antrenat un model de 4 miliarde de parametri care a bătut modelele de frontieră pe o sarcină CRM specifică și este atât de ieftin de rulat încât este aproape gratuit. Acesta este viitorul – și are nevoie de un strat de sisteme complet nou pentru a-l gestiona.
Analogia se păstrează pe tot parcursul: furnizorii de mainframe au făcut bine, dar crearea reală de bogăție a avut loc în ecosistemul PC-urilor. Același lucru va fi valabil și în inteligența artificială.
Privind spre următorii cinci ani, credeți că furnizorii de modele de frontieră vor captura majoritatea valorii, sau majoritatea impactului economic va veni din orchestrarea, optimizarea și sistemele aplicate construite în jurul lor?
Cred că piața de inferență a inteligenței artificiale va fi una dintre cele mai mari piețe din istoria lumii. Acest lucru înseamnă că laboratoarele de modele de frontieră vor face extrem de bine și vor exista în continuare oportunități masive pentru companiile care construiesc în jurul lor. Când aveți piețe de mii de miliarde de dolari, rezolvarea unor cazuri de margine mici în aceste piețe poate deveni companii de miliarde de dolari.
Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre NeuroMetric AI sau să se aboneze la newsletter-ul Investing in AI.












