Interviews

Rob May, CEO en mede-oprichter van NeuroMetric – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Rob May, CEO en mede-oprichter van NeuroMetric, is een ervaren ondernemer en investeerder met een lange staat van dienst in cloud computing, AI-startups en venture capital, die momenteel Neurometric AI leidt en tevens als Managing Director bij HalfCourt Ventures werkt, waar hij meer dan 100 technologiebedrijven heeft gesteund. Naast zijn operationele en investeringsrollen was hij mede-oprichter van de AI Innovators Community en heeft hij eerder bedrijven opgericht en verkocht, zoals Backupify, wat diepe ervaring over meerdere technologiecycli weerspiegelt. Hij is ook breed bekend vanwege zijn langlopende Investing in AI nieuwsbrief, die hij meer dan een decennium geleden begon om opkomende AI-trends, beleggingsstrategieën en marktverschuivingen te analyseren, en die sindsdien is geëvolueerd tot een platform voor diepgaande inzichten in de snel evoluerende AI-landschap.

NeuroMetric AI richt zich op het oplossen van een van de meest kritieke uitdagingen in kunstmatige intelligentie van vandaag: de kosten en efficiëntie van inferentie op grote schaal. Het platform beoordeelt AI-werklasten dynamisch en past optimalisatie-strategieën toe – zoals het combineren van kleinere, gespecialiseerde modellen met geavanceerde test-time compute-technieken – om de prestaties te verbeteren en de kosten aanzienlijk te verlagen, waardoor bedrijven een betere ROI van AI-implementaties kunnen behalen. Door werklasten te orkestreren en modelgebruik af te stemmen op specifieke taken, streeft Neurometric ernaar om AI-systemen aanzienlijk sneller en goedkoper te maken, waardoor het zichzelf positioneert op het snijvlak van AI-infrastructuur, efficiëntie en real-world-schaalbaarheid, terwijl organisaties overgaan van experimenten naar productie.

U heeft meerdere AI-bedrijven opgericht en geleid, in meer dan 100 startups geïnvesteerd via HalfCourt Ventures en eerder Backupify opgericht en verkocht. Hoe hebben die ervaringen uw perspectief beïnvloed op waar duurzame waarde wordt gecreëerd in AI vandaag?

Ik denk dat de meeste investeerders en ondernemers achter short-term moats aan zitten – dingen die op een voor de hand liggende marktgap lijken, maar gaten die snel door bestaande bedrijven worden gesloten. AI gaat het runnen van een bedrijf terugbrengen tot een reeks probabilistische beslissingen. De bedrijven waarin je moet investeren of opbouwen, zijn die met de beste algehele schattingen van die waarschijnlijkheden. Soms komt dat van verticale integratie en soms van horizontale schaal – het hangt van de markt af.

In uw Investing in AI-nieuwsbrief heeft u betoogd dat modellen steeds meer inwisselbaar worden en dat de echte defensibility verschuift naar de systemenlaag. Wat ziet een echte “systemenmoat” er in de praktijk uit?

Een echte systemenmoat heeft drie eigenschappen: het groeit met gebruik, het is specifiek voor de klant en het kan niet worden gerepliceerd door een beter model in te wisselen.

Defensibility leeft in wat ik een “Systeem van Context” noem – een geïntegreerde architectuur die basismodellen verbindt met alles wat een bedrijf uniek maakt: zijn gegevens, workflows, domeinkennis, besluitgeschiedenis. Het systeem vangt signalen op van elke interactie – welke modellen slagen voor welke taken, waar latentie ertoe doet, welke ondernemingspecifieke patronen ontstaan – en voedt die terug in het verbeteren van zichzelf.

Het belangrijkste inzicht is dat dit een multiplicatieve vliegwiel creëert, niet een additieve. U accumuleert geen zoekbare log van eerdere beslissingen. U genereert trainingsignalen die gespecialiseerde modellen produceren die routing verbeteren, die meer waardevolle gegevens vastleggen. De moat wordt groter met elke inferentie.

In de praktijk ziet een systemenmoat eruit als diepe workflow-integratie waarbij switchkosten niet over APIs gaan – ze gaan over het herschrijven van bedrijfslogica. Het ziet eruit als propriëtaire context die geen concurrent kan repliceren omdat het werd gegenereerd door maanden productiegebruik binnen een specifiek bedrijf. En het ziet eruit als de continue specialisatie-lus waarin het systeem voor die klant betekenisvol beter wordt op manieren waarop een generieke modelaanbieder nooit zal.

Het model-tijdperk gaf ons de ruwe capaciteit. Het systeemtijdperk is waar die capaciteit echt waarde wordt.

Hoe moeten bedrijven denken over het opbouwen van een multi-model-strategie, inclusief routeringslogica, escalatiepaden en continue evaluatie, in plaats van te vertrouwen op een enkel frontier-model?

Het eerste dat bedrijven moeten internaliseren, is dat “gewoon het beste model gebruiken” een verliesstrategie is op grote schaal. Het is het equivalent van het doorgeven van elke query aan uw meest senior engineer. Het is duur, het is langzaam en – tegenstrijdig genoeg – produceert het vaak niet de beste resultaten.

Dit heeft te maken met wat ik de Jagged Frontier of Inference noem: modelprestaties zijn taak-specifiek en onvoorspelbaar. Frontier-modellen verliezen van kleinere, gespecialiseerde modellen op specifieke taken de hele tijd. We hebben composite multi-model systemen gezien die 72,7% nauwkeurigheid op CRM-taken haalden, waar frontier-modellen 58% scoorden. Het prestatieoppervlak correleert niet netjes met parameteraantal. Dus de echte vraag is niet “welk model is het beste?” – het is “welk model is het beste voor deze specifieke subtaak?”

Die herformulering is de basis van een echte multi-model-strategie. Hier is hoe ik bedrijven zou vertellen om erover na te denken in drie lagen.

Routeringslogica begint met het in kaart brengen van uw inferentielandschap. Catalogiseer elke punt in uw systeem waar een LLM-aanroep wordt gedaan en voor elk daarvan documenteert u het taaktype, input/output-complexiteit, latentie-eisen, nauwkeurigheidsgrens en aanroepvolume. Dat geeft u een hittekaart. U zult snel ontdekken dat de meeste van uw volume hoogfrequente, smalle-scope-werk zijn – classificatie, entiteitsextractie, intentierouting, sjabloongeneratie – waar een fijngestemd kleiner model overeenkomt met of de frontier-model verslaat bij een fractie van de kosten. Reserveer uw dure frontier-aanroepen voor taken die echt complexe redenering vereisen. Een agent die 50 aanroepen per taak maakt, heeft geen GPT-4 nodig voor alle 50.

Escalatiepaden gaan over het opbouwen van intelligente fallbacks, niet alleen failover. Het systeem moet herkennen wanneer een kleiner model lage-vertrouwensresultaten teruggeeft en escaleren naar een capabeler model – of naar een andere model-strategie-combinatie. Dit is waar test-time compute-strategieën binnenkomen. Soms is het juiste antwoord niet een groter model – het is hetzelfde model met chain-of-thought, beam search of best-of-N sampling. De optimale configuratie verandert niet alleen per model, maar per denk-algoritme dat u ermee combineert.

Continue evaluatie is het stuk dat de meeste bedrijven helemaal missen, en het is waar de echte defensibility naar voren komt. Modelselectie is geen eenmalige beslissing – het is een continue optimalisatieprobleem. Nieuwe modellen komen constant uit, uw use cases evolueren en prestaties verslechteren op manieren die stil falen. U zult niet weten dat uw klantenservicebot een 40% slechtere antwoord gaf omdat u het verkeerde model voor die querytype gebruikte – u zult alleen churn zien na drie maanden. U hebt infrastructuur nodig die continu meet wat echt werkt over model-taak-combinaties en routering aanpast op basis van echte prestatiegegevens, niet benchmarks.

De reden waarom de meeste bedrijven deze verschuiving niet hebben gemaakt, is dat niemand ontslagen wordt voor het kiezen van het frontier-model – het is de “niemand wordt ontslagen voor het kopen van IBM” van AI. De vendor-ecosysteem duwt frontier omdat dat is waar de marges zijn. En de orkestratie-infrastructuur die nodig is om echt een multi-model-architectuur uit te voeren – routeringslogica, fallback-mechanisme, modelbeheer, observabiliteit – bestaat simpelweg niet bij de meeste bedrijven. Ze zitten vast in een lokaal optimum waar de switchkosten en onzekerheid van multi-model hoger lijken dan de voortdurende overspend aan frontier-inferentie.

Wat zijn de grootste fouten die u ziet dat bedrijven maken wanneer ze overstappen van AI-piloten naar productiegraad-systemen?

Zij gaan ervan uit dat hun keuzes statisch en langdurig kunnen zijn. In werkelijkheid verandert elke laag van de technische stack voor AI snel. Bedrijven moeten beslissingen nemen die opties en flexibiliteit bieden.

In welke soort workflows heeft u kleinere, taak-specifieke modellen zien uitblinken boven grote frontier-modellen, en waarom is dat strategisch belangrijk?

We hebben het gezien in bijna elke gebruikelijke dagelijkse werktaak – dingen als basisboekhouding, tekstsamenvatting, entiteitsextractie uit verschillende documenten. We hebben SLM’s voor honderden werktaken onderzocht en ze winnen bijna altijd als het probleem correct is gestructureerd.

U heeft geschreven over de dalende marginale kosten van het implementeren van AI in nieuwe use cases. Hoe verandert dat de langetermijneconomie van AI-adoptie voor bedrijven?

Het bubbelverhaal veronderstelt dat AI-omzet evenredige R&D-investeringen in nieuwe modellen vereist. Dat is niet zo. De modellen zijn gebouwd. De infrastructuur bestaat. Elke extra use case is een prompt, een gegevensverbinding, misschien wat lichte fine-tuning – niet nog een $100M trainingsrun. De marginale kostencurve buigt naar beneden naarmate het platform volwassener wordt.

Dit is het tegenovergestelde van spoorwegen of telecom, waar elke nieuwe mijl spoor duur was. In AI was het bouwen van de motor duur. Dingen verbinden met de motor is goedkoop, en het wordt goedkoper – inferentiekosten zijn in twee jaar ongeveer 1.000 keer gedaald. De vraag voor bedrijven is niet of AI rendeert. Het is hoeveel use cases u kunt stapelen op dezelfde infrastructuur voordat de omzetcurve de kostencurve overstijgt.

Welke signalen moeten technische teams gebruiken om te bepalen wanneer ze modellen moeten switchen, fine-tunen of gespecialiseerde kleine taakmodellen moeten bouwen?

De signalen zijn niet noodzakelijkerwijs technisch. Ze zijn meer prestatie- of economisch gedreven. Bijvoorbeeld, model switchen of fine-tunen of een aangepast SLM bouwen, het kan allemaal werken. De beslissing hangt af van of u optimaliseert voor latentie of kosten, hoe vaak de taak wordt uitgevoerd en hoe lang het duurt om elke oplossing te bouwen en te implementeren.

Hoe ontwerpt u guardrails, monitoring en governance op een manier die echt schaalt met gebruik in plaats van een bottleneck te worden?

De fout die de meeste bedrijven maken, is governance behandelen als een controlepunt – een handmatige reviewlaag die bovenop AI-workflows is gemonteerd. Dat schaalt niet. Het wordt de bottleneck zodra het gebruik toeneemt.

Governance moet in de orkestratielaag zelf zijn ingebed. Wanneer uw routeringsinfrastructuur al elke inferentie-aanroep evalueert – welk model, welke taak, welk vertrouwensniveau – is het toevoegen van guardrails een marginale kosten, niet een nieuw systeem. Dezelfde laag die beslist welk model een query afhandelt, kan beleid afdwingen: PII-filtering voor de aanroep, outputvalidatie na, audit-trails automatisch vastgelegd, kostentoewijzing per afdeling.

Het belangrijkste inzicht is dat bedrijven niet falen binnen AI-systemen. Ze falen tussen systemen – in de handovers, escalaties en uitzonderingen. Governance die schaalt, ziet eruit als een controlelaag die elke AI-actie veilig, auditeerbaar en herhaalbaar maakt als een bijproduct van uitvoering, niet als een obstakel ervoor.

U heeft de huidige AI-landschap vergeleken met de overgang van mainframes naar PCs. Wat betekent die decentralisatie voor startups die in de systemenlaag bouwen?

We zijn nu in de mainframe-fase van AI. Grote, centrale frontier-modellen van OpenAI, Anthropic en Google (GOOGL ) waren nodig om inspanningen te focussen en te laten zien wat AI kon doen. Die fase werkte. De capaciteiten zijn goed begrepen. Maar net zoals computing niet centraal bleef, zal AI dat ook niet doen. We gaan de PC-era in – een gedecentraliseerd ecosysteem waar kleinere, gespecialiseerde modellen dichter bij het werk draaien.

De uitgavengegevens weerspiegelen dit al. Bedrijfs-AI-investeringen zijn nu bijna gelijk verdeeld tussen infrastructuur en applicaties, en het aandeel van applicaties groeit sneller. De expansie is lateraal – over HR, juridisch, marketing, operations, finance – niet verticaal in grotere modellen.

Voor startups die in de systemenlaag bouwen, is dit de kans van een generatie. In een gecentraliseerde wereld verzamelt de modelaanbieder de meeste waarde. In een gedecentraliseerde wereld migreert waarde naar de bedrijven die orkestratie, routing, evaluatie en specialisatie oplossen – de operationele uitdagingen van het implementeren van een heterogeen model-ecosysteem op grote schaal.

Mijn projectie is dat ongeveer 25% van de AI-inferentie frontier-modellen zal vereisen. Die bedrijven zullen het goed doen – dat is een paar biljoen dollar aan TAM. Maar 75% zal op open-source en kleine gespecialiseerde taakmodellen draaien. We hebben een 4-miljard-parametermodel getraind dat frontier-modellen op een specifieke CRM-taak versloeg, en het is zo goedkoop om te draaien dat het bijna gratis is. Dat is de toekomst – en die heeft een hele nieuwe systemenlaag nodig om het te beheren.

De analogie houdt overal stand: de mainframe-vendors deden het goed, maar de echte rijkdomscreatie gebeurde in het PC-ecosysteem. Hetzelfde zal waar zijn in AI.

Kijkend naar de toekomst, vijf jaar vooruit, denkt u dat frontier-model-aanbieders de meeste waarde zullen verzamelen, of zal de meerderheid van de economische impact komen van orkestratie, optimalisatie en toegepaste systemen die eromheen zijn gebouwd?

Ik denk dat de AI-inferentie-markt een van de grootste markten in de geschiedenis van de wereld zal zijn. Dat betekent dat de frontier-model-labs het ongelooflijk goed zullen doen en er nog steeds enorme kansen zullen zijn voor de bedrijven die eromheen bouwen. Wanneer u trillion dollar-markten heeft, kan het oplossen van kleine edge cases in die markten zich ontwikkelen tot biljoen dollar-bedrijven.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen NeuroMetric AI bezoeken of zich abonneren op de Investing in AI nieuwsbrief.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.