Intervjuer
Rob May, VD och medgrundare av NeuroMetric – Intervju-serie

Rob May, VD och medgrundare av NeuroMetric, är en erfaren entreprenör och investerare med en lång meritlista som spänner över molntjänster, AI-startups och riskkapital, och som för närvarande leder Neurometric AI samt tjänstgör som verkställande direktör på HalfCourt Ventures, där han har stöttat över 100 teknikföretag. Utöver sina operativa och investeringsroller har han också medgrundat AI Innovators Community och tidigare byggt och avyttrat företag som Backupify, vilket visar på djup erfarenhet inom flera teknikcykler. Han är också allmänt känd för sin långvariga Investing in AI-nyhetsbrev, som han började skriva för över ett decennium sedan för att analysera framväxande AI-trender, investeringsstrategier och marknadsförändringar, och som sedan dess har utvecklats till en plattform för djupare insikter i den snabbt föränderliga AI-landskapet.
NeuroMetric AI fokuserar på att lösa en av de mest kritiska utmaningarna inom konstgjord intelligens idag: kostnaden och effektiviteten för inferens i stor skala. Plattformen utvärderar dynamiskt AI-arbetsbelastningar och tillämpar optimeringsstrategier – såsom att kombinera mindre, specialiserade modeller med avancerade test-tidberäkningsmetoder – för att förbättra prestanda samtidigt som kostnaderna minskas dramatiskt, vilket möjliggör för företag att uppnå bättre avkastning på sina AI-investeringar. Genom att orkestrera arbetsbelastningar och anpassa modellanvändning till specifika uppgifter syftar Neurometric till att göra AI-system betydligt snabbare och mer prisvärda, och positionerar sig själv vid skärningspunkten mellan AI-infrastruktur, effektivitet och realvärldsskalbarhet när organisationer flyttar från experiment till produktion.
Du har grundat och lett flera AI-företag, investerat i över 100 startups genom HalfCourt Ventures och tidigare byggt och avyttrat Backupify. Hur har dessa erfarenheter format din syn på var varaktig värde skapas inom AI idag?
Jag tror att de flesta investerare och entreprenörer jagar kortvariga fördelar – saker som ser ut som uppenbara luckor på marknaden idag men som kommer att stängas snabbt av befintliga företag. AI kommer att göra att driva ett företag kollapsar till en serie probabilistiska beslut. Företagen att investera i, eller bygga, är de som har de bästa övergripande uppskattningarna av dessa sannolikheter. Ibland kommer det från vertikal integration och ibland från horisontell skala – det beror på marknaden.
I ditt Investing in AI-nyhetsbrev har du hävdat att modeller blir alltmer utbytbara och att den verkliga försvarbarheten skiftar till systemlagret. Vad ser en sann “systemförsvar” ut som i praktiken?
Ett sant systemförsvar har tre egenskaper: det ackumuleras med användning, det är specifikt för kunden och det kan inte replikeras genom att byta ut en bättre modell.
Försvarbarheten bor i det jag kallar ett “System av kontext” – en integrerad arkitektur som kopplar grundmodeller till allt som gör ett företag unikt: dess data, dess arbetsflöden, dess domänkunskap, dess beslutshistoria. Systemet fångar signal från varje interaktion – vilka modeller lyckas med vilka uppgifter, var latens är viktig, vilka företagsspecifika mönster uppstår – och matar tillbaka det i förbättringen av sig själv.
Den viktiga insikten är att detta skapar en multiplikativt drivhjul, inte ett additivt. Du ackumulerar inte bara en sökbar logg av tidigare beslut. Du genererar utbildningssignal som producerar specialiserade modeller som förbättrar routning, som fångar mer värdefull data. Försvarsgropen vidgas med varje inferens.
I praktiken ser ett systemförsvar ut som djup arbetsflödesintegration där växlingskostnaderna inte handlar om API:er – de handlar om att omstrukturera affärslogik. Det ser ut som proprietär kontext som ingen konkurrent kan replikera eftersom den genererades genom månader av produktionsanvändning inom ett specifikt företag. Och det ser ut som den kontinuerliga specialiseringsloopen där systemet blir betydligt bättre för den kunden på sätt som en generisk modellleverantör aldrig kommer att göra.
Modell-eran gav oss den råa kapaciteten. System-eran är där kapaciteten blir verklig värde.
Hur bör företag tänka kring att bygga en multi-modellstrategi, inklusive routningslogik, eskalationsvägar och kontinuerlig utvärdering, i stället för att förlita sig på en enda frontmodell?
Det första företagen behöver internalisera är att “använd bara den bästa modellen” är en förlorarstrategi i stor skala. Det är likvärdigt med att köra varje fråga genom din mest seniora ingenjör. Det är dyrt, det är långsamt och – motsägelsefullt nog – producerar det ofta inte de bästa resultaten.
Detta för oss till vad jag kallar den “Tandade gränsen för inferens”: modellprestanda är uppgiftsspecifik och oförutsägbar. Frontmodeller förlorar mot mindre, specialiserade modeller på specifika uppgifter hela tiden. Vi har sett sammansatta multi-modellsystem nå 72,7% noggrannhet på CRM-uppgifter där frontmodeller fick 58%. Prestandaytan korrelerar inte snyggt med parameterantal. Så den verkliga frågan är inte “vilken modell är bäst?” – det är “vilken modell är bäst för denna specifika underuppgift?”
Den omformuleringen är grunden för en verklig multi-modellstrategi. Här är hur jag skulle säga till företag att tänka kring det i tre lager.
Routningslogik börjar med att kartlägga din inferenslandskap. Katalogera varje punkt i ditt system där en LLM-anrop görs, och för var och en, dokumentera uppgiftstypen, in-/utdatakomplexitet, latenskrav, noggrannhetströskel och anropsvolym. Det ger dig en värmekarta. Du kommer snabbt att upptäcka att de flesta av dina anrop är högfrekventa, smala arbetsuppgifter – klassificering, entitetsutvinning, avsiktssökning, mallgenerering – där en finjusterad mindre modell matchar eller slår frontmodellen till en bråkdel av kostnaden. Reservera dina dyra frontanrop för uppgifter som verkligen kräver komplex resonemang. En agent som gör 50 anrop per uppgift behöver inte GPT-4 för alla 50.
Eskalationsvägar handlar om att bygga intelligenta fallback-mekanismer, inte bara felhantering. Systemet behöver känna igen när en mindre modell returnerar lågkonfidensresultat och eskalera till en mer kapabel modell – eller till en annan modell-strategikombination helt och hållet. Det är här test-tidberäkningsstrategier kommer in. Ibland är det rätta svaret inte en större modell – det är samma modell med kedjeresonemang, strålsökning eller bäst-av-N-exempel. Den optimala konfigurationen ändras inte bara med modell, utan med tankealgoritmen du parar med den.
Kontinuerlig utvärdering är den bit som de flesta företag missar helt, och det är där den verkliga försvarbarheten uppstår. Modellval är inte ett engångsbeslut – det är ett kontinuerligt optimeringsproblem. Nya modeller släpps konstant, dina användningsfall utvecklas, och prestandan försämras på sätt som misslyckas tyst. Du kommer inte att veta att din kundtjänstbot gav ett 40% sämre svar för att du använde fel modell för den frågetypen – du kommer bara att se avhopp tre månader senare. Du behöver infrastruktur som kontinuerligt mäter vad som verkligen fungerar över modell-uppgiftskombinationer och justerar routning baserat på verklig prestandadata, inte benchmark.
Orsaken till att de flesta företag inte har gjort denna förändring är att ingen blir avskedad för att välja frontmodellen – det är “nobody gets fired for buying IBM” i AI. Leverantörsekosystemet trycker på frontmodellen eftersom det är där marginalerna är. Och orkestreringsinfrastrukturen som krävs för att faktiskt köra en multi-modellarkitektur – routningslogik, fallback-mekanismer, modellhantering, observerbarhet – finns helt enkelt inte i de flesta företag. De är fast i ett lokalt optimum där växlingskostnaderna och osäkerheten kring multi-modell känns högre än den pågående överspendningen på frontinferens.
Vilka är de största misstagen du ser att företag gör när de flyttar från AI-piloter till produktionsklara system?
De antar att deras val kan vara statiska och långvariga. I verkligheten förändras varje lager av teknikutvecklingen för AI snabbt. Företag behöver fatta beslut som ger valmöjligheter och flexibilitet.
I vilka typer av arbetsflöden har du sett mindre, uppgiftsspecifika modeller överträffa stora frontmodeller, och varför är det strategiskt viktigt?
Vi har sett det i nästan varje vanlig daglig arbetsuppgift – saker som grundläggande redovisning, textsammanfattning, entitetsutvinning från olika dokument. Vi har undersökt SLM för hundratals arbetsuppgifter och de vinner nästan alltid om problemet är strukturerat korrekt.
Du har skrivit om den minskande marginalkostnaden för att distribuera AI till nya användningsfall. Hur förändrar det den långsiktiga ekonomin för AI-antagande för företag?
Bubblanarrativet antar att AI-intäkter kräver proportionella FoU-investeringar i nya modeller. Det gör det inte. Modellerna är byggda. Infrastrukturen finns. Varje ytterligare användningsfall är en prompt, en dataanslutning, kanske någon lätt finjustering – inte en annan 100-miljoner-dollarträningskörning. Den marginala kostnadskurvan böjer nedåt när plattformen mognar.
Detta är motsatsen till järnvägar eller telekom, där varje ny mil bana var dyrt. I AI var det dyrt att bygga motorn. Att ansluta saker till motorn är billigt, och blir billigare – inferenskostnaderna har minskat ungefär 1 000 gånger på två år. Frågan för företag är inte om AI lönar sig. Det är hur många användningsfall du kan stapla på samma infrastruktur innan intäktskurvan överväldigar kostnadskurvan.
Vilka signaler bör tekniska team använda för att avgöra när de ska byta modell, finjustera eller bygga specialiserade små uppgiftsmodeller?
Signalerna är inte nödvändigtvis tekniska. De är mer prestanda- eller ekonomiskt drivna. Till exempel kan byta modell, finjustera modell eller bygga anpassad SLM alla fungera. Beslutet beror på om du optimerar för latens eller kostnad, hur ofta uppgiften utförs och hur lång tid det tar att bygga och distribuera varje lösning.
Hur designar du skyddsräcken, övervakning och styrning på ett sätt som faktiskt skalar med användning i stället för att bli en flaskhals?
Felet de flesta företag gör är att behandla styrning som en kontrollpunkt – en manuell granskningsnivå fäst ovanpå AI-arbetsflöden. Det skalar inte. Det blir flaskhalsen så fort användningen ökar.
Styrning måste vara inbäddad i orkestreringslagret själv. När din routningsinfrastruktur redan utvärderar varje inferensanrop – vilken modell, vilken uppgift, vilken konfidensnivå – är det en marginell kostnad att lägga till skyddsräcken, inte ett nytt system. Samma lager som bestämmer vilken modell som hanterar en fråga kan verkställa policy: PII-filtrering före anropet, utdatavalidering efter, revisionsloggning som fångas automatiskt, kostnadsallokering per avdelning.
Den viktiga insikten är att företag inte misslyckas inom AI-system. De misslyckas mellan dem – i överlämningarna, eskalationerna och undantagen. Styrning som skalar ser ut som en kontrollplan som gör varje AI-åtgärd säker, granskbar och upprepningsbar som en biprodukt av körning, inte ett hinder för den.
Du har jämfört dagens AI-landskap med övergången från stordatorer till persondatorer. Vad innebär den decentraliseringen för startups som bygger i systemlagret?
Vi är i stordatorfasen av AI just nu. Stora, centraliserade frontmodeller från OpenAI, Anthropic och Google (GOOGL ) var nödvändiga för att fokusera ansträngningar och demonstrera vad AI kunde göra. Den fasen fungerade. Förmågorna är väl förstådda. Men precis som datorer inte stannade centraliserade, kommer AI inte heller att göra det. Vi går in i PC-eran – ett decentraliserat ekosystem där mindre, specialiserade modeller körs närmare arbetet.
Utgiftsdatan speglar redan detta. Företagens AI-investeringar är nu nästan jämnt fördelade mellan infrastruktur och applikationer, och applikationsandelen växer snabbare. Utvidgningen är lateralt – över HR, juridik, marknadsföring, drift, ekonomi – inte vertikalt in i större modeller.
För startups som bygger i systemlagret är detta möjligheten för en generation. I en centraliserad värld fångar modellleverantören mest värde. I en decentraliserad värld migrerar värdet till företagen som löser orkestrering, routning, utvärdering och specialisering – de operativa utmaningarna med att distribuera en heterogen modell-ekosystem i stor skala.
Min projicering är att ungefär 25% av AI-inferensen kommer att kräva frontmodeller. Dessa företag kommer att göra bra – det är ett par biljoner i TAM. Men 75% kommer att köra på öppen källkod och små specialiserade uppgiftsmodeller. Vi tränade en 4-miljardersparametermodell som slog frontmodeller på en specifik CRM-uppgift, och det är så billigt att köra att det nästan är gratis. Det är framtiden – och den behöver ett helt nytt systemlager för att hantera den.
Analogin håller hela vägen: stordatorleverantörerna gjorde bra, men den verkliga rikedomsskapelsen hände i PC-ekosystemet. Samma sak kommer att hända i AI.
Om fem år tror du att frontmodellleverantörerna kommer att fånga mest värde, eller kommer den stora ekonomiska påverkan att komma från orkestrering, optimering och tillämpade system byggda runt dem?
Jag tror att AI-inferensmarknaden kommer att vara en av de största marknaderna i världshistorien. Det betyder att frontmodell-laboratorierna kommer att göra otroligt bra och det kommer fortfarande att finnas massiva möjligheter för företagen som bygger runt dem. När du har marknader på trillions, kan lösning av små kantfall i dessa marknader bli miljardföretag. Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka NeuroMetric AI, eller de kan prenumerera på Investing in AI-nyhetsbrevet.












