Interviews

Jay Dawani is mede-oprichter en CEO van Lemurian Labs – Interviewserie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Jay Dawani is mede-oprichter en CEO van Lemurian Labs. Lemurian Labs heeft als missie om betaalbare, toegankelijke en efficiënte AI-computers te leveren, gedreven door de overtuiging dat AI niet een luxe moet zijn, maar een instrument dat voor iedereen toegankelijk moet zijn. Het oprichtingsteam van Lemurian Labs combineert expertise in AI, compilers, numerieke algoritmen en computerarchitectuur, verenigd door een enkel doel: om versnelde computing opnieuw uit te vinden.

Kunt u ons door uw achtergrond en wat u in AI heeft gebracht?

Absoluut. Ik programmeerde al sinds mijn 12e en bouwde mijn eigen games en dergelijke, maar ik kwam eigenlijk in AI terecht toen ik 15 was vanwege een vriend van mijn vader die geïnteresseerd was in computers. Hij voedde mijn nieuwsgierigheid en gaf me boeken om te lezen, zoals Von Neumanns ‘De computer en de hersenen’, Minsky’s ‘Perceptrons’, Russel en Norvigs ‘AI: een moderne benadering’. Deze boeken hebben mijn denken sterk beïnvloed en het leek bijna vanzelfsprekend dat AI transformerend zou zijn en dat ik deel moest uitmaken van dit veld.

Toen het tijd was voor de universiteit, wilde ik echt AI studeren, maar ik vond geen universiteiten die dat aanboden, dus besloot ik toegepaste wiskunde te studeren en niet lang daarna hoorde ik over de resultaten van AlexNet op ImageNet, wat echt spannend was. Op dat moment had ik een nu-of-nooit-moment in mijn hoofd en ging ik volledig in op het lezen van elk papier en elke boek over neurale netwerken en zocht ik alle leiders in het veld op om van hen te leren, omdat je niet vaak de kans krijgt om erbij te zijn bij de geboorte van een nieuwe industrie en van de pioniers te leren.

Heel snel realiseerde ik me dat ik geen onderzoek doe, maar ik wel geniet van het oplossen van problemen en het bouwen van AI-geactiveerde producten. Dat leidde me naar het werken aan autonome auto’s en robots, AI voor materiaalontdekking, generatieve modellen voor multi-fysica-simulaties, AI-gebaseerde simulators voor het trainen van professionele raceauto-chauffeurs en het helpen bij auto-instellingen, space-robots, algoritme-gebaseerde handel en nog veel meer.

Nu, na al dat, probeer ik de kosten van AI-training en -implementatie te beteugelen, omdat dat de grootste hindernis zal zijn die we tegenkomen op onze weg naar het mogelijk maken van een wereld waarin elke persoon en elk bedrijf toegang kan hebben tot en kan profiteren van AI op de meest economische manier mogelijk.

Veel bedrijven die werken aan versnelde computing hebben oprichters die carrières hebben opgebouwd in halfgeleiders en infrastructuur. Hoe denkt u dat uw eerdere ervaring in AI en wiskunde uw vermogen beïnvloedt om de markt te begrijpen en effectief te concurreren?

Ik denk eigenlijk dat het feit dat ik niet uit de industrie kom, me het voordeel geeft van de buitenstaander. Ik heb het vaak meegemaakt dat niet weten van de industrienormen of conventionele wijsheid me de vrijheid geeft om vrijer te onderzoeken en dieper te gaan dan de meeste anderen, omdat ik niet belast ben met vooroordelen.

Ik heb de vrijheid om ‘domme’ vragen te stellen en aannamen te testen op een manier die de meeste anderen niet zouden doen, omdat veel dingen als waarheden worden aanvaard. In de afgelopen twee jaar heb ik verschillende gesprekken gehad met mensen binnen de industrie waarin ze heel dogmatisch zijn over iets, maar ze kunnen me niet vertellen waar het idee vandaan komt, wat ik heel verwarrend vind. Ik wil begrijpen waarom bepaalde keuzes zijn gemaakt en welke aannamen of voorwaarden er op dat moment golden en of ze nog steeds van toepassing zijn.

Vanuit mijn AI-achtergrond neig ik ernaar om een software-georiënteerde kijk te hebben door te kijken naar waar de workloads vandaag zijn en naar alle mogelijke manieren waarop ze in de loop van de tijd kunnen veranderen, en door de hele ML-pipeline voor training en inferentie te modelleren om de knelpunten te begrijpen, wat me vertelt waar de kansen liggen om waarde te leveren. En omdat ik een wiskundige achtergrond heb, wil ik dingen modelleren om zo dicht mogelijk bij de waarheid te komen en dat als leidraad te gebruiken. We hebben bijvoorbeeld modellen gebouwd om systeemprestaties te berekenen voor de totale kosten van eigendom en we kunnen de voordelen meten die we klanten kunnen bieden met software en/of hardware en beter begrijpen welke beperkingen en welke knoppen er voor ons beschikbaar zijn, en tientallen andere modellen voor allerlei dingen. We zijn heel data-gedreven en gebruiken de inzichten uit deze modellen om onze inspanningen en compromissen te leiden.

Het lijkt erop dat de vooruitgang in AI voornamelijk is gekomen door schaling, wat exponentieel meer compute en energie vereist. Het lijkt erop dat we in een wapenwedloop zitten met elk bedrijf dat probeert de grootste model te bouwen, en er lijkt geen einde aan te komen. Denkt u dat er een uitweg is?

Er zijn altijd manieren. Schaling heeft zichzelf bewezen als extreem nuttig, en ik denk niet dat we het einde nog hebben gezien. We zullen binnenkort modellen zien die getraind worden met een kosten van ten minste een miljard dollar. Als je een leider wilt zijn in generatieve AI en baanbrekende foundation-modellen wilt creëren, moet je minstens een paar miljard per jaar uitgeven aan compute. Nu zijn er natuurlijke limieten aan schaling, zoals het kunnen construeren van een groot genoeg dataset voor een model van die grootte, toegang krijgen tot mensen met de juiste know-how en toegang krijgen tot genoeg compute.

Verdere schaling van modelgrootte is onvermijdelijk, maar we kunnen de hele aardoppervlakte niet omvormen tot een planeetgrote supercomputer om LLM’s te trainen en te serveren voor voor de hand liggende redenen. Om dit onder controle te krijgen, hebben we verschillende knoppen waar we mee kunnen spelen: betere datasets, nieuwe modelarchitecturen, nieuwe trainingsmethoden, betere compilers, algoritme-verbeteringen en -uitbuiting, betere computerarchitecturen, enz. Als we dat allemaal doen, is er ongeveer drie ordes van grootte van verbetering te vinden. Dat is de beste uitweg.

U bent een voorstander van first principles denken, hoe vormt dit uw mindset voor het runnen van Lemurian Labs?

We passen inderdaad veel first principles denken toe bij Lemurian. Ik heb altijd gevonden dat conventionele wijsheid misleidend is omdat die kennis is gevormd op een bepaald moment in de tijd toen bepaalde aannamen golden, maar dingen veranderen altijd en je moet aannamen vaak opnieuw testen, vooral in een snel veranderende wereld.

Ik stel mezelf vaak vragen als “dit lijkt een heel goed idee, maar waarom zou dit niet werken”, of “wat moet waar zijn om dit te laten werken”, of “wat weten we dat absolute waarheden zijn en welke aannamen maken we en waarom?”, of “waarom geloven we dat deze specifieke aanpak de beste manier is om dit probleem op te lossen”. Het doel is om ideeën zo snel en goedkoop mogelijk te weerleggen en te doden. We willen proberen het aantal dingen dat we op een gegeven moment proberen te maximaliseren. Het gaat erom dat we geobsedeerd zijn door het probleem dat moet worden opgelost, en niet te veel gehecht zijn aan welke technologie het beste is. Te veel mensen focussen te veel op de technologie en ze eindigen met het misverstaan van de problemen van de klant en missen de overgangen in de industrie die hun aanpak kunnen invalidieren, waardoor ze niet in staat zijn om zich aan te passen aan de nieuwe staat van de wereld.

First principles denken is echter niet zo nuttig op zichzelf. We combineren het met backcasting, wat inhoudt dat we een ideale of gewenste toekomstige uitkomst voorstellen en terugwerken om de verschillende stappen of acties te identificeren die nodig zijn om die uitkomst te realiseren. Dit zorgt ervoor dat we convergeren naar een zinvolle oplossing die niet alleen innovatief is, maar ook gebaseerd is op de realiteit. Het heeft geen zin om tijd te besteden aan het creëren van de perfecte oplossing, alleen om later te realiseren dat het niet haalbaar is om die op te bouwen vanwege een verscheidenheid aan werkelijke beperkingen zoals middelen, tijd, regelgeving of het creëren van een ogenschijnlijk perfecte oplossing, maar later ontdekken dat we het te moeilijk hebben gemaakt voor klanten om die te accepteren.

Soms vinden we onszelf in een situatie waarin we een beslissing moeten nemen, maar we hebben geen gegevens, en in dit scenario passen we minimum testbare hypothesen toe, die ons een signaal geven of iets de moeite waard is om te volgen met de minste hoeveelheid energieverbruik.

Alles bij elkaar geeft ons dit de flexibiliteit, snelle iteratiecycli om items snel te de-risico te nemen, en heeft ons geholpen om strategieën aan te passen met een hoge mate van vertrouwen, en om veel vooruitgang te boeken op heel moeilijke problemen in een heel korte tijd.

Aanvankelijk was u gefocust op edge AI, wat heeft u doen verschuiven en pivoteren naar cloud computing?

We begonnen met edge AI omdat ik op dat moment heel gefocust was op het oplossen van een specifiek probleem dat ik had ondervonden bij het binnenhalen van een wereld van algemene autonome robotica. Autonome robotica belooft de grootste platformverschuiving in onze collectieve geschiedenis te zijn, en het leek alsof we alles hadden wat nodig was om een foundation-model voor robotica te bouwen, maar we misten de ideale inferentie-chip met de juiste balans van doorvoer, latentie, energoefficiëntie en programmeerbaarheid om dat model te draaien.

Ik dacht niet aan het datacenter op dat moment, omdat er meer dan genoeg bedrijven waren die zich daarop richtten en ik verwachtte dat ze het wel zouden oplossen. We ontwierpen een heel krachtige architectuur voor deze toepassingsruimte en waren klaar om het uit te voeren, en toen werd het overduidelijk dat de wereld was veranderd en het probleem echt in het datacenter lag. Het tempo waarin LLM’s schalen en compute verbruiken, overtreft de vooruitgang in computing, en wanneer je adoptie meeneemt, begint het een zorgwekkend beeld te schetsen.

Het voelde alsof dit waar we onze inspanningen op moesten richten, om de energiekosten van AI in datacenters zo laag mogelijk te brengen zonder beperkingen op te leggen aan waar en hoe AI zou moeten evolueren. En dus zijn we aan het werk gegaan om dit probleem op te lossen.

Kunt u het verhaal van de oprichting van Lemurian Labs delen?

Het verhaal begint in het begin van 2018. Ik werkte aan het trainen van een foundation-model voor algemene autonomie, evenals een model voor generatieve multi-fysica-simulatie om de agent te trainen en te fijnen voor verschillende toepassingen, en enkele andere dingen om te helpen schalen naar multi-agent-omgevingen. Maar heel snel had ik de hoeveelheid compute die ik had, uitgeput, en ik schatte dat ik meer dan 20.000 V100-GPU’s nodig had. Ik probeerde genoeg te verzamelen om toegang te krijgen tot de compute, maar de markt was nog niet klaar voor die schaal. Het kreeg me echter wel aan het denken over de implementatiekant van dingen en ik ging zitten om te berekenen hoeveel prestaties ik nodig zou hebben voor het serveren van dit model in de doelomgevingen en ik realiseerde me dat er geen chip bestond die me daar kon krijgen.

Een paar jaar later, in 2020, ontmoette ik Vassil – mijn latere mede-oprichter – om bij te praten en ik deelde de uitdagingen die ik had ondervonden bij het bouwen van een foundation-model voor autonomie, en hij stelde voor om een inferentie-chip te bouwen die het foundation-model kon draaien, en hij deelde dat hij veel had nagedacht over nummerformaten en betere representaties die zouden helpen bij het niet alleen maken van neurale netwerken die nauwkeurigheid behouden bij lagere bit-breedte, maar ook bij het creëren van krachtigere architectuur.

Het was een intrigerend idee, maar het was ver buiten mijn expertise. Maar het liet me niet los, wat me ertoe bracht om maanden en maanden te besteden aan het leren van de nuances van computerarchitectuur, instructiesets, runtimes, compilers en programmeringsmodellen. Uiteindelijk begon het opbouwen van een halfgeleiderbedrijf zin te krijgen en had ik een these gevormd over wat het probleem was en hoe we het zouden aanpakken. En tegen het einde van het jaar startten we Lemurian.

U hebt eerder gesproken over de noodzaak om eerst software aan te pakken bij het bouwen van hardware, kunt u uw visie uitleggen over waarom het hardwareprobleem eerst en vooral een softwareprobleem is?

Wat veel mensen niet beseffen, is dat de softwarekant van halfgeleiders veel moeilijker is dan de hardware zelf. Het bouwen van een nuttige computerarchitectuur voor klanten om te gebruiken en voordeel uit te halen, is een full-stack-probleem, en als je die kennis en bereidheid niet hebt, eindig je met een prachtige architectuur die heel performant en efficiënt is, maar totaal onbruikbaar voor ontwikkelaars, wat het eigenlijk belangrijkste is.

Er zijn andere voordelen aan het nemen van een software-eerst-benadering, zoals een snellere time-to-market. Dit is cruciaal in de snel veranderende wereld van vandaag, waarin te veel vertrouwen in een architectuur of functie kan betekenen dat je de markt helemaal mist.

Het niet nemen van een software-eerst-benadering resulteert meestal in het niet hebben van de belangrijke dingen gederiskeerd die nodig zijn voor productadoptie op de markt, het niet kunnen reageren op veranderingen in de markt wanneer workloads onverwacht veranderen, en onderbenutte hardware. Al deze dingen zijn niet goed. Dat is een grote reden waarom we veel waarde hechten aan het zijn van software-georiënteerd en waarom onze visie is dat je geen halfgeleiderbedrijf kunt zijn zonder echt een softwarebedrijf te zijn.

Kunt u uw onmiddellijke software-stack-doelen bespreken?

Toen we onze architectuur ontwierpen en nadachten over de toekomstige roadmap en waar de kansen lagen om meer prestaties en energoefficiëntie te brengen, werd het heel duidelijk dat we veel meer heterogeniteit zouden zien, wat veel problemen op software zou creëren. En we moeten niet alleen in staat zijn om heterogene architecturen productief te programmeren, we moeten ze ook aanpakken op datacenter-schaal, wat een uitdaging is zoals we die nog nooit eerder hebben gezien.

Dit maakte ons bezorgd, omdat de laatste keer dat we een grote overgang moesten doormaken, was toen de industrie overstapte van enkele kern- naar multi-core-architecturen, en op dat moment duurde het 10 jaar voordat software werkte en mensen het gebruikten. We kunnen niet 10 jaar wachten om software voor heterogeniteit op schaal uit te werken, het moet nu worden opgelost. En dus zijn we aan het werk gegaan om het probleem te begrijpen en wat nodig is om deze software-stack te laten bestaan.

We zijn momenteel in gesprek met veel van de toonaangevende halfgeleiderbedrijven en hyperscalers/wolken-dienstverleners en zullen onze software-stack binnen de komende 12 maanden uitbrengen. Het is een uniform programmeringsmodel met een compiler en runtime die in staat zijn om elke soort architectuur aan te sturen, en om werk te coördineren over clusters die bestaan uit verschillende soorten hardware, en die in staat zijn om te schalen van een enkele knooppunt tot een cluster van duizend knooppunten voor de hoogst mogelijke prestaties.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Lemurian Labs bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.