Intervjuer
Lin Qiao, CEO og medgrunnlegger av Fireworks AI – Intervju-serie

Lin Qiao var tidligere sjef for Metas PyTorch og er medgrunnlegger og CEO av Fireworks AI. Fireworks AI er en produksjonsplattform for kunstig intelligens som er bygget for utviklere, og Fireworks samarbeider med verdens ledende forskere innen generativ kunstig intelligens for å tilby de beste modellene med de raskeste hastighetene. Fireworks AI har nylig samlet inn 25 millioner dollar i serie A-finansiering.
Hva var det som først tiltalte deg til datavitenskap?
Min far var en meget senior maskiningeniør på et verft, der bygget lasteskip fra scratch. Fra en ung alder lærte jeg å lese de nøyaktige vinklene og målingene på skipets tegninger, og jeg elsket det.
Jeg var meget interessert i STEM fra middelskolen og utover – alt som hadde med matematikk, fysikk og kjemi å gjøre, slukt jeg i meg. En av mine oppgaver på videregående skole var å lære BASIC-programmering, og jeg kodet et spill om en slange som spiste sin egen hale. Etter det visste jeg at datavitenskap var fremtiden min.
Mens du var hos Meta, ledet du over 300 verdensklasseingeniører innen AI-rammeverk og -plattformer, hvor du bygget og deployerte Caffe2 og senere PyTorch. Hva var noen av dine viktigste erfaringer fra denne perioden?
Stor teknologi-selskaper som Meta er alltid fem eller flere år foran kurven. Da jeg begynte hos Meta i 2015, var vi i begynnelsen av vår AI-reise – vi gikk fra å bruke CPU til GPU. Vi måtte designe AI-infrastrukturen fra bunnen av. Modeller som Caffe2 var banebrytende da de ble laget, men AI utviklet seg så raskt at de raskt ble foreldet. Vi utviklet PyTorch og hele systemet rundt det som en løsning.
PyTorch er der jeg lærte om de største hindringene utviklere møter i kappløpet om å bygge AI. Den første utfordringen er å finne stabile og pålitelige modellarkitekturer som er lav latency og fleksible, så modellene kan skaleres. Den andre utfordringen er total kostnad, så selskaper ikke går konkurs når de prøver å vokse sine modeller.
Min tid hos Meta viste meg hvor viktig det er å holde modeller og rammeverk som PyTorch åpne. Det oppmuntrer til innovasjon. Vi ville ikke ha vokst like mye som vi gjorde med PyTorch uten åpne muligheter for iterasjon. Pluss, det er umulig å holde oss oppdatert på all den nyeste forskningen uten samarbeid.
Kan du diskutere hva som ledet til at du startet Fireworks AI?
Jeg har vært i teknologi-bransjen i over 20 år, og jeg har sett bølge etter bølge av bransje-omstilling – fra skyen til mobile apper. Men denne AI-omstillingen er en fullstendig tektonisk omstilling. Jeg så mange selskaper som kjempet med denne endringen. Alle ville flytte raskt og sette AI først, men de manglet infrastrukturen, ressursene og talentene til å gjøre det skje. Jo mer jeg snakket med disse selskapene, jo mer jeg forstod at jeg kunne løse dette gapet i markedet.
Jeg startet Fireworks AI både for å løse dette problemet og som en utvidelse av det fantastiske arbeidet vi gjorde hos PyTorch. Det inspirerte sogar vårt navn! PyTorch er fakkelen som holder ilden – men vi ønsker at denne ilden skal spre seg overalt. Derfor: Fireworks.
Jeg har alltid vært lidenskapelig opptatt av å demokratisere teknologi, og gjøre det tilgjengelig og enkelt for utviklere å innovere uavhengig av ressursene deres. Derfor har vi en så brukervennlig grensesnitt og sterke støttesystemer for å gi utviklere mulighet til å realisere sine visjoner.
Kan du diskutere hva utvikler-sentrert AI er og hvorfor dette er så viktig?
Det er enkelt: «utvikler-sentrert» betyr å prioritere utvikleres behov. For eksempel: å lage verktøy, samfunn og prosesser som gjør utviklere mer effektive og selvstendige.
Utvikler-sentrerte AI-plattformer som Fireworks bør integreres i eksisterende arbeidsflyter og teknologistacker. De bør gjøre det enkelt for utviklere å eksperimentere, gjøre feil og forbedre sitt arbeid. De bør oppmuntre til tilbakemeldinger, fordi det er utviklerne selv som forstår hva de trenger for å være suksessfulle. Til slutt handler det om mer enn bare å være en plattform. Det handler om å være et samfunn – et samfunn hvor samarbeidende utviklere kan pushe grensene for hva som er mulig med AI.
Den GenAI-plattformen du har utviklet er en betydelig fremgang for utviklere som arbeider med store språkmodeller (LLM). Kan du forklare de unike egenskapene og fordelene med din plattform, særlig i sammenligning med eksisterende løsninger?
Vår hele tilnærming som en AI-produksjonsplattform er unik, men noen av våre beste egenskaper er:
Effektiv inferens – Vi har designet Fireworks AI for effektivitet og hastighet. Utviklere som bruker vår plattform kan kjøre sine LLM-applikasjoner med den laveste mulige latensen og kostnaden. Vi oppnår dette med de nyeste modell- og tjenesteoptimeringsteknikkene, inkludert prompt-caching, adaptable sharding, kvantisering, kontinuerlig batching, FireAttention og mer.
Rimelig støtte for LoRA-justerte modeller – Vi tilbyr rimelig tjeneste for lav-rank-adaptasjon (LoRA) justerte modeller via multi-tenancy på basis-modeller. Dette betyr at utviklere kan eksperimentere med mange forskjellige brukssager eller variasjoner av samme modell uten å bryte banken.
Enkle grensesnitt og API-er – Våre grensesnitt og API-er er rett frem og enkle for utviklere å integrere i sine applikasjoner. Våre API-er er også OpenAI-kompatible for enkel migrering.
Ferdige modeller og justerte modeller – Vi tilbyr over 100 forhånds-trente modeller som utviklere kan bruke rett ut av boksen. Vi dekker de beste LLM, bilde-genereringsmodellene, innbedningsmodellene osv. Men utviklere kan også velge å hoste og tjene sine egne tilpassede modeller. Vi tilbyr også selvbetjente justerings-tjenester for å hjelpe utviklere til å tilpasse disse tilpassede modellene med deres eget proprietære data.
Samarbeid i samfunnet: Vi tror på åpne kilders samarbeids-ethos. Vår plattform oppmuntrer (men krever ikke) utviklere til å dele sine justerte modeller og bidra til en voksende bank av AI-aktiva og kunnskap. Alle drar nytte av å vokse vår kollektive ekspertise.
Kan du diskutere den hybride tilnærmingen som tilbys mellom modell-parallellisering og data-parallellisering?
Parallellisering av maskinlæringmodeller forbedrer effektiviteten og hastigheten på modell-trening og hjelper utviklere å håndtere større modeller enn en enkelt GPU kan prosessere.
Modell-parallellisering innebærer å dele en modell inn i flere deler og trene hver del på separate prosessorer. På den andre siden, deler data-parallellisering datasett inn i undersett og trener en modell på hver undersett samtidig på separate prosessorer. En hybrid tilnærming kombinerer disse to metodene. Modeller deles inn i separate deler, som hver blir trent på forskjellige undersett av data, og forbedrer effektiviteten, skalerbarheten og fleksibiliteten.
Fireworks AI brukes av over 20 000 utviklere og tjener nå over 60 milliarder token daglig. Hva er noen av de største utfordringene du har møtt når du skal skalerer dine operasjoner til dette nivået, og hvordan har du overvunnet dem?
Jeg skal være ærlig, det har vært mange høye fjell å klatre siden vi grunnla Fireworks AI i 2022.
Våre kunder kom først til oss og søkte etter svært lav latency-støtte fordi de bygget applikasjoner for enten forbrukere, prosumere eller andre utviklere – alle målgrupper som trenger raske løsninger. Deretter, når våre kunders applikasjoner begynte å skalerer raskt, innsett de at de ikke kunne betale de typiske kostnadene forbundet med denne skaleringen. De ba oss deretter om å hjelpe med å senke total kostnad (TCO), og vi gjorde det. Deretter ønsket våre kunder å migrere fra OpenAI til OSS-modeller, og de ba oss om å tilby like gode eller bedre kvalitet enn OpenAI. Vi gjorde det også.
Hver skritt i vår produkts utvikling var et utfordrende problem å løse, men det betydde at våre kunders behov virkelig formet Fireworks til å bli det den er i dag: en lyn-rask inferens-motor med lav TCO. Pluss, vi tilbyr både en rekke høykvalitets, ferdige modeller å velge mellom, eller justerings-tjenester for utviklere å lage sine egne.
Med de raske fremstegene innen AI og maskinlæring, er etiske overveielser viktigere enn noensinne. Hvordan håndterer Fireworks AI bekymringer relatert til bias, personvern og etisk bruk av AI?
Jeg har to tenåringer som ofte bruker genAI-applikasjoner som ChatGPT. Som mor, bekymrer jeg meg for at de finner misvisende eller upassende innhold, fordi bransjen bare begynner å takle det kritiske problemet med innholdssikkerhet. Meta gjør mye med Purple Llama-prosjektet, og Stability AIs nye SD3-moduser er flotte. Begge selskaper jobber hardt for å bringe sikkerhet til sine nye Llama3- og SD3-modeller med flere lag med filtre. Input-output-sikkerhetsmodellen, Llama Guard, får en god del bruk på vår plattform, men dens adopsjon er ikke på linje med andre LLM-er ennå. Bransjen som helhet har ennå langt igjen å gå for å bringe innholdssikkerhet og AI-etikk til fremtreden.
Vi på Fireworks bryr oss dypt om personvern og sikkerhet. Vi er HIPAA- og SOC2-kompatible, og tilbyr sikker VPC- og VPN-tilkobling. Selskaper stoler på Fireworks med sine proprietære data og modeller for å bygge sin forretnings-mur.
Hva er din visjon for hvordan AI vil utvikle seg?
Akkurat som AlphaGo viste autonomi mens det lærte å spille sjakk på egen hånd, tror jeg vi vil se genAI-applikasjoner bli mer og mer autonome. Applikasjoner vil automatisk dirigere og dirigere forespørsler til riktig agent eller API for å prosessere, og korrigere kursen til de henter riktig utgang. Og i stedet for at en funksjonskallende modell poller fra andre som en kontroller, vil vi se mer selv-organiserte, selv-koordinerte agenter som arbeider i samspill for å løse problemer.
Fireworks’ lyn-raske inferens, funksjonskallende modeller og justerings-tjenester har banet vei for denne virkeligheten. Nå er det opp til innovative utviklere å gjøre det skje.
Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Fireworks AI.












