Interviews
Lin Qiao, CEO & Co-Founder van Fireworks AI – Interview Series

Lin Qiao was eerder hoofd van Meta’s PyTorch en is de mede-oprichter en CEO van Fireworks AI. Fireworks AI is een productie-AI-platform dat is gebouwd voor ontwikkelaars. Fireworks werkt samen met ‘s werelds toonaangevende generatieve AI-onderzoekers om de beste modellen te leveren op de snelste snelheden. Fireworks AI heeft onlangs een $25M Series A-investering ontvangen.
Wat trok je aanvankelijk aan tot informatica?
Mijn vader was een senior mechanisch ingenieur op een scheepswerf, waar hij vrachtschepen van scratch bouwde. Van jongs af aan leerde ik de precieze hoeken en maten van scheepsblauwdrukken lezen en ik vond het leuk.
Ik was al vanaf de middelbare school geïnteresseerd in STEM – alles over wiskunde, natuurkunde en scheikunde. Een van mijn opdrachten op de middelbare school was om BASIC-programmering te leren en ik programmeerde een spel over een slang die zijn eigen staart at. Daarna wist ik dat informatica mijn toekomst was.
Terwijl je bij Meta werkte, leidde je meer dan 300 wereldklasse-ingenieurs in AI-frameworks en -platforms, waar je Caffe2 en later PyTorch bouwde en implementeerde. Wat waren enkele van je belangrijkste inzichten uit deze ervaring?
Grote technologiebedrijven zoals Meta zijn altijd vijf jaar of meer voorop. Toen ik in 2015 bij Meta kwam, waren we aan het begin van onze AI-reis – we maakten de overstap van CPUs naar GPUs. We moesten de AI-infrastructuur van scratch ontwerpen. Modellen zoals Caffe2 waren baanbrekend toen ze werden gemaakt, maar AI evolueerde zo snel dat ze snel verouderd raakten. We ontwikkelden PyTorch en het hele systeem eromheen als oplossing.
PyTorch is waar ik leerde over de grootste obstakels waarmee ontwikkelaars te maken krijgen bij het bouwen van AI. De eerste uitdaging is het vinden van stabiele en betrouwbare modelarchitectuur die laagdrempelig en flexibel is, zodat modellen kunnen schalen. De tweede uitdaging is de totale kosten van eigendom, zodat bedrijven niet failliet gaan bij het groeien van hun modellen.
Mijn tijd bij Meta liet me zien hoe belangrijk het is om modellen en frameworks zoals PyTorch open-source te houden. Het moedigt innovatie aan. We zouden niet zo veel gegroeid zijn bij PyTorch zonder open-source-mogelijkheden voor iteratie. Bovendien is het onmogelijk om bij te blijven met de laatste onderzoeken zonder samenwerking.
Kun je vertellen wat je ertoe bracht om Fireworks AI te lanceren?
Ik ben meer dan 20 jaar actief in de technologie-industrie en ik heb golf na golf van industrie-brede verschuivingen gezien – van de cloud naar mobiele apps. Maar deze AI-verschuiving is een complete tectonische verschuiving. Ik zag veel bedrijven worstelen met deze verandering. Iedereen wilde snel bewegen en AI op de eerste plaats zetten, maar ze hadden geen infrastructuur, middelen of talent om het te laten gebeuren. Hoe meer ik met deze bedrijven sprak, hoe meer ik besefte dat ik deze marktkloof kon opvullen.
Ik lanceerde Fireworks AI om dit probleem op te lossen en als een uitbreiding van het geweldige werk dat we bereikt hadden bij PyTorch. Het inspireerde zelfs onze naam! PyTorch is de toorts die het vuur vasthoudt – maar we willen dat vuur overal laten verspreiden. Vandaar: Fireworks.
Ik ben altijd gepassioneerd geweest over het democratiseren van technologie en het maken van het betaalbaar en eenvoudig voor ontwikkelaars om te innoveren, ongeacht hun middelen. Daarom hebben we een gebruikersvriendelijke interface en sterke ondersteuningsystemen om ontwikkelaars in staat te stellen hun visie te verwezenlijken.
Kun je uitleggen wat ontwikkelaar-georiënteerde AI is en waarom dit zo belangrijk is?
Het is eenvoudig: “ontwikkelaar-georiënteerd” betekent dat de behoeften van AI-ontwikkelaars voorop staan. Bijvoorbeeld: het creëren van tools, gemeenschappen en processen die ontwikkelaars efficiënter en autonomer maken.
Ontwikkelaar-georiënteerde AI-platforms zoals Fireworks moeten integreren in bestaande workflows en technische stacks. Ze moeten het voor ontwikkelaars eenvoudig maken om te experimenteren, fouten te maken en hun werk te verbeteren. Ze moeten feedback aanmoedigen, omdat het de ontwikkelaars zelf zijn die begrijpen wat ze nodig hebben om succesvol te zijn. Ten slotte gaat het er niet alleen om een platform te zijn, maar om een gemeenschap te zijn – een waarin ontwikkelaars samenwerken om de grenzen van wat mogelijk is met AI te verleggen.
Het GenAI-platform dat je hebt ontwikkeld, is een significante vooruitgang voor ontwikkelaars die werken met grote taalmodellen (LLM’s). Kun je de unieke functies en voordelen van je platform uitleggen, vooral in vergelijking met bestaande oplossingen?
Onze hele benadering als AI-productieplatform is uniek, maar enkele van onze beste functies zijn:
Efficiënte inferentie – We hebben Fireworks AI ontworpen voor efficiëntie en snelheid. Ontwikkelaars die ons platform gebruiken, kunnen hun LLM-toepassingen uitvoeren met de laagst mogelijke latentie en kosten. We bereiken dit met de laatste model- en service-optimalisatietechnieken, waaronder prompt-caching, adaptable sharding, quantization, continue batching, FireAttention en meer.
Betaalbare ondersteuning voor LoRA-gefineerde modellen – We bieden betaalbare service van low-rank adaptation (LoRA) gefineerde modellen via multi-tenancy op basismodellen. Dit betekent dat ontwikkelaars kunnen experimenteren met veel verschillende use-cases of variaties op hetzelfde model zonder failliet te gaan.
Eenvoudige interfaces en API’s – Onze interfaces en API’s zijn rechttoe rechtaan en eenvoudig voor ontwikkelaars om te integreren in hun toepassingen. Onze API’s zijn ook OpenAI-compatibel voor een gemakkelijke migratie.
Kant-en-klare modellen en gefineerde modellen – We bieden meer dan 100 vooraf getrainde modellen die ontwikkelaars kunnen gebruiken uit de doos. We dekken de beste LLM’s, beeldgeneratiemodellen, embeddingmodellen, enz. Maar ontwikkelaars kunnen ook kiezen om hun eigen aangepaste modellen te hosten en te serveren. We bieden ook self-service fine-tuningdiensten om ontwikkelaars te helpen hun aangepaste modellen aan te passen met hun eigen gegevens.
Gemeenschaps-samenwerking: We geloven in de open-source-ethiek van gemeenschaps-samenwerking. Ons platform moedigt ontwikkelaars aan (maar vereist niet) om hun gefineerde modellen te delen en bij te dragen aan een groeiende bank van AI-middelen en -kennis. Iedereen heeft baat bij het groeien van onze collectieve expertise.
Kun je de hybride benadering uitleggen die wordt aangeboden tussen model-parallelisme en data-parallelisme?
Het paralleliseren van machine learning-modellen verbetert de efficiëntie en snelheid van modeltraining en helpt ontwikkelaars om grotere modellen te verwerken die een enkele GPU niet aankan.
Model-parallelisme houdt in dat een model in meerdere delen wordt verdeeld en elk deel op een aparte processor wordt getraind. Aan de andere kant verdeelt data-parallelisme datasets in subsets en traint een model op elk subset tegelijk op aparte processors. Een hybride benadering combineert deze twee methoden. Modellen worden verdeeld in afzonderlijke delen, die elk worden getraind op verschillende subsets van gegevens, waardoor de efficiëntie, schaalbaarheid en flexibiliteit worden verbeterd.
Fireworks AI wordt gebruikt door meer dan 20.000 ontwikkelaars en serveert momenteel meer dan 60 miljard tokens per dag. Wat waren enkele van de uitdagingen die je hebt ondervonden bij het opschalen van je operaties tot dit niveau, en hoe heb je ze overwonnen?
Ik zal eerlijk zijn, er waren veel hoge bergen om te beklimmen sinds we Fireworks AI in 2022 hebben opgericht.
Onze klanten kwamen eerst naar ons toe op zoek naar zeer lage latentie-ondersteuning omdat ze toepassingen voor consumenten, prosumers of andere ontwikkelaars bouwen – allemaal publiek dat snelle oplossingen nodig heeft. Toen de toepassingen van onze klanten snel begonnen te groeien, realiseerden ze zich dat ze de typische kosten die daarmee gemoeid zijn niet konden betalen. Ze vroegen ons vervolgens om te helpen bij het verlagen van de totale kosten van eigendom (TCO), wat we deden. Toen onze klanten wilden migreren van OpenAI naar OSS-modellen, vroegen ze ons om kwaliteit te bieden die gelijkwaardig was aan of beter was dan OpenAI. We maakten dat ook mogelijk.
Elke stap in de evolutie van ons product was een moeilijk probleem om aan te pakken, maar het betekende dat de behoeften van onze klanten Fireworks echt vorm gaven tot wat het vandaag is: een bliksemsnelle inferentie-engine met lage TCO. Bovendien bieden we zowel een assortiment van hoogwaardige, kant-en-klare modellen om uit te kiezen, als fine-tuningdiensten voor ontwikkelaars om hun eigen modellen te maken.
Met de snelle vooruitgang in AI en machine learning, zijn ethische overwegingen meer belangrijk dan ooit. Hoe gaat Fireworks AI om met zorgen over vooroordelen, privacy en het ethische gebruik van AI?
Ik heb twee tienerdochters die genAI-apps zoals ChatGPT vaak gebruiken. Als moeder maak ik me zorgen over het vinden van misleidende of ongepaste inhoud, omdat de industrie net begint om het kritieke probleem van inhoudsveiligheid aan te pakken. Meta doet veel met het Purple Llama-project, en Stability AI’s nieuwe SD3-modi zijn geweldig. Beide bedrijven werken hard om veiligheid te brengen naar hun nieuwe Llama3- en SD3-modellen met meerdere lagen filters. Het input-output-veiligheidsmodel, Llama Guard, krijgt een behoorlijke hoeveelheid gebruik op ons platform, maar de adoptie is nog niet gelijk aan die van andere LLM’s. De industrie als geheel heeft nog een lange weg te gaan om inhoudsveiligheid en AI-ethiek naar de voorgrond te brengen.
Wij bij Fireworks geven om privacy en beveiliging. We zijn HIPAA- en SOC2-compatibel en bieden beveiligde VPC- en VPN-verbindingen. Bedrijven vertrouwen Fireworks met hun eigen gegevens en modellen om hun bedrijfsvoordeel te bouwen.
Wat is je visie voor de toekomst van AI?
Net zoals AlphaGo autonomie demonstreerde bij het leren van schaken, denk ik dat we genAI-toepassingen zullen zien die steeds autonomer worden. Apps zullen automatisch aanvragen routeren en doorsturen naar de juiste agent of API om te verwerken, en bijsturen totdat ze de juiste output verkrijgen. En in plaats van één function-call-model dat poolt van anderen als controller, zullen we meer zelfgeorganiseerde, zelfgecoördineerde agenten zien die samenwerken om problemen op te lossen.
Fireworks’ bliksemsnelle inferentie, function-call-modellen en fine-tuningdienst hebben de weg vrijgemaakt voor deze realiteit. Nu is het aan innovatieve ontwikkelaars om het te laten gebeuren.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Fireworks AI bezoeken.












