Entretiens
Lin Qiao, PDG et co-fondateur de Fireworks AI – Série d’entretiens

Lin Qiao, ancien responsable de PyTorch chez Meta, est le co-fondateur et PDG de Fireworks AI. Fireworks AI est une plateforme de production d’IA conçue pour les développeurs, qui s’associe aux meilleurs chercheurs en IA générative pour offrir les meilleurs modèles, à des vitesses les plus rapides. Fireworks AI a récemment levé un $25M Series A.
Qu’est-ce qui vous a initialement attiré vers l’informatique ?
Mon père était un ingénieur mécanique très senior dans un chantier naval, où il construisait des navires cargo à partir de zéro. Dès mon plus jeune âge, j’ai appris à lire les angles et les mesures précises des plans de navires, et j’aimais cela.
J’étais très intéressé par les STEM dès la classe moyenne – tout ce qui concernait les mathématiques, la physique et la chimie, je le dévorais. L’un de mes devoirs au lycée était d’apprendre la programmation BASIC, et j’ai codé un jeu sur un serpent qui mange sa queue. Après cela, j’ai su que l’informatique était dans mon avenir.
Pendant votre séjour chez Meta, vous avez dirigé plus de 300 ingénieurs de classe mondiale dans les frameworks et les plateformes d’IA, où vous avez construit et déployé Caffe2, puis PyTorch. Quelles étaient certaines de vos principales conclusions de cette expérience ?
Les grandes entreprises technologiques comme Meta sont toujours cinq ans ou plus en avance sur la courbe. Lorsque j’ai rejoint Meta en 2015, nous étions au début de notre parcours d’IA – en passant des CPU aux GPU. Nous devions concevoir les infrastructures d’IA à partir de zéro. Des modèles comme Caffe2 étaient révolutionnaires lorsqu’ils ont été créés, mais l’IA a évolué si rapidement qu’ils sont rapidement devenus obsolètes. Nous avons développé PyTorch et tout le système qui l’entoure comme solution.
PyTorch est où j’ai appris quels sont les plus grands obstacles auxquels les développeurs sont confrontés dans la course pour construire l’IA. Le premier défi est de trouver une architecture de modèle stable et fiable qui soit à faible latence et flexible, afin que les modèles puissent évoluer. Le deuxième défi est le coût total de possession, afin que les entreprises ne fassent pas faillite en essayant de développer leurs modèles.
Mon séjour chez Meta m’a montré à quel point il est important de garder les modèles et les frameworks comme PyTorch en open-source. Cela encourage l’innovation. Nous n’aurions pas autant grandi avec PyTorch sans les opportunités d’itération en open-source. De plus, il est impossible de rester à jour sur toutes les dernières recherches sans collaboration.
Pouvez-vous discuter de ce qui vous a conduit à lancer Fireworks AI ?
J’ai passé plus de 20 ans dans l’industrie technologique, et j’ai vu vague après vague de changements au niveau de l’industrie – du cloud aux applications mobiles. Mais ce changement d’IA est un réalignement tectonique complet. J’ai vu de nombreuses entreprises lutter avec ce changement. Tout le monde voulait avancer rapidement et donner la priorité à l’IA, mais ils manquaient d’infrastructures, de ressources et de talents pour le faire. Plus je parlais à ces entreprises, plus je me rendais compte que je pouvais résoudre ce problème du marché.
J’ai lancé Fireworks AI pour résoudre ce problème et servir de prolongement du travail incroyable que nous avons réalisé avec PyTorch. Cela a même inspiré notre nom ! PyTorch est la torche qui tient le feu – mais nous voulons que ce feu se propage partout. D’où : Fireworks.
Je suis toujours passionné par la démocratisation de la technologie, et je veux la rendre abordable et simple pour les développeurs afin qu’ils puissent innover, quel que soit leurs ressources. C’est pourquoi nous avons une interface utilisateur très conviviale et des systèmes de support solides pour permettre aux créateurs de réaliser leurs visions.
Pouvez-vous discuter de ce qu’est l’IA centrée sur le développeur et pourquoi cela est si important ?
C’est simple : « centré sur le développeur » signifie donner la priorité aux besoins des développeurs d’IA. Par exemple, créer des outils, des communautés et des processus qui rendent les développeurs plus efficaces et autonomes.
Les plateformes d’IA centrées sur le développeur comme Fireworks doivent s’intégrer dans les flux de travail et les piles technologiques existantes. Ils doivent rendre il simple pour les développeurs d’expérimenter, de faire des erreurs et d’améliorer leur travail. Ils doivent encourager les commentaires, car ce sont les développeurs eux-mêmes qui comprennent ce dont ils ont besoin pour réussir. Enfin, il s’agit de plus que d’être une plateforme. C’est une communauté – une communauté où les développeurs collaboratifs peuvent repousser les limites de ce qui est possible avec l’IA.
La plateforme GenAI que vous avez développée est une avancée significative pour les développeurs qui travaillent avec les grands modèles de langage (LLM). Pouvez-vous élaborer sur les fonctionnalités uniques et les avantages de votre plateforme, en particulier par rapport aux solutions existantes ?
Notre approche globale en tant que plateforme de production d’IA est unique, mais certaines de nos meilleures fonctionnalités sont :
Inférence efficace – Nous avons conçu Fireworks AI pour l’efficacité et la rapidité. Les développeurs qui utilisent notre plateforme peuvent exécuter leurs applications LLM à la latence la plus basse possible et au coût le plus bas. Nous y parvenons grâce aux dernières techniques d’optimisation de modèle et de service, y compris le cache de prompt, le sharding adaptable, la quantification, le batchage continu, FireAttention, et plus encore.
Prise en charge abordable des modèles LoRA – Nous offrons une prise en charge abordable des modèles LoRA (Low-Rank Adaptation) fine-tunés via une multi-locataire sur les modèles de base. Cela signifie que les développeurs peuvent expérimenter de nombreux cas d’utilisation ou variations sur le même modèle sans se ruiner.
Interfaces et API simples – Nos interfaces et API sont directes et faciles à intégrer dans les applications des développeurs. Nos API sont également compatibles OpenAI pour faciliter la migration.
Modèles prêts à l’emploi et modèles fine-tunés – Nous proposons plus de 100 modèles pré-entraînés que les développeurs peuvent utiliser directement. Nous couvrons les meilleurs LLM, les modèles de génération d’images, les modèles d’intégration, etc. Mais les développeurs peuvent également choisir d’héberger et de servir leurs propres modèles personnalisés. Nous proposons également des services de fine-tuning en libre-service pour aider les développeurs à adapter ces modèles personnalisés avec leurs données propriétaires.
Collaboration communautaire : Nous croyons en l’éthos open-source de collaboration communautaire. Notre plateforme encourage (mais n’exige pas) les développeurs à partager leurs modèles fine-tunés et à contribuer à une banque croissante d’actifs et de connaissances en IA. Tout le monde bénéficie de l’expertise collective grandissante.
Pouvez-vous discuter de l’approche hybride que vous proposez entre le parallélisme de modèle et le parallélisme de données ?
Le parallélisme des modèles d’apprentissage automatique améliore l’efficacité et la rapidité de la formation des modèles et aide les développeurs à gérer des modèles plus grands que ce que peut traiter un seul GPU.
Le parallélisme de modèle consiste à diviser un modèle en plusieurs parties et à former chaque partie sur des processeurs séparés. D’un autre côté, le parallélisme de données divise les ensembles de données en sous-ensembles et forme un modèle sur chaque sous-ensemble en même temps sur des processeurs séparés. Une approche hybride combine ces deux méthodes. Les modèles sont divisés en parties distinctes, qui sont formées sur des sous-ensembles de données différents, améliorant ainsi l’efficacité, la scalabilité et la flexibilité.
Fireworks AI est utilisé par plus de 20 000 développeurs et sert actuellement plus de 60 milliards de jetons par jour. Quels défis avez-vous rencontrés pour mettre à l’échelle vos opérations à ce niveau, et comment les avez-vous surmontés ?
Je serai honnête, il y a eu de nombreuses montagnes à gravir depuis que nous avons fondé Fireworks AI en 2022.
Nos clients sont venus à nous en recherchant une prise en charge à très faible latence, car ils construisent des applications pour les consommateurs, les prosumers ou d’autres développeurs – tous les publics qui ont besoin de solutions rapides. Lorsque les applications de nos clients ont commencé à évoluer rapidement, ils se sont rendu compte qu’ils ne pouvaient pas se permettre les coûts typiques associés à cette évolution. Ils nous ont alors demandé de les aider à réduire le coût total de possession (TCO), ce que nous avons fait. Ensuite, nos clients ont voulu migrer d’OpenAI vers des modèles OSS, et ils nous ont demandé de fournir une qualité équivalente ou supérieure à celle d’OpenAI. Nous avons rendu cela possible.
Chaque étape de l’évolution de notre produit a été un problème difficile à résoudre, mais cela signifiait que les besoins de nos clients ont véritablement façonné Fireworks en ce qu’il est aujourd’hui : un moteur d’inférence rapide avec un faible coût total de possession. De plus, nous proposons une sélection de modèles de haute qualité, prêts à l’emploi, à choisir, ou des services de fine-tuning pour que les développeurs puissent créer leurs propres modèles.
Avec les progrès rapides de l’IA et de l’apprentissage automatique, les considérations éthiques sont plus importantes que jamais. Comment Fireworks AI aborde-t-il les préoccupations liées aux préjugés, à la vie privée et à l’utilisation éthique de l’IA ?
J’ai deux filles adolescentes qui utilisent souvent des applications de genAI comme ChatGPT. En tant que mère, je m’inquiète de leur trouver du contenu trompeur ou inapproprié, car l’industrie commence à peine à résoudre le problème critique de la sécurité du contenu. Meta fait beaucoup avec le projet Purple Llama, et les nouveaux modes SD3 de Stability AI sont excellents. Les deux entreprises travaillent dur pour apporter la sécurité à leurs nouveaux modèles Llama3 et SD3 avec plusieurs couches de filtres. Le modèle de sauvegarde d’entrée-sortie, Llama Guard, est utilisé de manière significative sur notre plateforme, mais son adoption n’est pas à la hauteur des autres LLM. L’industrie dans son ensemble a encore un long chemin à parcourir pour apporter la sécurité du contenu et l’éthique de l’IA au premier plan.
Nous, chez Fireworks, nous soucions profondément de la vie privée et de la sécurité. Nous sommes conformes à la HIPAA et à la SOC2, et nous proposons une connectivité VPC et VPN sécurisée. Les entreprises font confiance à Fireworks pour leurs données et modèles propriétaires afin de construire leur avantage concurrentiel.
Quelle est votre vision de l’évolution de l’IA ?
Tout comme AlphaGo a démontré son autonomie en apprenant à jouer au chess par lui-même, je pense que nous verrons des applications de genAI devenir de plus en plus autonomes. Les applications seront capables de router et de diriger automatiquement les requêtes vers le bon agent ou API pour les traiter, et de corriger leur trajectoire jusqu’à ce qu’elles obtiennent la bonne sortie. Et au lieu d’un modèle à appels de fonction qui interroge les autres comme un contrôleur, nous verrons plus d’agents auto-organisés et auto-coordonnés travaillant en harmonie pour résoudre des problèmes.
Fireworks’ inférence rapide, les modèles à appels de fonction et le service de fine-tuning ont ouvert la voie à cette réalité. Maintenant, c’est aux développeurs innovants de la concrétiser.
Je vous remercie pour cette grande interview. Les lecteurs qui souhaitent en savoir plus peuvent visiter Fireworks AI.












