Entretiens
Alex Ratner, PDG et co-fondateur de Snorkel AI – Série d’entretiens

Alex Ratner est le PDG et co-fondateur de Snorkel AI, une entreprise née du laboratoire d’IA de Stanford.
Snorkel AI rend le développement de l’IA rapide et pratique en transformant les processus de développement manuels de l’IA en solutions programmatiques. Snorkel AI permet aux entreprises de développer une IA qui fonctionne pour leurs charges de travail uniques en utilisant leurs données et connaissances propriétaires 10 à 100 fois plus rapidement.
Qu’est-ce qui vous a initialement attiré vers l’informatique ?
Il y a deux aspects très excitants de l’informatique lorsque vous êtes jeune. Premièrement, vous pouvez apprendre aussi vite que vous le souhaitez en bricolant et en construisant, grâce aux retours immédiats, plutôt que de devoir attendre un enseignant. Deuxièmement, vous pouvez construire beaucoup sans avoir à demander la permission à qui que ce soit !
J’ai commencé à programmer lorsque j’étais un jeune garçon pour ces raisons. J’aimais également la précision qu’elle nécessitait. J’ai apprécié le processus d’abstraction de processus et de routines complexes, puis de les encoder de manière modulaire.
Plus tard, en tant qu’adulte, je me suis retrouvé dans l’informatique professionnellement via un emploi dans le conseil où j’ai été chargé d’écrire des scripts pour effectuer certaines analyses de base du corpus des brevets. J’étais fasciné par la quantité de connaissances humaines – tout ce que quelqu’un avait jamais considéré comme brevetable – qui était facilement accessible, mais si inaccessible parce qu’il était si difficile de faire même les analyses les plus simples sur des textes techniques complexes et des données multimodales.
C’est ce qui m’a ramené dans le domaine de l’informatique, et finalement, à la faculté de Stanford, où j’ai étudié le traitement automatique des langues, qui est le domaine de l’utilisation de l’apprentissage automatique et de l’IA sur la langue naturelle.
Vous avez initié et dirigé le projet open-source Snorkel pendant que vous étiez à Stanford, pouvez-vous nous décrire le parcours de ces premiers jours ?
À l’époque, nous nous concentrions, comme beaucoup dans l’industrie, sur le développement de nouveaux algorithmes et – c’est-à-dire toutes les choses “fancy” de l’apprentissage automatique que les gens de la communauté faisaient des recherches et publiaient des articles sur.
Cependant, nous étions toujours très attachés à ancrer cela dans des problèmes du monde réel – principalement avec des médecins et des scientifiques de Stanford. Mais chaque fois que nous présentions un nouveau modèle ou un algorithme, la réponse devenait « oui, nous essayerions cela, mais nous aurions besoin de toutes ces données d’entraînement étiquetées que nous n’avons pas le temps de créer ! »
Nous voyions que le grand problème non dit était autour du processus d’étiquetage et de curation de ces données d’entraînement – c’est ainsi que le projet Snorkel et l’idée de “data-centric AI” ont commencé.
Snorkel a une approche d’IA centrée sur les données, pouvez-vous définir ce que cela signifie et comment cela diffère de l’approche de développement d’IA centrée sur les modèles ?
L’IA centrée sur les données signifie se concentrer sur la construction de meilleures données pour construire de meilleurs modèles.
Cela s’oppose – mais fonctionne main dans la main avec – l’IA centrée sur les modèles. Dans l’IA centrée sur les modèles, les scientifiques des données ou les chercheurs supposent que les données sont statiques et consacrent leur énergie à ajuster les architectures et les paramètres des modèles pour obtenir de meilleurs résultats.
Les chercheurs font toujours un excellent travail dans l’IA centrée sur les modèles, mais les modèles prêts à l’emploi et les techniques d’apprentissage automatique ont tellement amélioré que le choix du modèle est devenu banalisé au moment de la production. Lorsque c’est le cas, la meilleure façon d’améliorer ces modèles est de leur fournir plus de données et de meilleures données.
Quels sont les principes fondamentaux d’une approche d’IA centrée sur les données ?
Le principe fondamental de l’IA centrée sur les données est simple : de meilleures données construisent de meilleurs modèles.
Dans nos travaux universitaires, nous avons appelé cela “programmation de données”. L’idée est que si vous alimentez un modèle robuste avec suffisamment d’exemples d’entrées et de sorties attendues, le modèle apprend à dupliquer ces modèles.
Cela présente un défi plus grand que vous pourriez le penser. La grande majorité des données n’a pas d’étiquettes – ou, du moins, pas d’étiquettes utiles pour votre application. Étiqueter ces données à la main nécessite de la monotonie, du temps et des efforts humains.
Avoir un ensemble de données étiquetées ne garantit pas non plus la qualité. Les erreurs humaines se glissent partout. Chaque exemple incorrect dans votre vérité de base dégradera les performances du modèle final. Aucun réglage de paramètres ne peut masquer cette réalité. Les chercheurs ont même trouvé des enregistrements incorrectement étiquetés dans des ensembles de données open source fondamentaux.
Pouvez-vous élaborer sur ce que signifie pour l’IA centrée sur les données d’être programmatique ?
Étiqueter manuellement les données présente de sérieux défis. Cela nécessite beaucoup d’heures humaines, et parfois ces heures humaines peuvent être coûteuses. Les documents médicaux, par exemple, ne peuvent être étiquetés que par des médecins.
En outre, les sprints d’étiquetage manuel s’apparentent souvent à des projets à usage unique. Les étiqueteurs annotent les données selon un schéma rigide. Si les besoins d’une entreprise changent et nécessitent un différent ensemble d’étiquettes, les étiqueteurs doivent recommencer à zéro.
Les approches programmatiques de l’IA centrée sur les données minimisent ces deux problèmes. Le système d’étiquetage programmatique de Snorkel AI intègre des signaux diversifiés – des modèles existants aux étiquettes existantes et aux bases de connaissances externes – pour développer des étiquettes probabilistes à grande échelle. Notre source principale de signal provient d’experts dans le domaine qui collaborent avec des scientifiques des données pour construire des fonctions d’étiquetage. Ces fonctions encodent leur jugement expert dans des règles évolutives, permettant ainsi à l’effort investi dans une décision d’avoir un impact sur des dizaines ou des centaines de points de données.
Ce cadre est également flexible. Au lieu de recommencer à zéro lorsque les besoins de l’entreprise changent, les utilisateurs ajoutent, suppriment et ajustent les fonctions d’étiquetage pour appliquer de nouvelles étiquettes en quelques heures au lieu de jours.
Comment cette approche centrée sur les données permet-elle une mise à l’échelle rapide des données non étiquetées ?
<p Notre approche programmatique de l'IA centrée sur les données permet une mise à l'échelle rapide des données non étiquetées en amplifiant l'impact de chaque choix. Une fois que les experts dans le domaine établissent un petit ensemble initial de vérité de base, ils commencent à collaborer avec des scientifiques des données pour une itération rapide. Ils définissent quelques fonctions d'étiquetage, entraînent un modèle rapide, analysent l'impact de leurs fonctions d'étiquetage, puis ajoutent, suppriment ou ajustent les fonctions d'étiquetage au besoin.
Chaque cycle améliore les performances du modèle jusqu’à ce qu’il atteigne ou dépasse les objectifs du projet. Cela peut réduire des mois de travail d’étiquetage de données à quelques heures. Dans un projet de recherche Snorkel, deux de nos chercheurs ont étiqueté 20 000 documents en une seule journée – un volume qui aurait pu prendre des semaines ou plus à des étiqueteurs manuels.
Snorkel propose plusieurs solutions d’IA, notamment Snorkel Flow, Snorkel GenGlow et Snorkel Foundry. Quelles sont les différences entre ces offres ?
La suite Snorkel AI permet aux utilisateurs de créer des fonctions d’étiquetage (par exemple, recherche de mots clés ou de modèles dans des documents) pour étiqueter de manière programmatique des millions de points de données en quelques minutes, plutôt que d’étiqueter manuellement un point de données à la fois.
Elle compressé le temps nécessaire aux entreprises pour traduire leurs données propriétaires en modèles prêts à la production et commencer à en extraire de la valeur. Snorkel AI permet aux entreprises de mettre à l’échelle les approches avec un humain dans la boucle en incorporant efficacement le jugement humain et les connaissances d’experts dans le domaine.
Cela conduit à une IA plus transparente et plus explicative, équipant les entreprises pour gérer les préjugés et fournir des résultats responsables.
En descendant dans le détail, Snorkel AI permet aux entreprises du Fortune 500 de :
- Développer des données étiquetées de haute qualité pour entraîner des modèles ou améliorer la génération de réponses aux questions;
- Personnaliser les modèles de langage avec un affinage;
- Distiller les modèles de langage en modèles spécialisés qui sont beaucoup plus petits et moins coûteux à exploiter;
- Construire des modèles de langage spécifiques au domaine et à la tâche avec une pré-formation.
Vous avez écrit certains articles révolutionnaires, selon vous, lequel est le plus important ?
L’un des articles clés était le premier sur la programmation de données (étiquetage des données d’entraînement de manière programmatique) et sur celui de Snorkel.
Quelle est votre vision pour l’avenir de Snorkel ?
Je vois Snorkel devenir un partenaire de confiance pour toutes les grandes entreprises qui sont sérieuses à propos de l’IA.
Snorkel Flow devrait devenir un outil omniprésent pour les équipes de sciences des données des grandes entreprises – qu’elles soient en train d’affiner des modèles de langage personnalisés pour leurs organisations, de construire des modèles de classification d’images ou de construire des modèles de régression logistique simples et déployables.
Quels que soient les types de modèles dont une entreprise a besoin, ils auront besoin de données étiquetées de haute qualité pour les entraîner.
Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Snorkel AI,












