Entretiens

Roshanak Houmanfar, VP de produits d’apprentissage automatique chez Integrate.ai – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Roshanak (Ro) Houmanfar est la VP des produits d’apprentissage automatique pour integrate.ai, une entreprise qui aide les développeurs à résoudre les problèmes les plus importants du monde sans risquer les données sensibles. Ro a un don particulier pour trouver de nouvelles façons de simplifier les concepts complexes d’IA et de les relier aux besoins des utilisateurs. En exploitant cette expertise, elle est à la pointe de la mission d’Integrate.ai pour démocratiser l’accès à la technologie améliorant la confidentialité.

Qu’est-ce qui vous a initialement attiré vers la science des données et l’apprentissage automatique ?

J’ai commencé mon parcours dans la robotique. Après avoir expérimenté les différents angles de la robotique, et avoir incendié un laboratoire de soudage, j’en suis venue à la conclusion que j’étais plus attirée par le côté intelligence artificielle de mon domaine, et que cela m’a menée au merveilleux monde de l’apprentissage automatique.

Pouvez-vous décrire votre rôle actuel et ce à quoi ressemble une journée typique pour vous ?

Je suis la VP de produit chez integrate.ai, une entreprise SaaS qui aide les développeurs à résoudre les problèmes les plus importants du monde sans risquer les données sensibles. Nous construisons des outils pour l’apprentissage automatique et l’analyse de données en toute sécurité pour l’avenir distribué des données.

Dans mon travail quotidien, je collabore avec nos équipes à travers les fonctions pour atteindre trois objectifs :

Réfléchir à ce que pourrait être l’avenir de l’intelligence et comment nous pouvons façonner cet avenir pour que l’intelligence résolve les problèmes les plus critiques

Comprendre les points de douleur de nos clients et comment nous pouvons innover pour rendre leur travail plus impactant et efficace.

Veiller à ce que notre vision et les commentaires de nos clients soient toujours pris en compte dans le développement de produits, en travaillant en collaboration avec nos équipes pour livrer les meilleures fonctionnalités.

Les données synthétiques sont actuellement très à la mode dans l’apprentissage automatique, mais Integrate.ai adopte une approche un peu contre-intuitive. Quelles sont les applications où les données synthétiques peuvent ne pas être une option souhaitable ?

Pour comprendre quand les données synthétiques ne sont pas la meilleure solution, il est important de comprendre d’abord quand elles le sont. Les données synthétiques sont les meilleures lorsque la cible de modélisation a soit un petit montant de données réelles disponibles, soit aucune – par exemple, dans les problèmes de démarrage à froid et la formation de modèles basés sur du texte et des images. Parfois, il n’y a simplement pas suffisamment de données pour former un modèle, ce qui est le cas où les données synthétiques brillent comme solution.

Cependant, les données synthétiques sont de plus en plus utilisées dans des situations où de nombreuses données réelles existent, mais que ces données sont cloisonnées en raison de réglementations sur la confidentialité, de coûts de centralisation ou d’autres obstacles à l’interopérabilité. C’est une utilisation abusive des données synthétiques. Dans ces cas d’utilisation, il est difficile de déterminer le niveau d’abstraction approprié pour la création de données synthétiques, ce qui entraîne des données synthétiques de mauvaise qualité qui peuvent causer des biais innés ou d’autres problèmes plus tard qui sont difficiles à déboguer. De plus, les modèles formés sur des données synthétiques ne sont pas comparables à ceux formés sur des données réelles de haute qualité et granulaires.

Integrate.ai se spécialise dans l’offre de solutions d’apprentissage fédéré, pouvez-vous décrire ce qu’est l’apprentissage fédéré ?

Dans l’apprentissage automatique traditionnel, toutes les données de formation de modèles doivent être centralisées dans une base de données. Avec l’apprentissage fédéré, les modèles peuvent être formés sur des ensembles de données décentralisés ou des données qui résident dans deux bases de données ou plus et ne peuvent pas être facilement déplacées. Voici comment cela fonctionne : des parties d’un modèle d’apprentissage automatique sont formées là où se trouvent les données, et les paramètres de modèle sont partagés entre les ensembles de données participants pour produire un modèle global amélioré. Et comme aucune donnée ne se déplace dans le système, les organisations peuvent former des modèles sans obstacles tels que les réglementations sur la confidentialité et la sécurité, les coûts ou d’autres préoccupations de centralisation.

En général, les données de formation accessibles avec l’apprentissage fédéré sont de beaucoup meilleure qualité, car les données centralisées ont tendance à perdre une partie de leur granularité au profit de la facilité d’accès à un emplacement.

Comment une entreprise identifie-t-elle les meilleurs cas d’utilisation pour l’apprentissage fédéré ?

L’apprentissage fédéré est une pile technologique d’apprentissage automatique conçue pour les situations où l’accès aux données ou leur intégration dans l’infrastructure traditionnelle de l’apprentissage automatique avec des lacs de données centralisés est douloureux. Si vous rencontrez l’un des symptômes suivants, l’apprentissage fédéré est pour vous :

  • Vous fournissez des produits intelligents alimentés par l’analyse et l’apprentissage automatique et vous ne pouvez pas créer des effets de réseau pour vos produits car les données appartiennent à vos clients.
  • Vous travaillez sur de longs accords de service ou des accords de partage de données pour accéder aux données de vos partenaires.
  • Vous passez beaucoup de temps à former des contrats de collaboration avec vos partenaires, en particulier dans les situations où le résultat de cette association de données est incertain pour vous.
  • Vous disposez d’une richesse de données et vous souhaitez les monétiser, mais vous avez peur des implications pour votre réputation.
  • Vous monétisez déjà vos données, mais vous passez beaucoup de temps, d’efforts et d’argent pour les rendre sécurisées pour le partage.
  • Votre infrastructure a été laissée en arrière pendant le passage au cloud, mais vous avez toujours besoin d’analyse et d’apprentissage automatique.
  • Vous avez de nombreuses filiales qui appartiennent à la même organisation, mais qui ne peuvent pas partager directement de données les unes avec les autres.
  • Les ensembles de données avec lesquels vous travaillez sont trop grands ou coûteux pour être déplacés, vous avez donc décidé de ne pas les utiliser ou vos pipelines ETL coûtent cher.
  • Vous avez une application ou une opportunité que vous pensez pouvoir avoir un impact significatif, mais vous n’avez pas les données pour la rendre possible.
  • Vos modèles d’apprentissage automatique ont atteint un plateau et vous ne savez pas comment les améliorer davantage.

La confidentialité différentielle est souvent utilisée en conjonction avec l’apprentissage fédéré, qu’est-ce que c’est spécifiquement ?

La confidentialité différentielle est une technique pour garantir la confidentialité tout en exploitant le pouvoir de l’apprentissage automatique. En utilisant des mathématiques différentes de celles des techniques standard de dé-identification, la confidentialité différentielle ajoute du bruit pendant la formation de modèles locaux, préservant la plupart des caractéristiques statistiques du jeu de données tout en limitant le risque que les données d’un individu soient identifiées.

Dans les implémentations idéales, la confidentialité différentielle ramène le risque à presque zéro, tandis que les modèles d’apprentissage automatique maintiennent des performances similaires – fournissant ainsi toute la sécurité nécessaire pour la dé-identification des données, sans réduire la qualité des résultats du modèle.

La confidentialité différentielle est incluse par défaut dans la plate-forme d’Integrate.ai, de sorte que les développeurs puissent s’assurer que les données individuelles ne peuvent pas être déduites de leurs paramètres de modèle.

Pouvez-vous décrire comment fonctionne la plate-forme d’apprentissage fédéré d’Integrate.ai ?

<p Notre plate-forme utilise les technologies d'apprentissage fédéré et de confidentialité différentielle pour débloquer une gamme de capacités d'apprentissage automatique et d'analyse sur des données qui seraient autrement difficiles ou impossibles à accéder en raison de la confidentialité, de la confidentialité ou d'obstacles techniques. Les opérations telles que la formation de modèles et l'analyse sont effectuées localement, et seuls les résultats finaux sont agrégés de manière sécurisée et confidentielle.

Integrate.ai est conditionné comme un outil pour les développeurs, permettant aux développeurs d’intégrer ces capacités dans presque toute solution avec un kit de développement logiciel (SDK) facile à utiliser et un service cloud de gestion complète. Une fois la plate-forme intégrée, les utilisateurs finals peuvent collaborer sur des ensembles de données sensibles tout en conservant le contrôle total. Les solutions qui intègrent Integrate.ai peuvent servir d’outils d’expérimentation efficaces et de services prêts pour la production.

Quels sont les exemples d’utilisation de cette plate-forme dans le domaine du diagnostic de précision ?

L’un des réseaux de partenaires avec lesquels nous travaillons, l’Autism Sharing Initiative, collecte des informations relatives au diagnostic de l’autisme ainsi que des échantillons de données génomiques pour comprendre les liens entre les différents génotypes et phénotypes et les diagnostics d’autisme. Chaque site de données individuel n’a pas suffisamment de jeux de données pour que les modèles d’apprentissage automatique fonctionnent, mais collectivement, ils créent une taille d’échantillon significative. Cependant, déplacer des données pose un risque élevé pour la sécurité et la confidentialité, et en raison des réglementations et des politiques hospitalières, ces instituts de recherche ont toujours fait défaut pour ne pas partager.

Dans un autre réseau, avec une configuration similaire, les chercheurs sont intéressés à améliorer l’attribution des essais cliniques aux patients en utilisant une vision plus holistique de l’historique de chaque patient.

Les différents instituts de recherche impliqués ont accès à des informations différentes sur chaque patient – un laboratoire a accès à leurs scans médicaux, un autre laboratoire a accès à leurs informations génomiques, et un autre institut a leurs résultats d’essais cliniques. Mais ces différentes organisations ne peuvent pas partager directement d’informations les unes avec les autres.

Avec la solution Integrate.ai, chaque organisation peut accéder aux données des autres pour leurs objectifs sans déplacer les données loin des gardiens de données et donc en respectant leurs politiques internes.

Pouvez-vous discuter de l’importance de rendre la confidentialité compréhensible et de la manière dont Integrate.ai permet cela ?

Rendre la confidentialité compréhensible signifie ouvrir de nombreuses portes aux entreprises et aux organisations qui étaient historiquement fermées en raison de la nature ambiguë du risque. Les réglementations sur la confidentialité telles que le RGPD, le CCPA et le HIPAA sont incroyablement complexes et peuvent varier en fonction de l’industrie, de la région et du type de données, ce qui rend difficile pour les organisations de déterminer quels projets de données sont sécurisés en matière de confidentialité. Plutôt que de perdre du temps et des ressources pour vérifier chaque case, la plate-forme d’apprentissage fédéré d’Integrate.ai propose une confidentialité différentielle, un chiffrement homomorphique et un calcul multi-parties sécurisé, de sorte que les développeurs et les gardiens de données puissent se reposer sur le fait que leurs projets seront automatiquement conformes aux exigences réglementaires, sans les tracasseries de sauter d’une case à l’autre.

Y a-t-il autre chose que vous aimeriez partager sur Integrate.ai ?

La solution d’Integrate.ai est un outil incroyablement convivial pour les développeurs qui permet un apprentissage automatique et une analyse conformes et préservant la confidentialité sur les sources de données sensibles. Grâce à des API simples à utiliser, toute la complexité de la conformité réglementaire et des contrats sur les données sensibles est abstraite. La solution d’Integrate.ai permet aux scientifiques des données et aux développeurs de logiciels de gérer leurs charges de travail en toute sécurité avec un impact minimal sur leur infrastructure et leurs flux de travail actuels.

Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter integrate.ai.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.