Leaders d’opinion
Comment utiliser l’apprentissage profond avec de petites données ? – Leaders d’opinion

Lorsqu’il s’agit de suivre les tendances émergentes en matière de cybersécurité, le processus de suivi des derniers développements peut devenir fastidieux, car il y a beaucoup de nouvelles à suivre. Cependant, ces derniers temps, la situation a changé de manière significative, car les domaines de la cybersécurité semblent tourner autour de deux mots : l’apprentissage profond.
Bien que nous ayons initialement été surpris par la grande couverture que l’apprentissage profond recevait, il est rapidement devenu évident que le buzz généré par l’apprentissage profond était bien mérité. De manière similaire au cerveau humain, l’apprentissage profond permet à un modèle d’IA d’obtenir des résultats très précis, en effectuant des tâches directement à partir du texte, des images et des signaux audio.
Jusqu’à présent, il était largement admis que l’apprentissage profond repose sur un grand ensemble de données, similaire à l’ampleur des données hébergées par les géants de la Silicon Valley comme Google et Facebook pour atteindre l’objectif de résoudre les problèmes les plus complexes au sein d’une organisation. Contrairement à la croyance populaire, cependant, les entreprises peuvent exploiter le pouvoir de l’apprentissage profond, même avec un accès limité à des données.
Dans le but d’aider nos lecteurs à acquérir les connaissances nécessaires pour équiper leur organisation de l’apprentissage profond, nous avons compilé un article qui plonge au cœur (sans jeu de mots) de certaines des manières dont les entreprises peuvent utiliser les avantages de l’apprentissage profond malgré l’accès à des données limitées.
Mais avant de pouvoir aborder le fond de l’article, nous aimerions faire une petite suggestion, mais essentielle – commencez simplement. Cependant, avant de formuler des réseaux de neurones complexes enough pour figurer dans un film de science-fiction, commencez par expérimenter avec quelques modèles simples et conventionnels (par exemple, une forêt aléatoire) pour vous familiariser avec le logiciel.
Une fois cela établi, plongeons dans certaines des manières dont les entreprises peuvent intégrer la technologie d’apprentissage profond tout en ayant accès à des données limitées.
#1- Affiner le modèle de base:
Comme nous l’avons déjà mentionné ci-dessus, la première étape que les entreprises doivent prendre après avoir formulé un modèle de base d’apprentissage profond simple est de l’affiner pour le problème spécifique en question.
Cependant, affiner un modèle de base semble plus difficile sur le papier qu’il ne l’est en réalité. L’idée fondamentale derrière l’affinement d’un grand ensemble de données pour répondre aux besoins spécifiques d’une entreprise est simple – vous prenez un grand ensemble de données qui présente une certaine ressemblance avec le domaine dans lequel vous opérez, puis affinez les détails de l’ensemble de données original avec vos données limitées.
En ce qui concerne l’obtention de l’ensemble de données important, les propriétaires d’entreprise peuvent compter sur ImageNet, qui fournit également une solution facile pour tout problème de classification d’images. L’ensemble de données hébergé par ImageNet permet aux organisations d’accéder à des millions d’images, qui sont divisées en plusieurs classes d’images, ce qui peut être utile pour les entreprises issues de divers domaines, y compris, mais sans s’y limiter, des images d’animaux, etc.
Si le processus d’affinement d’un modèle pré-entraîné pour répondre aux besoins spécifiques de votre organisation vous semble encore trop difficile, nous vous recommandons de demander de l’aide sur Internet, car une simple recherche Google vous fournira des centaines de tutoriels sur la façon d’affiner un ensemble de données.
#2- Collecter plus de données:
Bien que le deuxième point de notre liste puisse sembler redondant pour certains de nos lecteurs les plus cyniques, le fait est que, lorsqu’il s’agit d’apprentissage profond, plus votre ensemble de données est important, plus vous êtes susceptible d’obtenir des résultats plus précis.
Bien que l’essence même de cet article réside dans la fourniture aux entreprises d’un ensemble de données limitées, nous avons souvent eu le déplaisir de rencontrer trop de “dirigeants” qui traitent l’investissement dans la collecte de données comme un péché cardinal.
Il est trop souvent que les entreprises tendent à négliger les avantages offerts par l’apprentissage profond, simplement parce qu’elles sont réticentes à investir du temps et des efforts dans la collecte de données. Si votre entreprise est incertaine quant à la quantité de données à collecter, nous vous suggérons de tracer des courbes d’apprentissage, à mesure que les données supplémentaires sont intégrées dans le modèle, et d’observer le changement dans les performances du modèle.
Contrairement à la croyance populaire des CSO et des CISO, parfois la meilleure façon de résoudre les problèmes est de collecter plus de données pertinentes. Le rôle du CSO et du CISO est extrêmement important dans ce cas, car il y a toujours une menace d’attaques cybernétiques. On a constaté qu’en 2019, les dépenses mondiales en matière de cybersécurité s’élevaient à 103,1 milliards de dollars, et ce chiffre continue d’augmenter. Pour mettre cela en perspective, considérons un exemple simple – imaginez que vous essayiez de classer des diamants rares, mais que vous avez accès à un ensemble de données très limité. Comme la solution la plus évidente au problème le dicte, au lieu de vous amuser avec le modèle de base, collectez simplement plus de données !
#3- Augmentation de données:
Bien que les deux premiers points que nous avons discutés ci-dessus soient tous deux très efficaces pour fournir une solution facile à la plupart des problèmes entourant la mise en œuvre de l’apprentissage profond dans les entreprises à données limitées, ils reposent lourdement sur une certaine dose de chance pour réussir.
Si vous n’avez pas de succès avec l’affinement d’un ensemble de données préexistant, nous vous recommandons d’essayer l’augmentation de données. Le processus d’augmentation de données est simple. À travers le processus d’augmentation de données, l’ensemble de données d’entrée est modifié ou augmenté de telle sorte qu’il donne une nouvelle sortie, sans changer la valeur de l’étiquette.
Pour mettre l’idée d’augmentation de données en perspective pour nos lecteurs, considérons une image d’un chien. Lorsqu’elle est tournée, le spectateur de l’image pourra toujours dire que c’est une image d’un chien. C’est exactement ce que l’augmentation de données bien faite cherche à accomplir, par opposition à une image tournée d’une route, qui change l’angle d’élévation et laisse beaucoup d’espace pour que l’algorithme d’apprentissage profond arrive à une conclusion incorrecte et contrecarre l’objectif de la mise en œuvre de l’apprentissage profond.
Lorsqu’il s’agit de résoudre des problèmes liés à la classification d’images, l’augmentation de données joue un rôle clé dans le domaine et propose diverses techniques d’augmentation de données qui aident le modèle d’apprentissage profond à acquérir une compréhension approfondie des différentes classifications d’images.
De plus, lorsqu’il s’agit d’augmenter les données, les possibilités sont virtuellement infinies. Les entreprises peuvent mettre en œuvre l’augmentation de données de diverses manières, qui incluent le traitement automatique du langage naturel (NLP) et l’expérimentation des GAN, qui permettent à l’algorithme de générer de nouvelles données.
#4- Mise en œuvre d’un effet d’ensemble:
La technologie derrière l’apprentissage profond dicte que le réseau est construit sur plusieurs couches. Cependant, contrairement à la croyance populaire maintenue par beaucoup, plutôt que de considérer chaque couche comme une “hiérarchie toujours croissante” de fonctionnalités, la dernière couche sert à offrir un mécanisme d’ensemble.
La croyance selon laquelle les entreprises ayant accès à un ensemble de données limité devraient opter pour la construction de leurs réseaux de neurones en profondeur a également été partagée dans un document NIPs, qui a fait écho à la croyance que nous avons exprimée ci-dessus. Les entreprises à données limitées peuvent facilement manipuler l’effet d’ensemble à leur avantage, simplement en construisant leurs réseaux d’apprentissage profond en profondeur, par affinement ou autre.
#5- Intégration d’auto-encodeurs:
Bien que le cinquième point que nous avons pris en considération ait reçu un succès relatif, nous sommes toujours partisans de l’utilisation d’auto-encodeurs pour pré-entraîner un réseau et l’initialiser correctement.
L’une des principales raisons, outre les attaques cybernétiques, pour lesquelles les entreprises échouent à surmonter les premiers obstacles de l’intégration de l’apprentissage profond, est due à une mauvaise initialisation et à ses nombreux pièges. Le pré-entraînement non supervisé conduit souvent à une exécution mauvaise ou incorrecte de la technologie d’apprentissage profond, c’est là que les auto-encodeurs peuvent briller.
La notion fondamentale derrière un réseau de neurones dicte la création d’un réseau de neurones qui prédit la nature de l’ensemble de données d’entrée. Si vous êtes incertain sur la façon d’utiliser un auto-encodeur, il existe plusieurs tutoriels en ligne qui donnent des instructions claires.
En conclusion:
À la fin de l’article, nous aimerions résumer ce que nous avons dit tout au long de l’article, avec une addition – l’intégration de connaissances spécifiques au domaine dans le processus d’apprentissage ! Non seulement l’intégration de connaissances précieuses accélère le processus d’apprentissage, mais elle permet également à la technologie d’apprentissage profond de produire de meilleurs résultats et plus précis.












