ModÃĻles et plateformes dâIA
TinySAM : ModÃĻle de segmentation efficace pour tout segmenter
La segmentation dâobjets est un domaine fondamental et crucial dans la vision par ordinateur moderne. Elle joue un rÃīle essentiel dans les applications nÃĐcessitant des composants visuels ÃĐtendus, tels que la localisation et lâidentification dâobjets, et nÃĐcessite une segmentation rapide, prÃĐcise et en temps rÃĐel. Cette importance a fait de la segmentation dâobjets un sujet de recherche constamment populaire, avec des travaux significatifs rÃĐalisÃĐs dans des domaines tels que la segmentation dâinstances, la segmentation sÃĐmantique et la segmentation panoptique.
Avec lâÃĐvolution de la segmentation dâobjets, le ModÃĻle de segmentation de tout (SAM) est apparu comme un outil remarquable, prÃĐsentant des capacitÃĐs de segmentation exceptionnelles et ÃĐtant rapidement adoptÃĐ dans diverses applications de vision par ordinateur. Les cadres utilisant une architecture SAM prÃĐ-entraÃŪnÃĐe ont obtenu des performances impressionnantes dans les tÃĒches de vision en aval. Cependant, malgrÃĐ ses capacitÃĐs et sa grande prÃĐcision dans les tÃĒches de segmentation, lâarchitecture complexe et lourde du SAM nÃĐcessite une puissance de calcul importante, ce qui entrave sa mise en Åuvre sur des appareils à ressources computationnelles limitÃĐes.
Pour rÃĐpondre aux dÃĐfis de calcul du SAM, les chercheurs ont dÃĐveloppÃĐ le Tiny Segment Anything Model (TinySAM), qui conserve les performances de zÃĐro-shot de la trame dâorigine tout en ÃĐtant plus lÃĐger. Le TinySAM utilise une mÃĐthode de distillation des connaissances à plein stage avec des invites difficiles en ligne pour crÃĐer un modÃĻle dâÃĐtudiant plus efficace. La quantification post-formation adaptÃĐe aux tÃĒches de segmentation invocables rÃĐduit encore les besoins de calcul. De plus, la conception du TinySAM vise à segmenter de maniÃĻre hiÃĐrarchique tout, ce qui double presque la vitesse dâinfÃĐrence sans compromettre les performances.
Cet article se penche sur le cadre TinySAM, en explorant ses principes fondamentaux, son architecture et ses performances par rapport à dâautres cadres de segmentation dâÃĐtat de lâart. Explorons ces aspects en dÃĐtail.
TinySAM : ModÃĻle de segmentation efficace pour tout segmenter
Le ModÃĻle de segmentation de tout a contribuÃĐ Ã la progression rapide de plusieurs applications de vision par ordinateur en raison de ses capacitÃĐs de segmentation remarquables, couplÃĐes à un ÃĐnorme ensemble de donnÃĐes de segmentation qui abrite plus de 11 millions dâimages et plus dâun milliard de masques dâimage. En raison de ses performances exceptionnelles dans les tÃĒches de segmentation dâobjets avec des catÃĐgories et des formes arbitraires, il sert de base pour les cadres qui effectuent des tÃĒches en aval telles que le retouching dâimages, le suivi dâobjets, la vision 3D et plus encore. De plus, le ModÃĻle de segmentation de tout offre des performances de segmentation zÃĐro-shot remarquables qui ont bÃĐnÃĐficiÃĐ Ã des industries sensibles qui travaillent avec une quantitÃĐ limitÃĐe de donnÃĐes, notamment les industries de la recherche mÃĐdicale et de lâimagerie mÃĐdicale.
Bien que lâon ne puisse pas remettre en question les capacitÃĐs de segmentation remarquables offertes par le ModÃĻle de segmentation de tout sur une large gamme de tÃĒches de vision en aval, il a son inconvÃĐnient en termes de surcharge architecturale complexe, de besoins de calcul ÃĐlevÃĐs et de coÃŧts dâexploitation importants. Pour un systÃĻme fonctionnant sur une GPU moderne, le temps dâinfÃĐrence dâun modÃĻle SAM peut Être aussi ÃĐlevÃĐ que 2 secondes pour une image 1024Ã1024. Par consÃĐquent, il est trÃĻs difficile de mettre en Åuvre des applications SAM sur des appareils à ressources computationnelles limitÃĐes. Pour surmonter cet obstacle, des travaux rÃĐcents tels que MobileSAM et FastSAM ont tentÃĐ de dÃĐvelopper un modÃĻle SAM plus efficace sur le plan computationnel. Le cadre MobileSAM tente de remplacer le composant lourd de lâencodeur dâimage par lâarchitecture de la trame TinyViT, tandis que le modÃĻle FastSAM transfÃĻre la tÃĒche de segmentation à une tÃĒche de segmentation dâinstances avec une seule catÃĐgorie avec le modÃĻle YoloV8. Bien que ces mÃĐthodes aient pu atteindre un certain niveau de succÃĻs en termes de rÃĐduction des besoins de calcul, elles nâont pas pu maintenir les performances, en particulier sur les tÃĒches zÃĐro-shot en aval.
TinySAM ou le Tiny Segment Anything Model est une tentative pour rÃĐduire les besoins de calcul du modÃĻle SAM actuel sans nuire aux performances sur les tÃĒches zÃĐro-shot en aval. De plus, le cadre TinySAM propose de mettre en Åuvre une mÃĐthode de distillation des connaissances à plein stage dans son architecture, dans le but dâamÃĐliorer la capacitÃĐ du rÃĐseau dâÃĐtudiant compact. Le cadre TinySAM distille le rÃĐseau dâÃĐtudiant de maniÃĻre globale sous la supervision du rÃĐseau dâenseignant à diffÃĐrents stades. Pour amÃĐliorer les performances, le cadre permet à la distillation de se concentrer davantage sur les exemples difficiles en mettant en Åuvre une stratÃĐgie dâÃĐchantillonnage dâinvites difficiles en ligne. De plus, pour rÃĐduire encore les coÃŧts de calcul, le cadre TinySAM expose les tÃĒches de segmentation invocables aux composants de quantification post-formation.
La majeure partie des besoins de calcul du ModÃĻle de segmentation de tout est due au fait que le modÃĻle gÃĐnÃĻre des masques massifs à partir des points de grille pour segmenter tout dans lâimage. Pour surmonter les besoins de calcul de cette stratÃĐgie de segmentation, le cadre TinySAM emploie une stratÃĐgie de segmentation hiÃĐrarchique, qui double presque la vitesse dâinfÃĐrence sans compromettre les performances. Avec ces mÃĐthodes mises en Åuvre dans son architecture, le cadre TinySAM offre une rÃĐduction significative des besoins de calcul et fixe de nouvelles limites pour les tÃĒches de segmentation efficaces.
TinySAM : Architecture et mÃĐthodologie
Avant de discuter de lâarchitecture et de la mÃĐthodologie du cadre TinySAM, il est important de regarder dâabord son prÃĐdÃĐcesseur, le cadre SAM. Depuis son introduction, le ModÃĻle de segmentation de tout a dÃĐmontrÃĐ des performances remarquables, une polyvalence et des capacitÃĐs de gÃĐnÃĐralisation à travers une gamme de tÃĒches de vision et de segmentation dâobjets.
Au cÅur du modÃĻle SAM, il y a trois sous-rÃĐseaux : lâencodeur dâinvite, lâencodeur dâimage et le dÃĐcodeur de masque. Lâobjectif principal de lâencodeur dâinvite est de coder les masques de formes arbitraires, les points et les boÃŪtes dâentrÃĐe, ainsi que le texte libre avec des informations de position. Lâencodeur dâimage est un rÃĐseau lourd basÃĐ sur un transformateur de vision qui extrait lâimage dâentrÃĐe en embeddings. Le modÃĻle utilise diffÃĐrents rÃĐseaux pour traiter les invites gÃĐomÃĐtriques et textuelles. Enfin, le dÃĐcodeur de masque contient un transformateur à deux voies qui reçoit la sortie de lâencodeur dâinvite et de lâencodeur dâimage pour gÃĐnÃĐrer la prÃĐdiction finale du masque. Avec lâensemble de donnÃĐes, le cadre SAM dÃĐmontre des capacitÃĐs de segmentation de haute qualitÃĐ pour les objets, quelle que soit leur forme et leur catÃĐgorie. De plus, le ModÃĻle de segmentation de tout dÃĐmontre des performances remarquables et une efficacitÃĐ Ã travers les tÃĒches de vision zÃĐro-shot, notamment la proposition dâobjets, la dÃĐtection de bords, la prÃĐdiction de masque de texte et la segmentation dâinstances. En raison de ses capacitÃĐs de segmentation de haute qualitÃĐ et de ses invites flexibles, les cadres SAM forment la base des applications de vision. Cependant, on ne peut pas ignorer les besoins de calcul ÃĐlevÃĐs de lâarchitecture SAM traditionnelle, avec un grand nombre de paramÃĻtres qui rendent presque impossible pour les dÃĐveloppeurs de dÃĐployer des applications SAM sur des appareils à ressources computationnelles limitÃĐes.
Distillation des connaissances
La distillation des connaissances est une approche importante pour amÃĐliorer les performances des rÃĐseaux compacts pendant la phase dâentraÃŪnement. La mÃĐthode de distillation des connaissances utilise la sortie du rÃĐseau dâenseignant pour superviser lâentraÃŪnement du rÃĐseau dâÃĐtudiant lÃĐger. La mÃĐthode de distillation des connaissances peut Être divisÃĐe en deux sous-catÃĐgories : la distillation pour les fonctionnalitÃĐs intermÃĐdiaires et la distillation pour les sorties de rÃĐseau, avec la majoritÃĐ des travaux de recherche sur la distillation des connaissances se concentrant sur les tÃĒches de classification dâimages.
Comme indiquÃĐ plus haut, la figure suivante montre lâarchitecture gÃĐnÃĐrique du cadre TinySAM, ainsi que les performances sur les tÃĒches de segmentation dâinstances zÃĐro-shot.

Dans la premiÃĻre ÃĐtape, le cadre TinySAM met en Åuvre la distillation des connaissances conçue spÃĐcifiquement pour le cadre SAM, et pour activer le processus de distillation, le modÃĻle utilise un ÃĐchantillonnage dâinvites difficiles en ligne pour extraire les connaissances difficiles du rÃĐseau dâenseignant vers le rÃĐseau dâÃĐtudiant. Dans la deuxiÃĻme ÃĐtape, le cadre TinySAM adapte la mÃĐthode de quantification post-formation aux tÃĒches de segmentation invocables et la met en Åuvre sur le rÃĐseau dâÃĐtudiant lÃĐger. Enfin, le modÃĻle met en Åuvre le mode dâinfÃĐrence de segmentation hiÃĐrarchique conçu pour les tÃĒches de segmentation, ce qui double la vitesse dâinfÃĐrence avec une perte dâexactitude nÃĐgligeable.
Distillation des connaissances à plein stage
Comme mentionnÃĐ plus haut, le ModÃĻle de segmentation de tout se compose de trois sous-rÃĐseaux au cÅur : lâencodeur dâinvite, lâencodeur dâimage et le dÃĐcodeur de masque, avec le composant dâencodeur dâimage construit sur un transformateur de vision et ayant des besoins de calcul ÃĐlevÃĐs. Pour rÃĐsoudre ce problÃĻme, le cadre MobileSAM a remplacÃĐ le transformateur de vision par un TinyViT ou un transformateur de vision miniature, bien que le remplacement nâait pas ÃĐtÃĐ efficace en raison de la perte de performance significative. Pour garantir quâil nây ait pas de perte de performance, le cadre TinySAM met en Åuvre une mÃĐthode de distillation des connaissances à plein stage qui guide le rÃĐseau dâÃĐtudiant lÃĐger de lâencodeur dâimage depuis le niveau dâapprentissage jusquâau niveau de connaissance multiple. En plus de la perte conventionnelle entre les ÃĐtiquettes de vÃĐritÃĐ et les rÃĐsultats prÃĐdits, le cadre TinySAM introduit plusieurs pertes de distillation pendant diffÃĐrentes ÃĐtapes, comme indiquÃĐ dans la figure suivante.

Quantification
La quantification de modÃĻle est une approche populaire dans les cadres de vision par ordinateur et est utilisÃĐe pour compresser le modÃĻle en quantifiant les poids ou les activations depuis une bande passante plus ÃĐlevÃĐe vers une bande passante plus basse dans le but de rÃĐduire la complexitÃĐ de calcul et les besoins de stockage sans dÃĐgrader significativement la qualitÃĐ de sortie.
Lâobjectif principal de la quantification dans le TinySAM est de projeter le tenseur à virgule flottante sur le tenseur entier à lâaide dâun facteur dâÃĐchelle, avec la mÃĐtrique pour mesurer la distance entre la multiplication de matrices et la matrice quantifiÃĐe jouant un rÃīle essentiel pour optimiser le facteur dâÃĐchelle.
Segmentation hiÃĐrarchique
Le ModÃĻle de segmentation de tout propose dâutiliser un gÃĐnÃĐrateur de masque automatique qui ÃĐchantillonne des points sous forme de grille pour segmenter tout dans lâimage. Cependant, il a ÃĐtÃĐ indiquÃĐ que lâutilisation dâune grille de points dense entraÃŪne des sorties de segmentation trop fines et que le processus nÃĐcessite des besoins de calcul importants et engendre des coÃŧts dâexploitation ÃĐlevÃĐs. De plus, dâune part, trop de points dâÃĐchantillonnage pour un objet complet peuvent entraÃŪner une segmentation incorrecte de diffÃĐrentes sections de lâobjet en masques distincts, tandis que dâautre part, le coÃŧt temps de lâinfÃĐrence du mode tout est principalement dÃŧ au fait que lâencodeur dâimage a ÃĐtÃĐ rÃĐduit de maniÃĻre significative. Pour rÃĐduire le coÃŧt dâexploitation du mode tout, le cadre TinySAM utilise une approche de gÃĐnÃĐration de masque hiÃĐrarchique, avec la diffÃĐrence dans la stratÃĐgie par rapport au cadre SAM dâorigine dÃĐmontrÃĐe dans lâimage suivante.

DiffÃĐrent de lâapproche mise en Åuvre dans le cadre SAM dâorigine, le modÃĻle TinySAM nâutilise que 25 % des points de chaque cÃītÃĐ, ce qui signifie quâil utilise seulement 1/16 des points disponibles dans la configuration dâorigine. Le modÃĻle infÃĻre ensuite le dÃĐcodeur de masque et lâencodeur dâinvite avec ces invites et obtient la sortie. Le modÃĻle filtre ensuite certains masques avec une confiance dÃĐpassant un certain seuil et masque les emplacements correspondants comme des zones pour les prÃĐdictions finales potentielles. Puisque le modÃĻle traite ces rÃĐgions comme le rÃĐsultat de la segmentation dâinstances avec une confiance ÃĐlevÃĐe, il nâa pas besoin de gÃĐnÃĐrer des invites de points. La stratÃĐgie non seulement aide à prÃĐvenir la segmentation trop fine de lâobjet, mais elle aide ÃĐgalement à rÃĐduire les coÃŧts dâexploitation et les besoins de calcul de maniÃĻre significative. Le cadre fusionne ensuite et post-traite les rÃĐsultats de ces deux ÃĐtapes pour obtenir les masques finals.
TinySAM : ExpÃĐriences et rÃĐsultats
Pour accÃĐlÃĐrer le processus de distillation, le cadre TinySAM calcule et stocke les embeddings dâimages du rÃĐseau dâenseignant à lâavance, ce qui signifie quâil nâest pas nÃĐcessaire pour le modÃĻle de calculer lâencodeur dâimage lourd du rÃĐseau dâenseignant à plusieurs reprises pendant la phase dâentraÃŪnement. Pour la quantification post-formation, le cadre TinySAM quantifie toutes les couches de multiplication de matrices, les couches de convolution, les couches de dÃĐconvolution et les couches linÃĐaires, avec le modÃĻle utilisant des facteurs dâÃĐchelle canal par canal pour les couches de convolution et de dÃĐconvolution. Pour les couches de multiplication de matrices, le modÃĻle met en Åuvre des facteurs dâÃĐchelle tÊte par tÊte, tandis que pour les couches linÃĐaires, le modÃĻle met en Åuvre des facteurs dâÃĐchelle linÃĐaire par linÃĐaire. Le modÃĻle effectue ÃĐgalement une ÃĐvaluation sur les tÃĒches en aval zÃĐro-shot.
Pour les tÃĒches de segmentation dâinstances dans un contexte zÃĐro-shot, le cadre TinySAM suit les paramÃĻtres expÃĐrimentaux de son prÃĐdÃĐcesseur, le ModÃĻle de segmentation de tout, et utilise les rÃĐsultats de dÃĐtection dâobjets du cadre Vision Transformer Det-H ou VitDet-H pour la segmentation dâinstances. Comme dÃĐmontrÃĐ dans lâimage suivante, le cadre TinySAM surpasse les mÃĐthodes existantes en termes de prÃĐcision de segmentation dâinstances et de score FLOPs.

De plus, les performances qualitatives du modÃĻle TinySAM sont dÃĐmontrÃĐes dans lâimage suivante pour la segmentation dâinstances zÃĐro-shot, avec la boÃŪte verte reprÃĐsentant les invites de boÃŪte.

En termes dâÃĐvaluation de masque valide zÃĐro-shot, le modÃĻle TinySAM surpasse de maniÃĻre significative le cadre MobileSAM sur diffÃĐrents ensembles de donnÃĐes et fournit des rÃĐsultats substantiellement meilleurs lorsque le cadre utilise un nombre rÃĐduit de points comme invites.

De plus, le tableau suivant rÃĐsume les rÃĐsultats de lâaccÃĐlÃĐration et de la rÃĐduction des besoins de calcul obtenus grÃĒce à la stratÃĐgie de mode tout hiÃĐrarchique. Le modÃĻle applique le mÊme score de stabilitÃĐ et la mÊme valeur de seuil avec diffÃĐrentes stratÃĐgies pour une comparaison ÃĐquitable, et les rÃĐsultats sont rÃĐsumÃĐs ci-dessous.

PensÃĐes finales
Dans cet article, nous avons discutÃĐ du TinySAM, un cadre proposÃĐ qui pousse les limites pour segmenter nâimporte quelle tÃĒche, et obtient une architecture de modÃĻle efficace avec moins de besoins de calcul et une prÃĐcision ÃĐquivalente à celle du cadre SAM dâorigine. Le TinySAM ou le Tiny Segment Anything Model conserve et livre les performances zÃĐro-shot de la trame dâorigine. Le cadre TinySAM met dâabord en Åuvre une mÃĐthode de distillation des connaissances à plein stage qui utilise des invites difficiles en ligne pour distiller un modÃĻle dâÃĐtudiant lÃĐger. Le cadre TinySAM adapte ensuite la quantification post-formation aux tÃĒches de segmentation invocables, ce qui aide à rÃĐduire encore les besoins de calcul. De plus, le cadre vise ÃĐgalement à segmenter de maniÃĻre hiÃĐrarchique tout, ce qui double presque la vitesse dâinfÃĐrence sans affecter les performances.












