Modèles et plateformes d’IA
YOLOv7 : L’algorithme de détection d’objets le plus avancé ?

Le 6 juillet 2022 sera marqué comme une date historique dans l’histoire de l’IA, car c’est ce jour-là que YOLOv7 a été publié. Depuis son lancement, YOLOv7 a été le sujet le plus chaud dans la communauté des développeurs de vision par ordinateur, et pour de bonnes raisons. YOLOv7 est déjà considéré comme un jalon dans l’industrie de la détection d’objets.
Peu de temps après la publication du document YOLOv7, il est apparu comme le modèle de détection d’objets en temps réel le plus rapide et le plus précis. Mais comment YOLOv7 surpasse-t-il ses prédécesseurs ? Qu’est-ce qui rend YOLOv7 si efficace pour effectuer des tâches de vision par ordinateur ?
Dans cet article, nous allons essayer d’analyser le modèle YOLOv7 et essayer de trouver la réponse à la question de savoir pourquoi YOLOv7 devient la norme de l’industrie. Mais avant de pouvoir répondre à cela, nous devons avoir un aperçu de l’histoire de la détection d’objets.
Qu’est-ce que la détection d’objets ?
La détection d’objets est une branche de la vision par ordinateur qui identifie et localise les objets dans une image ou un fichier vidéo. La détection d’objets est le bloc de construction de nombreuses applications, notamment les voitures autonomes, la surveillance surveillée et même la robotique.
Un modèle de détection d’objets peut être classé en deux catégories différentes, les détecteurs à un seul tir, et les détecteurs à plusieurs tirs.
Détection d’objets en temps réel
Pour vraiment comprendre comment YOLOv7 fonctionne, il est essentiel de comprendre l’objectif principal de YOLOv7, « la détection d’objets en temps réel ». La détection d’objets en temps réel est un composant clé de la vision par ordinateur moderne. Les modèles de détection d’objets en temps réel tentent d’identifier et de localiser les objets d’intérêt en temps réel. Les modèles de détection d’objets en temps réel ont rendu possible pour les développeurs de suivre les objets d’intérêt dans un cadre en mouvement, comme une vidéo ou une entrée de surveillance en direct.

Les modèles de détection d’objets en temps réel sont essentiellement un pas en avant par rapport aux modèles de détection d’images conventionnels. Alors que le premier est utilisé pour suivre les objets dans des fichiers vidéo, le second localise et identifie les objets dans un cadre fixe, comme une image.
En conséquence, les modèles de détection d’objets en temps réel sont très efficaces pour l’analyse de vidéos, les véhicules autonomes, le comptage d’objets, le suivi d’objets multiples, et bien plus encore.
Qu’est-ce que YOLO ?
YOLO ou « Vous ne regardez qu’une fois » est une famille de modèles de détection d’objets en temps réel. Le concept YOLO a été introduit pour la première fois en 2016 par Joseph Redmon, et il a été le sujet de conversation presque instantanément parce qu’il était beaucoup plus rapide et plus précis que les algorithmes de détection d’objets existants. Il n’a pas fallu longtemps avant que l’algorithme YOLO devienne une norme dans l’industrie de la vision par ordinateur.

Le concept fondamental que l’algorithme YOLO propose est d’utiliser un réseau neuronal de bout en bout en utilisant des boîtes de délimitation et des probabilités de classe pour faire des prédictions en temps réel. YOLO était différent des modèles de détection d’objets précédents dans le sens qu’il proposait une approche différente pour effectuer la détection d’objets en repurposant les classificateurs.
Le changement d’approche a fonctionné, car YOLO est devenu la norme de l’industrie, car l’écart de performance entre lui et les autres algorithmes de détection d’objets en temps réel était important. Mais quelle était la raison pour laquelle YOLO était si efficace ?
Lorsqu’il est comparé à YOLO, les algorithmes de détection d’objets à l’époque utilisaient des réseaux de proposition de région pour détecter les régions d’intérêt possibles. Le processus de reconnaissance était ensuite effectué sur chaque région séparément. En conséquence, ces modèles ont souvent effectué plusieurs itérations sur la même image, et donc le manque de précision et le temps d’exécution plus élevé. D’un autre côté, l’algorithme YOLO utilise une seule couche entièrement connectée pour effectuer la prédiction à la fois.
Comment YOLO fonctionne-t-il ?
Il y a trois étapes qui expliquent comment un algorithme YOLO fonctionne.
Reformulation de la détection d’objets comme un problème de régression unique
L’algorithme YOLO tente de reformuler la détection d’objets comme un problème de régression unique, y compris les pixels d’image, les probabilités de classe et les coordonnées de la boîte de délimitation. Par conséquent, l’algorithme n’a pas besoin de regarder l’image qu’une seule fois pour prédire et localiser les objets cibles dans les images.
Raisons pour lesquelles l’image est analysée globalement
De plus, lorsque l’algorithme YOLO fait des prédictions, il analyse l’image globalement. Il est différent des techniques de proposition de région et de glissage, car l’algorithme YOLO voit l’image complète pendant l’entraînement et le test sur le jeu de données, et est capable d’encoder des informations contextuelles sur les classes et la façon dont elles apparaissent.
Avant YOLO, Fast R-CNN était l’un des algorithmes de détection d’objets les plus populaires qui ne pouvait pas voir le contexte plus large dans l’image, car il utilisait des erreurs de fond dans une image pour un objet. Par rapport à l’algorithme Fast R-CNN, YOLO est 50 % plus précis lorsqu’il s’agit d’erreurs de fond.
Généralisation de la représentation des objets
Enfin, l’algorithme YOLO vise également à généraliser la représentation des objets dans une image. Par conséquent, lorsque l’algorithme YOLO a été exécuté sur un jeu de données avec des images naturelles et testé pour les résultats, YOLO a surpassé les modèles R-CNN existants avec une grande marge. C’est parce que YOLO est très généralisable, les chances qu’il se brise lorsqu’il est mis en œuvre sur des entrées inattendues ou de nouveaux domaines étaient faibles.
YOLOv7 : Qu’est-ce qui est nouveau ?
Maintenant que nous avons une compréhension de base de ce que sont les modèles de détection d’objets en temps réel et de ce qu’est l’algorithme YOLO, il est temps de discuter de l’algorithme YOLOv7.
Optimisation du processus d’entraînement
L’algorithme YOLOv7 ne tente pas seulement d’optimiser l’architecture du modèle, mais il vise également à optimiser le processus d’entraînement. Il vise à utiliser des modules et des méthodes d’optimisation pour améliorer la précision de la détection d’objets, en renforçant le coût d’entraînement, tout en maintenant le coût d’interférence. Ces modules d’optimisation peuvent être appelés un sac de gratuities formable.
Affectation d’étiquette guidée par l’entête de conduite grossière à fine
L’algorithme YOLOv7 prévoit d’utiliser une nouvelle affectation d’étiquette guidée par l’entête de conduite grossière à fine au lieu de l’affectation d’étiquette dynamique conventionnelle. C’est parce que, avec l’affectation d’étiquette dynamique, l’entraînement d’un modèle avec plusieurs couches de sortie peut causer des problèmes, le plus courant étant de savoir comment attribuer des cibles dynamiques pour les différentes couches et leurs sorties.
Re-paramétrisation du modèle
La re-paramétrisation du modèle est un concept important dans la détection d’objets, et son utilisation est généralement suivie de certains problèmes pendant l’entraînement. L’algorithme YOLOv7 prévoit d’utiliser le concept de chemin de propagation du gradient pour analyser les politiques de re-paramétrisation du modèle applicables à différentes couches du réseau.
Étendre et mettre à l’échelle
L’algorithme YOLOv7 introduit également les méthodes d’étendue et de mise à l’échelle pour utiliser et utiliser efficacement les paramètres et les calculs pour la détection d’objets en temps réel.

YOLOv7 : Travaux liés
Détection d’objets en temps réel
YOLO est actuellement la norme de l’industrie, et la plupart des détecteurs d’objets en temps réel déployés utilisent des algorithmes YOLO et FCOS (Fully Convolutional One-Stage Object-Detection). Un détecteur d’objets en temps réel d’état de l’art a généralement les caractéristiques suivantes
- Une architecture de réseau plus forte et plus rapide.
- Une méthode d’intégration de fonctionnalités efficace.
- Une méthode de détection d’objets précise.
- Une fonction de perte robuste.
- Une méthode d’affectation d’étiquette efficace.
- Une méthode d’entraînement efficace.
L’algorithme YOLOv7 n’utilise pas l’apprentissage auto-supervisé et la distillation, qui nécessitent souvent de grandes quantités de données. Au lieu de cela, l’algorithme YOLOv7 utilise une méthode de sac de gratuities formable.
Re-paramétrisation du modèle
Les techniques de re-paramétrisation du modèle sont considérées comme des techniques d’ensemble qui combinent plusieurs modules de calcul dans une étape d’interférence. La technique peut être divisée en deux catégories, l’ensemble au niveau du modèle et l’ensemble au niveau du module.
Maintenant, pour obtenir le modèle d’interférence final, la technique d’ensemble au niveau du modèle utilise deux pratiques. La première pratique utilise des données d’entraînement différentes pour entraîner de multiples modèles identiques, puis average les poids des modèles entraînés. Alternativement, l’autre pratique average les poids des modèles pendant les différentes itérations.
La re-paramétrisation au niveau du module est en train de gagner une popularité immense récemment, car elle divise un module en différentes branches de module ou des branches identiques pendant la phase d’entraînement, puis intègre ces différentes branches dans un module équivalent pendant l’interférence.
Cependant, les techniques de re-paramétrisation ne peuvent pas être appliquées à tous les types d’architecture. C’est pourquoi l’algorithme YOLOv7 utilise de nouvelles techniques de re-paramétrisation du modèle pour concevoir des stratégies adaptées à différentes architectures.
Mise à l’échelle du modèle
La mise à l’échelle du modèle est le processus de mise à l’échelle d’un modèle existant pour qu’il convienne à différents appareils de calcul. La mise à l’échelle du modèle utilise généralement une variété de facteurs tels que le nombre de couches (profondeur), la taille des images d’entrée (résolution), le nombre de pyramides de fonctionnalités (étape) et le nombre de canaux (largeur). Ces facteurs jouent un rôle crucial pour assurer un équilibre entre les paramètres du réseau, la vitesse d’interférence, les calculs et la précision du modèle.
L’une des méthodes de mise à l’échelle les plus couramment utilisées est la recherche d’architecture de réseau (NAS), qui recherche automatiquement des facteurs de mise à l’échelle appropriés à partir de moteurs de recherche sans règles compliquées. Le principal inconvénient de l’utilisation de la NAS est qu’il s’agit d’une approche coûteuse pour rechercher des facteurs de mise à l’échelle appropriés.
Presque tous les modèles de re-paramétrisation analysent les facteurs d’échelle individuels et uniques de manière indépendante, et optimisent également ces facteurs de manière indépendante. C’est parce que l’architecture NAS fonctionne avec des facteurs d’échelle non corrélés.
Il est important de noter que les modèles basés sur la concaténation, tels que VoVNet ou DenseNet, changent la largeur d’entrée de certaines couches lorsque la profondeur du modèle est mise à l’échelle. YOLOv7 fonctionne sur une architecture basée sur la concaténation, il utilise donc une méthode de mise à l’échelle composée.

La figure mentionnée ci-dessus compare les réseaux d’agrégation de couches efficaces étendus (E-ELAN) de différents modèles. La méthode E-ELAN proposée maintient le chemin de transmission du gradient de l’architecture d’origine, mais vise à augmenter la cardinalité des fonctionnalités ajoutées en utilisant la convolution de groupe. Le processus peut améliorer les fonctionnalités apprises par les différentes cartes et peut également rendre l’utilisation des calculs et des paramètres plus efficace.
Architecture YOLOv7
Le modèle YOLOv7 utilise les modèles YOLOv4, YOLO-R et YOLOv4 mis à l’échelle comme base. Le YOLOv7 est le résultat des expériences menées sur ces modèles pour améliorer les résultats et rendre le modèle plus précis.
Réseau d’agrégation de couches efficace étendu ou E-ELAN
E-ELAN est le bloc de construction fondamental du modèle YOLOv7, et il est dérivé de modèles existants sur l’efficacité du réseau, principalement ELAN.
Les principales considérations lors de la conception d’une architecture efficace sont le nombre de paramètres, la densité de calcul, et la quantité de calcul. D’autres modèles prennent également en compte des facteurs tels que l’influence du rapport entre les canaux d’entrée et de sortie, les branches de l’architecture du réseau, la vitesse d’interférence du réseau, le nombre d’éléments dans les tenseurs du réseau de convolution, et plus encore.
Le modèle CSPVoNet ne prend pas seulement en compte les paramètres mentionnés ci-dessus, mais il analyse également le chemin de gradient pour apprendre des fonctionnalités plus diverses en activant les poids des différentes couches. L’approche permet aux interférences d’être beaucoup plus rapides et précises. L’architecture ELAN vise à concevoir un réseau efficace pour contrôler le chemin de gradient le plus court, afin que le réseau puisse être plus efficace pour apprendre et converger.
ELAN a déjà atteint un état stable, quel que soit le nombre de blocs de calcul empilés, et la longueur du chemin de gradient. L’état stable peut être détruit si les blocs de calcul sont empilés sans limite, et le taux d’utilisation des paramètres diminuera. L’architecture E-ELAN proposée peut résoudre le problème, car elle utilise l’expansion, le mélange et la fusion de la cardinalité pour continuellement améliorer la capacité d’apprentissage du réseau tout en conservant le chemin de gradient d’origine.
De plus, lors de la comparaison de l’architecture E-ELAN avec ELAN, la seule différence est dans le bloc de calcul, tandis que l’architecture de la couche de transition est inchangée.
E-ELAN propose d’étendre la cardinalité des blocs de calcul et d’étendre le canal en utilisant la convolution de groupe. La carte de fonctionnalités sera ensuite calculée et mélangée en groupes en fonction du paramètre de groupe, puis concaténée ensemble. Le nombre de canaux dans chaque groupe restera le même que dans l’architecture d’origine. Enfin, les groupes de cartes de fonctionnalités seront ajoutés pour effectuer la cardinalité.
Mise à l’échelle du modèle pour les modèles basés sur la concaténation
La mise à l’échelle du modèle aide à ajuster les attributs des modèles qui aident à générer des modèles selon les besoins et à différentes échelles pour répondre à différentes vitesses d’interférence.

La figure parle de la mise à l’échelle du modèle pour les modèles basés sur la concaténation. Comme vous pouvez le voir dans la figure (a) et (b), la largeur de sortie du bloc de calcul augmente avec une augmentation de la mise à l’échelle de la profondeur du modèle. En conséquence, la largeur d’entrée de la couche de transmission est augmentée. Si ces méthodes sont mises en œuvre sur une architecture basée sur la concaténation, le processus de mise à l’échelle est effectué en profondeur, et il est représenté dans la figure (c).
Il peut ainsi être conclu que il n’est pas possible d’analyser les facteurs d’échelle de manière indépendante pour les modèles basés sur la concaténation, et qu’ils doivent être considérés ou analysés ensemble. Par conséquent, pour un modèle basé sur la concaténation, il est approprié d’utiliser la méthode de mise à l’échelle composée correspondante. De plus, lorsque le facteur de profondeur est mis à l’échelle, le canal de sortie du bloc doit également être mis à l’échelle.
Sac de gratuities formable
Un sac de gratuities est un terme que les développeurs utilisent pour décrire un ensemble de méthodes ou de techniques qui peuvent modifier la stratégie d’entraînement ou le coût pour améliorer la précision du modèle. Quels sont les sacs de gratuities formables dans YOLOv7 ? Jetons un coup d’œil.
Convolution re-paramétrée planifiée
L’algorithme YOLOv7 utilise les chemins de propagation du gradient pour déterminer comment combiner idéalement un réseau avec la convolution re-paramétrée. Cette approche de YOLOv7 est une tentative pour contrer l’algorithme RepConv, qui, bien qu’il ait performé de manière sereine sur le modèle VGG, performe mal lorsqu’il est appliqué directement aux modèles DenseNet et ResNet.
Pour identifier les connexions dans une couche de convolution, l’algorithme RepConv combine la convolution 3×3 et la convolution 1×1. Si nous analysons l’algorithme, sa performance et l’architecture, nous observerons que RepConv détruit la concaténation dans DenseNet et la rémanence dans ResNet.

L’image ci-dessus représente un modèle re-paramétré planifié. On peut voir que l’algorithme YOLOv7 a constaté qu’une couche dans le réseau avec des connexions de concaténation ou de rémanence ne devrait pas avoir de connexion d’identité dans l’algorithme RepConv. En conséquence, il est acceptable de basculer vers RepConvN sans connexion d’identité.
Grossier pour l’auxiliaire et fin pour la perte de conduite
La supervision profonde est une branche de l’informatique qui trouve souvent son utilité dans le processus d’entraînement des réseaux profonds. Le principe fondamental de la supervision profonde est qu’il ajoute une tête auxiliaire supplémentaire dans les couches moyennes du réseau ainsi que les poids du réseau superficiel avec une perte d’assistance comme guide. L’algorithme YOLOv7 se réfère à la tête responsable de la sortie finale comme la tête de conduite, et la tête auxiliaire est la tête qui aide à l’entraînement.
En continuant, YOLOv7 utilise une méthode différente pour l’affectation d’étiquette. Conventuellement, l’affectation d’étiquette a été utilisée pour générer des étiquettes en se référant directement à la vérité terrain et sur la base d’un ensemble de règles données. Cependant, ces dernières années, la distribution et la qualité de la prédiction d’entrée jouent un rôle important pour générer une étiquette fiable. YOLOv7 génère une étiquette douce de l’objet en utilisant les prédictions de la boîte de délimitation et la vérité terrain.
De plus, la nouvelle méthode d’affectation d’étiquette de l’algorithme YOLOv7 utilise les prédictions de la tête de conduite pour guider à la fois la tête de conduite et la tête auxiliaire. La méthode d’affectation d’étiquette propose deux stratégies.
Affectation d’étiquette guidée par la tête de conduite
La stratégie effectue des calculs sur la base des résultats de prédiction de la tête de conduite et de la vérité terrain, puis utilise l’optimisation pour générer des étiquettes douces. Ces étiquettes douces sont ensuite utilisées comme modèle d’entraînement pour la tête de conduite et la tête auxiliaire.
La stratégie fonctionne sur l’hypothèse que, puisque la tête de conduite a une capacité d’apprentissage plus grande, les étiquettes qu’elle génère devraient être plus représentatives et corrélées entre la source et la cible.
Affectation d’étiquette grossière à fine guidée par la tête de conduite
Cette stratégie effectue également des calculs sur la base des résultats de prédiction de la tête de conduite et de la vérité terrain, puis utilise l’optimisation pour générer des étiquettes douces. Cependant, il y a une différence clé. Dans cette stratégie, il y a deux ensembles d’étiquettes douces, niveau grossier et étiquette fine.
L’étiquette grossière est générée en relaxant les contraintes du processus d’affectation d’échantillons positifs qui traite plus de grilles comme des cibles positives. C’est fait pour éviter le risque de perdre des informations en raison de la faible force d’apprentissage de la tête auxiliaire.

La figure ci-dessus explique l’utilisation d’un sac de gratuities formable dans l’algorithme YOLOv7. Il représente le grossier pour la tête auxiliaire et le fin pour la tête de conduite. Lorsque nous comparons un modèle avec une tête auxiliaire (b) avec le modèle normal (a), nous observerons que le schéma (b) a une tête auxiliaire, tandis que ce n’est pas le cas dans (a).
La figure (c) représente l’affectation d’étiquette indépendante commune, tandis que la figure (d) et la figure (e) représentent respectivement l’affectation d’étiquette guidée par la tête de conduite et l’affectation d’étiquette grossière à fine guidée par la tête de conduite utilisée par YOLOv7.
Autres sacs de gratuities formables
En plus de ceux mentionnés ci-dessus, l’algorithme YOLOv7 utilise des sacs de gratuities formables supplémentaires, bien qu’ils n’aient pas été proposés par eux à l’origine. Ils sont
- La normalisation par lots dans la technologie Conv-Bn-Activation : cette stratégie est utilisée pour relier directement une couche de convolution à la couche de normalisation par lots.
- Les connaissances implicites dans YOLOR : l’algorithme YOLOv7 combine la stratégie avec la carte de fonctionnalités de convolution.
- Le modèle EMA : le modèle EMA est utilisé comme modèle de référence final dans YOLOv7, bien que son utilisation principale soit d’être utilisé dans la méthode du professeur moyen.
YOLOv7 : Expériences
Configuration expérimentale
L’algorithme YOLOv7 utilise le jeu de données Microsoft COCO pour l’entraînement et la validation de son modèle de détection d’objets, et non tous ces expériences utilisent un modèle pré-entraîné. Les développeurs ont utilisé le jeu de données d’entraînement 2017 pour l’entraînement et le jeu de données de validation 2017 pour la sélection des hyperparamètres. Enfin, les résultats de la détection d’objets YOLOv7 sont comparés avec les algorithmes d’état de l’art pour la détection d’objets.
Les développeurs ont conçu un modèle de base pour une carte graphique de bord (YOLOv7-tiny), une carte graphique normale (YOLOv7) et une carte graphique cloud (YOLOv7-W6). De plus, l’algorithme YOLOv7 utilise également un modèle de base pour la mise à l’échelle du modèle selon les différentes exigences de service, et obtient différents modèles. Pour l’algorithme YOLOv7, la mise à l’échelle de la pile est effectuée sur le cou, et les composés proposés sont utilisés pour mettre à l’échelle la profondeur et la largeur du modèle.
Références
L’algorithme YOLOv7 utilise les modèles YOLO précédents et l’algorithme de détection d’objets YOLOR comme références.

La figure ci-dessus compare la référence du modèle YOLOv7 avec d’autres modèles de détection d’objets, et les résultats sont assez évidents. Lorsqu’il est comparé à l’algorithme YOLOv4, YOLOv7 n’utilise pas seulement 75 % moins de paramètres, mais il utilise également 15 % moins de calculs, et a une précision de 0,4 % supérieure.
Comparaison avec les modèles de détection d’objets d’état de l’art

La figure ci-dessus montre les résultats lorsque YOLOv7 est comparé aux modèles de détection d’objets d’état de l’art pour les cartes graphiques mobiles et générales. On peut observer que la méthode proposée par l’algorithme YOLOv7 a le meilleur score de compromis entre vitesse et précision.
Étude d’ablation : Méthode de mise à l’échelle composée proposée

La figure ci-dessus compare les résultats de l’utilisation de différentes stratégies pour mettre à l’échelle le modèle. La stratégie de mise à l’échelle de l’algorithme YOLOv7 met à l’échelle la profondeur du bloc de calcul de 1,5 fois, et met à l’échelle la largeur de 1,25 fois.
Lorsqu’il est comparé à un modèle qui ne met à l’échelle que la profondeur, le modèle YOLOv7 fonctionne mieux de 0,5 % tout en utilisant moins de paramètres et de puissance de calcul. D’un autre côté, lorsqu’il est comparé à des modèles qui ne mettent à l’échelle que la profondeur, la précision de YOLOv7 est améliorée de 0,2 %, mais le nombre de paramètres doit être mis à l’échelle de 2,9 %, et le calcul de 1,2 %.
Modèle re-paramétré planifié proposé
Pour vérifier la généralité de son modèle re-paramétré proposé, l’algorithme YOLOv7 l’utilise sur des modèles basés sur la rémanence et la concaténation pour la vérification. Pour le processus de vérification, l’algorithme YOLOv7 utilise 3 empilés ELAN pour le modèle basé sur la concaténation, et CSPDarknet pour le modèle basé sur la rémanence.
Pour le modèle basé sur la concaténation, l’algorithme remplace les couches de convolution 3×3 dans les 3 empilés ELAN par RepConv. La figure ci-dessous montre la configuration détaillée du RepConv planifié et des 3 empilés ELAN.

De plus, lorsqu’il s’agit du modèle basé sur la rémanence, l’algorithme YOLOv7 utilise un bloc sombre inversé, car le bloc sombre d’origine n’a pas de couche de convolution 3×3. La figure ci-dessous montre l’architecture du CSPDarknet inversé, qui inverse les positions des couches de convolution 3×3 et 1×1.

Perte d’assistance pour la tête auxiliaire proposée
Pour la perte d’assistance pour la tête auxiliaire, le modèle YOLOv7 compare l’affectation d’étiquette indépendante pour la tête auxiliaire et la tête de conduite.

La figure ci-dessus contient les résultats de l’étude sur la tête auxiliaire proposée. On peut voir que les performances globales du modèle augmentent avec une augmentation de la perte d’assistance. De plus, l’affectation d’étiquette guidée par la tête de conduite proposée par le modèle YOLOv7 fonctionne mieux que les stratégies d’affectation d’étiquette indépendantes.
Résultats YOLOv7
Sur la base des expériences ci-dessus, voici le résultat des performances de YOLOv7 par rapport à d’autres algorithmes de détection d’objets.

La figure ci-dessus compare le modèle YOLOv7 avec d’autres algorithmes de détection d’objets, et on peut clairement observer que le modèle YOLOv7 dépasse les autres modèles de détection d’objets en termes de précision moyenne (AP) par rapport à l’interférence par lot.
De plus, la figure ci-dessous compare les performances de YOLOv7 par rapport à d’autres algorithmes de détection d’objets en temps réel. Une fois encore, YOLOv7 dépasse les autres modèles en termes de performances globales, de précision et d’efficacité.

Voici quelques observations supplémentaires des résultats et des performances de YOLOv7.
- Le YOLOv7-Tiny est le plus petit modèle de la famille YOLO, avec plus de 6 millions de paramètres. Le YOLOv7-Tiny a une précision moyenne de 35,2 %, et il dépasse les modèles YOLOv4-Tiny avec des paramètres comparables.
- Le modèle YOLOv7 a plus de 37 millions de paramètres, et il dépasse les modèles avec des paramètres plus élevés comme YOLov4.
- Le modèle YOLOv7 a la précision moyenne et le taux de FPS les plus élevés dans la plage de 5 à 160 FPS.
Conclusion
YOLO ou « Vous ne regardez qu’une fois » est l’algorithme de détection d’objets d’état de l’art dans la vision par ordinateur moderne. L’algorithme YOLO est connu pour sa grande précision et son efficacité, et en conséquence, il trouve une application extensive dans l’industrie de la détection d’objets en temps réel. Depuis que le premier algorithme YOLO a été introduit en 2016, les expériences ont permis aux développeurs d’améliorer le modèle de manière continue.
Le modèle YOLOv7 est la dernière addition à la famille YOLO, et c’est l’algorithme YOLO le plus puissant à ce jour. Dans cet article, nous avons discuté des fondamentaux de YOLOv7 et avons essayé d’expliquer ce qui rend YOLOv7 si efficace.












