Angle d’Anderson
NVIDIA publie une mise à jour corrective pour le problème de surchauffe du pilote GPU

Hier, NVIDIA a publié une mise à jour corrective urgente pour contenir les conséquences d’une version de pilote précédente qui avait déclenché l’alarme dans les communautés de l’IA et du jeu en faisant rapporter de manière erronée des températures de GPU sûres – même si les exigences de refroidissement augmentaient discrètement vers des niveaux potentiellement critiques.
Dans l’annonce officielle de NVIDIA à propos de la sortie de la mise à jour corrective, bien que ce soit seulement le troisième point de la liste des correctifs, le problème est cité comme ‘Les utilitaires de surveillance de la température du GPU peuvent cesser de signaler la température du GPU après le réveil de l’ordinateur’.
Peu de temps après la sortie du pilote Game Ready affecté 576.02, un fil de discussion épinglé sur le sous-Reddit Stable Diffusion, intitulé Lisez pour sauver votre GPU!, est devenu une ressource pour les problèmes anecdotiques et les mises à jour signalées par les utilisateurs concernant le nouveau pilote. À partir de ceux-ci, et d’autres rapports sur le web, une chronologie des problèmes émergents peut être établie.
Le premier rapport de bogue sur Reddit semble avoir eu lieu vendredi après-midi UTC, sur le subreddit ZephyrusG14, où l’utilisateur fricy81 a cité un post sur les forums NVIDIA (archivé):

Un utilisateur sur les forums NVIDIA trouve des problèmes après la mise à jour 576.02. Source: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
L’utilisateur sur les forums NVIDIA a signalé que, après avoir installé la mise à jour du pilote, des outils comme MSI Afterburner et des moniteurs de jeu tels que celui de Call of Duty (qui accèdent généralement aux lectures système natives, comme le panneau GPU du Gestionnaire de tâches sous Windows) ont cessé de mettre à jour les lectures de température du GPU, gelant à environ 35-36°C.
Le redémarrage du logiciel de surveillance n’a eu aucun effet, a déclaré l’utilisateur, et seul un redémarrage complet du système a restauré les lectures précises. Des outils comme HWInfo et l’application de surveillance de NVIDIA ont continué à signaler les températures correctement. L’utilisateur a souligné que le problème est survenu pendant une utilisation normale, et non seulement après le réveil du système de veille.
Les commentaires des utilisateurs sur divers forums ont mis en évidence une perturbation générale du comportement normal de la courbe de ventilateur et une modification de la régulation thermique du noyau, entraînant des unités de traitement graphique à l’arrêt à des températures inattendument élevées, et surchauffant de manière alarmante sous des charges opérationnelles standard, comme détaillé dans ce commentaire:
‘Je pouvais sentir que quelque chose n’allait pas. Le temps à l’extérieur était probablement autour de 55°F / 12°C, mais j’étais en train de cuire vivant dans ma chambre. Ma fenêtre était ouverte, et pourtant je ne pouvais pas sentir de différence. Tous les ventilateurs tournaient à plein régime, et les températures semblaient bonnes au début – autour de 68°C à 72°C après avoir joué pendant un moment.
‘Au début, cela semblait normal – jusqu’au lendemain matin, lorsque j’ai réalisé que ce ne sont pas des températures d’arrêt, et que les ventilateurs étaient toujours en marche.
‘J’avais fait de l’overclocking d’IA après avoir réparé quelques choses récemment, donc je ne savais pas si les valeurs avaient simplement augmenté trop haut. C’est arrivé une fois auparavant après avoir installé ASUS AI Suite 3 – les paramètres du BIOS ne fonctionnaient même pas correctement à cause de cela.
‘Quoi qu’il en soit, je suis allé de l’avant et je suis revenu à un pilote plus ancien pour l’instant.’
Sous-optimal
Le document PDF officiel de mise à jour pour le pilote 576.02 offre quelques indices sur les changements qui ont pu contribuer aux nouveaux problèmes. Dans la section 5.5, NVIDIA reconnaît que la température du GPU peut être signalée de manière incorrecte sur les systèmes Optimus de NVIDIA, en particulier en affichant zéro degré lorsque aucune application n’est en cours d’exécution.

La section 5.5 des notes de mise à jour officielles de la mise à jour 576.02 aborde les problèmes de surveillance de la température qui semblent avoir affecté un plus grand nombre de systèmes que le système Optimus. Source: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
La mise à jour indique:
5.5 Température du GPU signalée de manière incorrecte sur les systèmes Optimus
5.5.1 Problème
Sur les systèmes Optimus, les outils de surveillance de la température tels que Speccy ou GPU-Z signalent que la température du GPU NVIDIA est zéro lorsque aucune application n’est en cours d’exécution.
5.5.2 Explication
Sur les systèmes Optimus, lorsque le GPU NVIDIA n’est pas utilisé, il est mis dans un état de faible consommation. Cela entraîne des outils de surveillance de la température à renvoyer des valeurs incorrectes. Réveiller le GPU pour interroger la température entraînerait des mesures sans signification, car la température du GPU changerait en conséquence.
Ces outils ne signaleront des températures précises que lorsque le GPU est éveillé et en cours d’exécution.
NVIDIA Optimus est une technologie de commutation de GPU qui bascule entre les graphiques intégrés et les graphiques dédiés en fonction des exigences de l’application, afin d’équilibrer automatiquement les performances et la consommation d’énergie, conçue pour conserver la durée de vie de la batterie et réduire la consommation d’énergie. Pour les tâches telles que le jeu ou la lecture de vidéos HD, Optimus active le GPU dédié pour de meilleures performances; pendant les activités plus légères telles que la navigation Web, il revient aux graphiques intégrés (intégrés).
La mise à jour semble avoir étendu un comportement précédemment limité aux systèmes Optimus, permettant au GPU affecté d’entrer dans un état de faible consommation lorsqu’il est inactif, même lorsqu’il n’est pas hébergé sur un système Optimus, ce qui perturbe la surveillance de la température dans les outils tiers.
Ajustement des risques
Dans la plupart des scénarios, il est raisonnable de dire que le VBIOS de la carte graphique VBIOS aurait probablement empêché les dommages permanents au GPU. Le VBIOS impose des limites thermiques et de puissance au niveau du micrologiciel, indépendamment du pilote.
Par conséquent, même si un pilote pouvait causer un comportement de ventilateur incorrect ou des températures mal signalées, le VBIOS devrait toujours limiter les performances, augmenter l’activité du ventilateur ou arrêter le GPU pour prévenir les dégâts matériels.
Cela ne signifie pas que le risque était négligeable – des températures élevées prolongées peuvent dégrader les performances avec le temps ou stresser les composants adjacents; en outre, en l’absence d’une compréhension commune selon laquelle une mise à jour de pilote a causé un problème (notamment dans les systèmes où les pilotes se mettent à jour « silencieusement »), un problème de ce type pourrait induire en erreur une grande proportion d’utilisateurs affectés, qui pourraient tenter des remèdes pour des problèmes inexistants, ou même potentiellement causer des dommages à leurs systèmes en appliquant des « corrections » non pertinentes.
Le comportement erroné causé par la mise à jour 576.02 était particulièrement alarmant pour ceux qui sont engagés dans les flux de travail d’intelligence artificielle, où le matériel haute performance est régulièrement poussé à ses limites thermiques pendant de longues périodes.
La mise à jour de pilote problématique 576.02 a inspiré une vague plus large de plaintes après sa sortie à la mi-avril, malgré les premiers rapports qui indiquaient qu’elle offrait certaines améliorations de performances bénéfiques. Nonobstant la fourniture de la mise à jour corrective, et le niveau de perturbation que 576.02 semble avoir causé, à l’heure de la rédaction, elle reste disponible pour téléchargement* sur le site de NVIDIA.
Après-coup
En termes de conséquences de la mise à jour défectueuse, il y a de nombreux types de dommages et d’inconvénients signalés: l’utilisateur Frankie_T9000 a signalé que son GPU s’est éteint au démarrage en raison de l’accumulation de chaleur sous la mise à jour défectueuse, et n’a été stabilisé qu’après une sous-tension. Il a commenté ‘Il semble que ce ne soit pas endommagé de manière permanente, mais j’ai besoin de le répéter dès que possible (j’ai des pads qui arrivent mercredi) je soupçonne que la vieille pâte thermique ait été vieillie par l’accumulation de chaleur, donc je mets de nouvelles pâtes.‘
Hier, un autre utilisateur dans le même fil de discussion a déclaré: ‘Je suis en train d’utiliser une courbe de ventilateur personnalisée avec MSI Afterburner, et elle indiquait constamment que mes températures de GPU étaient de 27°C, donc les ventilateurs ne se sont pas mis en marche, ce qui a entraîné des problèmes de surchauffe. Je pensais que c’était un problème de ma part, mais après avoir installé le pilote précédent, tout a fonctionné à nouveau correctement. De plus, les températures ne sont pas affichées correctement dans le Gestionnaire de tâches.’
Bien que NVIDIA (comme elle le déclare régulièrement dans chaque version de mise à jour corrective) fournisse souvent des mises à jour correctives pour des jeux vidéo ou des plateformes spécifiques, le risque de dommages thermiques au GPU ou à proximité est plus élevé pour les praticiens de l’IA que pour les joueurs, car les processus d’apprentissage automatique intensifs tels que la formation ou l’inférence prolongée placent un GPU sous une charge constante à long terme – un événement susceptible d’être déclenché uniquement périodiquement dans un jeu, qui peut « exploser » en une utilisation élevée pour un combat de boss ou une section de carte particulièrement exigeante, mais qui est conçu comme un compromis entre l’exploitation du GPU et la stabilité du système.
* Archive: https://archive.ph/ylVR1
Publié pour la première fois mardi 22 avril 2025












