Andersons vinkel
NVIDIA Utsteder Hotfix for GPU-Driverens Overoppheting-Problemer

I går utga NVIDIA en kritisk hotfix for å begrense skaden fra en tidligere driverelease som hadde utløst alarm i AI- og gamingsamfunnene ved å få systemer til å feilaktig rapportere trygge GPU-temperaturer – selv om kjølekravene steg til potensielt kritiske nivåer.
I NVIDIA’s offisielle post omkring hotfix-utgivelsen, selv om det bare er tredje på listen over oppgitte fikser, er problemet sitert som ‘GPU-overvåkingsverktøy kan slutte å rapportere GPU-temperaturen etter at PC våkner fra søvn’.
Kort tid etter at den berørte Game Ready-drivere 576.02 ble rullet ut, ble en pinnad tråd på Stable Diffusion-sub-Reddit, med tittelen Les for å redde din GPU!, en ressurs for anekdotiske problemer og bruker-rapporterte oppdateringer om den nye drivere. Fra disse, og andre rapporter på nettet, kan en tidslinje for fremvoksende problemer etableres.
Den første Reddit-rapporten om feilen synes å ha funnet sted sent på fredag ettermiddag UTC, på ZephyrusG14-subreddit, hvor brukeren fricy81 siterte en post på NVIDIA-forum (arkivert):

En bruker på NVIDIA-forum finner problemer etter 576.02-oppdateringen. Kilde: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
Brukeren på NVIDIA-forum rapporterte at etter å ha installert driveroppdateringen, stoppet verktøy som MSI Afterburner og spill-overvåkingsverktøy som det i Call of Duty (som vanligvis aksesserer native systemlesninger, på samme måte som Task Manager’s GPU-panel gjør i Windows) med å oppdatere GPU-temperaturlesninger, og frøs på rundt 35-36°C.
Å restarte overvåkingsprogramvaren hadde ingen effekt, sa brukeren, og bare en fullstendig systemomstart ville gjenopprette nøyaktige lesninger. Verktøy som HWInfo og NVIDIA’s egen overvåkingsapp fortsatte å rapportere temperaturer korrekt. Brukeren understreket at problemet inntraff under normal bruk, ikke bare etter å ha våknet systemet fra søvn.
Bruker-tilbakemelding på ulike forumer viste en generell forstyrrelse av normal fan-kurve-atferd og en endring av kjerne-termoregulering, som resulterte i at grafikkprosessorer idlet på uventet høye temperaturer, og alarmende overopphetet under hva som vanligvis ville bli betraktet som standard operasjonelle belastninger, som detaljert i denne kommentaren:
‘Jeg kunne se at noe var galt. Været utenfor var sannsynligvis rundt 55°F / 12°C, men jeg var kokende levende i mitt rom. Mitt vindu var åpent, og likevel kunne jeg ikke føle noen forskjell. Alle fansene gikk på maks, og tempene så ut til å være fine til å begynne med—rundt 68°C til 72°C etter å ha spilt i en stund.
‘Til å begynne med, syntes det å være normalt—før neste morgen, da jeg innsett at disse ikke er idle-temperaturer, og at fansene fortsatt [gikk].
‘Jeg hadde gjort noen AI-overklokking etter å ha fikset noen ting nylig, så jeg var ikke sikker på om verdiene hadde bare spiket for høyt. Det har skjedd en gang før etter å ha installert ASUS AI Suite 3 – BIOS-innstillingene ville ikke engang fungere korrekt på grunn av det.
‘Uansett, jeg gikk videre og rullet tilbake til en eldre driver for nå.’
Under-Optimal
Den offisielle utgivelsen PDF for 576.02-driveroppdateringen tilbyr noen ledetråder om endringer som kan ha bidratt til de nye problemene. I seksjon 5.5, erkjenner NVIDIA at GPU-temperatur kan rapporteres feilaktig på NVIDIA Optimus-systemer, spesielt når den viser null grader når ingen applikasjoner kjører.

Seksjon 5.5 av den offisielle 576.02-oppdateringsnotatene omhandler temperatur-overvåkingsproblemer som synes å ha berørt et større antall systemer enn Optimus-systemet. Kilde: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
Utgivelsen slår fast:
5.5 GPU-temperatur rapportert feilaktig på Optimus-systemer
5.5.1 Problem
På Optimus-systemer, rapporterer temperatur-overvåkingsverktøy som Speccy eller GPU-Z at NVIDIA GPU-temperaturen er null når ingen applikasjoner kjører.
5.5.2 Forklaring
På Optimus-systemer, når NVIDIA GPU-en ikke er i bruk, blir den satt i en lav-strømtilstand. Dette får temperatur-overvåkingsverktøy til å returnere feilaktige verdier. Å våke opp GPU-en for å spørre om temperaturen ville resultere i meningsløse målinger fordi GPU-temperaturen endrer seg som en følge.
Disse verktøyene vil bare rapportere nøyaktige temperaturer når GPU-en er våken og kjører.
NVIDIA Optimus er en GPU-omskiftningsteknologi som skifter mellom integrert og diskret grafikk basert på applikasjonskrav, for å automatisk balansere ytelse og strømforbruk, designet for å spare batteriliv og redusere strømforbruk. For oppgaver som spill eller HD-videoavspilling, aktiverer Optimus den diskrete GPU-en for bedre ytelse; under lettere aktiviteter som nettlesing, går den tilbake til integrert (onboard) grafikk.
Oppdateringen synes å ha utvidet en atferd som tidligere var begrenset til Optimus-systemer, og lar den berørte GPU-en gå inn i en lav-strømtilstand mens den er inaktiv, selv når den ikke er vert for et Optimus-system, og dermed forstyrer temperatur-rapportering i tredjepartsverktøy.
Risikotilpasning
I de fleste scenarier er det rimelig å si at grafikkortets VBIOS sannsynligvis ville ha forhindret permanent GPU-skade. VBIOS pålegger termiske og strømbegrensninger på firmware-nivå, uavhengig av drivere.
Derfor, selv om en driver kunne årsake feilaktig fan-atferd eller misrapportere temperaturer, skulle VBIOS fortsatt begrense ytelse, øke fan-aktivitet eller ellers skru av GPU-en for å forhindre maskinvarefeil.
Dette betyr ikke at risikoen var ubetydelig – vedvarende høye temperaturer kan nedgrave ytelse over tid eller stress nærliggende komponenter; i tillegg, uten en felles forståelse av at en oppdatert driver forårsaket et problem (ikke minst i systemer hvor drivere oppdateres ‘stille’), kunne et problem av denne typen mislede en stor andel av berørte brukere, som kan prøve å fikse ikke-eksisterende problemer, eller sogar potensielt skade deres systemer ved å bruke ikke-relevante ‘fikser’.
Det feilaktige atferden forårsaket av oppdateringen 576.02 var spesielt alarmerende for de som var engasjert i kunstig intelligens-arbeidsflyter, hvor høy-ytelseshardware rutinemessig presses til termiske grenser over lengre perioder.
Den problematiske 576.02-drivere inspirerte en større rekke klager etter utgivelsen i midten av april, til tross for tidlige rapporter som indikerte at den tilbød noen gunstige ytelsesforbedringer. Uavhengig av tilgjengeligheten av hotfixen, og nivået av forstyrrelse som 576.02 synes å ha forårsaket, var den fortsatt tilgjengelig for nedlasting* på NVIDIA’s nettsted på tidspunktet for skriving.
Efterglød
I forhold til skaden fra den feilaktige oppdateringen, er det flere typer skader og/eller ulemper som er rapportert: brukeren Frankie_T9000 rapporterte at hans GPU krasjet på oppstart på grunn av varmeoppbygging under feil-oppdateringen, og bare stabiliserte etter å ha redusert spenningen. Han kommenterte ‘ser ut til å ikke være permanent skadet, men må gjøre om termisk paste så snart som mulig (jeg har pads som kommer onsdag) mistenker at den gamle termiske pasten var eldre på grunn av varmeoppbyggingen, så jeg setter inn nye pastepads.‘
I går sa en annen bruker i samme tråden at: ‘Jeg bruker en tilpasset fan-kurve med MSI Afterburner, og den viste at mine GPU-temperaturer var konstant på 27°C, så fansene gikk ikke på, som førte til overoppheting-problemer. Jeg trodde det var et problem med meg, men etter å ha installert den forrige drivere, fungerte alt igjen. Og temperaturene vises ikke korrekt i Task Manager.’
Selv om NVIDIA (som det stadig påpeker i hver hotfix-utgivelse) ofte gir ut hotfixer for bestemte videospill eller plattformer, er risikoen for varmeskade på eller rundt en GPU høyere for AI-praktikere enn for videospillere, siden intensive maskinlæringsprosesser som trening eller vedvarende inferens plasserer en GPU under konstant langvarig belastning – en hendelse som sannsynligvis vil bli utløst bare periodisk i et spill, som kan ‘spike’ inn i høy bruk for en boss-kamp eller en spesielt krevende kart-seksjon, men som ellers er designet som en kompromiss mellom GPU-utnyttelse og systemstabilitet.
* Arkiv: https://archive.ph/ylVR1
Først publisert tirsdag, 22. april 2025












