Andersons vinkel
NVIDIA Udsender Hotfix til GPU-Drivers Overophedingsproblemer

I går udsendte NVIDIA en kritisk hotfix for at begrænse skaderne fra en tidligere driverudgivelse, der havde udløst alarm i både AI- og gamingsamfundene ved at få systemer til at fejlagtigt rapportere sikre GPU-temperaturer – selvom kølekravene stille og roligt steg mod potentielt kritiske niveauer.
I NVIDIA’s officielle meddelelse omkring hotfix-udgivelsen, selvom det kun er tredje punkt på listen over nævnte rettelser, nævnes problemet som ‘GPU-overvågningsværktøjer kan stoppe med at rapportere GPU-temperaturen efter, at computeren er vågnet fra søvn’.
Kort efter, at den berørte Game Ready-driver 576.02 var udsendt, blev en fastgjort tråd på Stable Diffusion-subreddit, med titlen Læs for at redde din GPU!, til en ressource for anekdotiske problemer og bruger-rapporter om den nye driver. Fra disse og andre rapporter på nettet kan en tidslinje for opståede problemer etableres.
Den første Reddit-rapport om fejlen synes at have fundet sted sent på fredag eftermiddag UTC, på ZephyrusG14-subreddit, hvor brugeren fricy81 citerede en post på NVIDIA-fora (arkiveret):

En bruger på NVIDIA-fora finder problemer efter 576.02-opdateringen. Kilde: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
Brugeren på NVIDIA-fora rapporterede, at efter installation af driveropdateringen, værktøjer som MSI Afterburner og in-game-monitore som den i Call of Duty (som normalt har adgang til native systemlæsninger, ligesom Task Manager’s GPU-panel gør i Windows) stoppede med at opdatere GPU-temperatur-læsninger, og frøs på omkring 35-36°C.
Genstart af overvågningssoftwaren havde ingen effekt, sagde brugeren, og kun en fuld systemgenstart kunne gendanne nøjagtige læsninger. Værktøjer som HWInfo og NVIDIA’s egen overvågningsapp fortsatte med at rapportere temperaturer korrekt. Brugeren understregede, at problemet opstod under normal brug, og ikke kun efter, at systemet var vågnet fra søvn.
Brugertilbagemeldinger på forskellige fora fremhævede en generel forstyrrelse af normal fan-kurve-adfærd og en ændring af kerne-termisk regulering, hvilket resulterede i, at grafikprocessorerne lå stille i uventet høje temperaturer, og overophedede under, hvad der normalt ville blive betragtet som standard operationelle belastninger, som detaljeret i denne kommentar:
‘Jeg kunne se, at noget var galt. Vejret udenfor var sandsynligvis omkring 55°F / 12°C, men jeg var ved at koge i live i mit værelse. Mit vindue var åbent, og alligevel kunne jeg ikke føle nogen forskel. Alle fansene kørte på maks, og temperaturerne så ud til at være fine til at starte med—omkring 68°C til 72°C efter at have spillet i en periode.
‘Til at starte med syntes det normalt—indtil næste morgen, da jeg indså, at det ikke var idle-temperaturer, og at fansene stadig var i gang.
‘Jeg havde lavet nogen AI-overklokning efter at have rettet nogle ting for nylig, så jeg var ikke sikker på, om værdierne bare var steget for højt. Det er sket en gang før efter installation af ASUS AI Suite 3 – BIOS-indstillingerne ville ikke engang fungere korrekt på grund af det.
‘Jeg gik i gang og rullede tilbage til en ældre driver for nu.
Underoptimal
Den officielle udgivelses-PDF for 576.02-driveropdateringen tilbyder nogen ledetråde om ændringer, der kan have bidraget til de nye problemer. I afsnit 5.5 anerkender NVIDIA, at GPU-temperatur kan rapporteres forkert på NVIDIA Optimus-systemer, specifikt viser nul grader, når der ikke kører nogen programmer.

Afsnit 5.5 i den officielle 576.02-opdateringsnoter omhandler temperatur-overvågningsproblemer, der synes at have påvirket et større antal systemer end Optimus-systemet. Kilde: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
Udgivelsen fastslår:
5.5 GPU-temperatur rapporteres forkert på Optimus-systemer
5.5.1 Problem
På Optimus-systemer rapporterer temperatur-overvågningsværktøjer som Speccy eller GPU-Z, at NVIDIA GPU-temperaturen er nul, når der ikke kører nogen programmer.
5.5.2 Forklaring
På Optimus-systemer, når NVIDIA GPU ikke er i brug, sættes det i en lavstrøms tilstand. Dette får temperatur-overvågningsværktøjer til at returnere forkerte værdier. At vække GPU’en for at afhøre temperaturen ville resultere i meningsløse målinger, fordi GPU-temperaturen ændrer sig herefter.
Disse værktøjer vil kun rapportere nøjagtige temperaturer, når GPU’en er vågen og kører.
NVIDIA Optimus er en GPU-skifteteknologi, der skifter mellem integreret og separat grafik afhængigt af programkrav, for at automatisk balancere ydelse og strømforbrug, designet til at spare batteriliv og reducere strømforbrug. Til opgaver som gaming eller HD-videoafspilning, aktiverer Optimus den separate GPU for bedre ydelse; under lettere aktiviteter som webbrowsing, går den tilbage til integreret (onboard) grafik.
Opdateringen synes at have udvidet en adfærd, der tidligere var begrænset til Optimus-systemer, og tillader den berørte GPU at gå i en lavstrøms tilstand, selv når den ikke er på et Optimus-system, hvilket forstyrrer temperatur-rapportering i tredjeparts-værktøjer.
Risikotilpasning
I de fleste scenarier er det rimeligt at sige, at grafikkortets VBIOS sandsynligvis ville have forhindret permanent GPU-skade. VBIOS gennemtvinger termiske og strøm begrænsninger på firmware-niveau, uafhængigt af driveren.
Derfor, selv hvis en driver ville forårsage forkert fan-adfærd eller misrapportere temperaturer, skulle VBIOS stadig begrænse ydelsen, øge fan-aktivitet eller lukke GPU’en for at forhindre hardware-fejl.
Det betyder ikke, at risikoen var trivial – vedvarende høje temperaturer kan nedgrade ydelsen over tid eller belaste tilstødende komponenter; desuden, uden en fælles forståelse af, at en opdateret driver forårsagede et problem (især i systemer, hvor drivere opdateres ‘stille’), kunne et problem af denne art mislede en stor proportion af berørte brugere, der måske ville forsøge at afhjælpe ikke-eksisterende problemer eller endda potentielt forårsage skade på deres systemer ved at anvende ikke-relevante ‘løsninger’.
Den fejlende adfærd, forårsaget af opdatering 576.02, var særligt alarmerende for dem, der var engageret i kunstig intelligens-arbejdsprocesser, hvor høj-ydelseshardware rutinemæssigt presses til dens termiske grænser i længere perioder.
Den problematiske 576.02-driver inspirerede en bredere rash af klager efter dens udgivelse i midten af april, på trods af de første rapporter, der tydede på, at den tilbød nogen gavnlige ydelsesforbedringer. Trods tilbudet af hotfixen og niveauet af forstyrrelse, som 576.02 synes at have forårsaget, er den på skrivestiden stadig tilgængelig til download* på NVIDIA’s side.
Eftergløden
I forhold til følgerne af den fejlbehæftede opdatering, er der talrige typer skader og/eller ulemper rapporteret: brugeren Frankie_T9000 rapporterer, at hans GPU crashed ved opstart på grund af varmeopbygning under fejl-opdateringen, og kun stabiliserede efter under-volting. Han kommenterede ‘det ser ud til, at det ikke er permanent skadet, men jeg har brug for at gensende det så hurtigt som muligt (jeg har pads på vej onsdag) Jeg mistænker, at den gamle termiske paste var ældre på grund af varmeopbygningen, så jeg sætter nye paste-pads.‘
I går sagde en anden bruger i samme tråd : ‘Jeg bruger en brugerdefineret fan-kurve med MSI Afterburner, og den viste, at mine GPU-temperaturer konstant var på 27°C, så fansene blev ikke aktiveret, hvilket resulterede i overophedingsproblemer. Jeg troede, det var et problem med mig, men efter at have installeret den forrige driver, fungerede alt igen.
Selv om NVIDIA (som det fastslår vedvarende i hver hotfix-udgivelse) ofte tilbyder hotfixer til bestemte videospil eller platforme, er risikoen for varmeskade på eller omkring en GPU højere for AI-praktikere end for videospillere, da intensive maskinlæringsprocesser som træning eller vedvarende slutning placerer en GPU under konstant langvarig belastning – en begivenhed, der sandsynligvis kun udløses periodisk i et spil, der måske ‘spiker’ til høj brug under en boss-kamp eller en særligt krævende kort-sektion, men som ellers er designet som en kompromis mellem GPU-udnyttelse og systemstabilitet.
* Arkiv: https://archive.ph/ylVR1
Først udgivet tirsdag, 22. april 2025












