Andersons vinkel

NVIDIA släpper hotfix för GPU-drivrutins överhettning

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPT-40 and Adobe Firefly

Igår släppte NVIDIA en kritisk hotfix för att begränsa skadorna från en tidigare drivrutinsversion som hade orsakat larm i AI- och spelsamhällen genom att få systemen att felaktigt rapportera säkra GPU-temperaturer – även om kylkraven tyst ökade mot potentiellt kritiska nivåer.

I NVIDIA:s officiella inlägg kring hotfix-utgåvan, fast det bara är tredje punkten på listan över angivna korrigeringar, nämns problemet som ‘GPU-övervakningsverktyg kan sluta rapportera GPU-temperaturen efter att datorn vaknat från sömn’.

Strax efter att den påverkade Game Ready-drivrutin 576.02 hade släppts, blev en pinned tråd på Stable Diffusion-subreddit, med titeln Läs för att rädda din GPU!, en resurs för anekdotiska problem och användarrapporter om den nya drivrutinen. Från dessa, och andra rapporter på webben, kan en tidslinje för framväxande problem fastställas.

Den första Reddit-rapporten om buggen tycks ha inträffat sent på fredagseftermiddagen UTC, på ZephyrusG14-subreddit, där användaren fricy81 citerade ett inlägg på NVIDIA-forum (arkiverad):

En användare på NVIDIA-forum upptäcker problem efter uppdatering till 576.02. Källa: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

En användare på NVIDIA-forum upptäcker problem efter uppdatering till 576.02. Källa: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

Användaren på NVIDIA-forum rapporterade att efter att ha installerat drivrutinsuppdateringen, slutade verktyg som MSI Afterburner och in-game-övervakare som den i Call of Duty (som vanligtvis åtkommer nativa systemläsningar, liknande Task Managers GPU-panel i Windows) att uppdatera GPU-temperaturer, och frös vid cirka 35-36°C.

Att starta om övervakningsprogrammet hade ingen effekt, enligt användaren, och endast en fullständig systemomstart kunde återställa korrekta läsningar. Verktyg som HWInfo och NVIDIA:s egen övervakningsapp fortsatte att rapportera temperaturer korrekt. Användaren betonade att problemet uppstod under normal användning, inte bara efter att systemet vaknat från sömn.

Användarfeedback på olika forum betonade en allmän störning av normal fläktkurvabeteende och en förändring av kärntermisk reglering, vilket resulterade i att grafikprocessorer låg stilla vid oväntat höga temperaturer, och överhettade under vad som normalt anses vara standardbelastningar, som beskrivs i den här kommentaren:

‘Jag kunde se att något var fel. Vädret utanför var förmodligen runt 55°F / 12°C, men jag kokade levande i mitt rum. Mitt fönster var öppet, och ändå kunde jag inte känna någon skillnad. Alla fläktar gick på max, och temperaturerna såg bra ut vid första anblicken—runt 68°C till 72°C efter att ha spelat en stund.

‘Först verkade det normalt—tills nästa morgon, när jag insåg att det inte var vilande temperaturer, och fläktarna fortfarande gick.’

‘Jag hade gjort någon AI-överklockning efter att ha fixat några saker nyligen, så jag visste inte om värdena hade skjutit för högt. Det har hänt en gång tidigare efter att ha installerat ASUS AI Suite 3 – BIOS-inställningarna fungerade inte ens ordentligt på grund av det.

‘Hur som helst, jag gick vidare och rullade tillbaka till en äldre drivrutin för tillfället.’

Underoptimal

Den officiella utgåvan PDF för drivrutinsuppdateringen 576.02 erbjuder några ledtrådar om de förändringar som kan ha bidragit till de nya problemen. I avsnitt 5.5 erkänner NVIDIA att GPU-temperaturen kan rapporteras felaktigt på NVIDIA Optimus-system, specifikt visar noll grader när inga applikationer körs.

Avsnitt 5.5 i den officiella 576.02-uppdateringsnoten behandlar temperaturövervakningsproblem som tycks ha påverkat ett större antal system än Optimus-system. Källa: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

Avsnitt 5.5 i den officiella 576.02-uppdateringsnoten behandlar temperaturövervakningsproblem som tycks ha påverkat ett större antal system än Optimus-system. Källa: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

Utgåvan förklarar:

5.5 GPU-temperatur rapporteras felaktigt på Optimus-system

5.5.1 Problem

På Optimus-system rapporterar temperaturövervakningsverktyg som Speccy eller GPU-Z att NVIDIA GPU-temperaturen är noll när inga applikationer körs.

5.5.2 Förklaring

På Optimus-system, när NVIDIA GPU inte används, sätts den i ett lågeffektläge. Detta får temperaturövervakningsverktyg att returnera felaktiga värden. Att väcka GPU:n för att fråga om temperaturen skulle resultera i meningslösa mätningar eftersom GPU-temperaturen förändras som en följd.

De här verktygen rapporterar korrekta temperaturer endast när GPU:n är vaken och körs.

NVIDIA Optimus är en GPU-omkopplings-teknik som växlar mellan integrerad och diskret grafik beroende på applikationskrav, för att automatiskt balansera prestanda och effektförbrukning, designad för att spara batteritid och minska effektförbrukning. För uppgifter som spel eller HD-videoavspelning aktiverar Optimus den diskreta GPU:n för bättre prestanda; under lättare aktiviteter som webbläsning återgår den till integrerad (inbyggd) grafik.

Uppdateringen tycks ha utvidgat ett beteende som tidigare var begränsat till Optimus-system, och låter den påverkade GPU:n gå in i ett lågeffektläge när den är inaktiv, även när den inte är värd på ett Optimus-system, vilket stör temperaturövervakningen i tredjepartsverktyg.

Riskjustering

I de flesta scenarier är det rimligt att säga att grafikkortets VBIOS troligen skulle ha förhindrat permanent GPU-skada. VBIOS tillämpar termiska och effektbegränsningar på firmware-nivå, oberoende av drivrutinen.

Därför, även om en drivrutin skulle orsaka felaktigt fläktbeteende eller felaktig temperaturrapportering, skulle VBIOS fortfarande dämpa prestandan, öka fläktaktiviteten eller stänga av GPU:n för att förhindra maskinvarufel.

Det betyder inte att risken var försumbar – långvariga höga temperaturer kan försämra prestandan över tid eller påverka intilliggande komponenter; dessutom, utan en allmän förståelse för att en uppdaterad drivrutin orsakat problemet (inte minst i system där drivrutiner uppdateras “tyst”), kunde ett problem av den här naturen vilseleda en stor andel av påverkade användare, som kan försöka åtgärda icke-existerande problem eller till och med orsaka skada på sina system genom att tillämpa icke-relevanta “lösningar”.

Det felaktiga beteendet som orsakades av uppdatering 576.02 var särskilt alarmerande för de som är engagerade i artificiell intelligens-arbetsflöden, där högpresterande maskinvara rutinmässigt pressas till sina termiska gränser under långa perioder.

Den problematiska 576.02-drivrutinen inspirerade en bredare våg av klagomål efter dess utgåva i mitten av april, trots initiala rapporter som tydde på att den erbjöd vissa prestandaförbättringar. Trots tillhandahållandet av hotfixen och den nivå av störning som 576.02 tycks ha orsakat, förblev den vid skrivande stund fortfarande tillgänglig för nedladdning* på NVIDIA:s webbplats.

Efterdyning

I termer av följderna av den felaktiga uppdateringen, finns det många typer av skador och olägenheter som rapporteras: användaren Frankie_T9000 rapporterade att hans GPU kraschade vid start på grund av värmeuppbyggnad under den felaktiga uppdateringen, och stabiliserades endast efter att ha reducerat spänningen. Han kommenterade ‘det ser ut som att det inte är permanent skadat, men jag behöver återlimma så snart som möjligt (jag har pads som kommer på onsdag) jag misstänker att den gamla termiska pastan var mer åldrad på grund av värmeuppbyggnaden, så jag sätter in nya pastapads.

Igår rapporterade en annan användare i samma tråd att: ‘Jag använder en anpassad fläktkurva med MSI Afterburner, och den visade att min GPU-temperatur var konstant 27°C, så fläktarna startade inte, vilket ledde till överhettning. Jag trodde att det var ett problem med mig, men efter att ha installerat den föregående drivrutinen fungerade allt bra igen. Dessutom visas temperaturerna inte korrekt i Aktivitetshanteraren.’

Även om NVIDIA (som den påpekar konsekvent i varje hotfix-utgåva) ofta tillhandahåller hotfixar för specifika videospel eller plattformar, är risken för värmskada på eller runt en GPU högre för AI-utövare än för spelare, eftersom intensiva maskinlärningsprocesser som utbildning eller långvarig inferens utsätter en GPU för konstant långvarig belastning – en händelse som troligen kommer att utlösas endast periodiskt i ett spel, som kan “spika” till hög användning under en boss-strid eller en särskilt krävande kartsektion, men som i övrigt är designad som en kompromiss mellan GPU-utnyttjande och systemsäkerhet.

 

* Arkiv: https://archive.ph/ylVR1

Publicerad första gången tisdag, 22 april 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai