Andersons hoek
NVIDIA Brengt Hotfix Uit voor Oververhittingsprobleem van GPU-Stuurprogramma

Gisteren heeft NVIDIA een kritische hotfix uitgebracht om de gevolgen van een eerdere stuurprogramma-update te beteugelen, die alarm had geslagen bij AI- en gamingsgemeenschappen doordat systemen vals meldingen gaven over veilige GPU-temperaturen – zelfs terwijl de koelingsbehoeften stilzwijgend toenamen naar potentieel kritische niveaus.
In NVIDIA’s officiële bericht over de hotfix-release, wordt het probleem, hoewel slechts derde in de lijst van vermelde fixes, aangeduid als ‘GPU-monitoringshulpmiddelen kunnen stoppen met het melden van de GPU-temperatuur nadat de PC ontwaakt uit de slaapstand’.
Kort na de release van de getroffen Game Ready-stuurprogramma 576.02 werd een gepinde thread op de Stable Diffusion-sub-Reddit, getiteld Lees om uw GPU te redden!, een bron van anekdotische problemen en door gebruikers gerapporteerde updates over de nieuwe stuurprogramma. Vanuit deze, en andere rapporten op het web, kan een tijdslijn van opkomende problemen worden vastgesteld.
De eerste Reddit-rapportage van de bug lijkt te zijn opgetreden laat op vrijdagmiddag UTC, op de ZephyrusG14-subreddit, waar de gebruiker fricy81 een bericht op de NVIDIA-forums (gearchiveerd) vermeldde:

Een gebruiker op de NVIDIA-forums vindt problemen na de 576.02-update. Bron: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
De gebruiker op de NVIDIA-forums meldde dat na het installeren van de stuurprogramma-update, tools zoals MSI Afterburner en in-game-monitoren zoals die in Call of Duty (die over het algemeen native systeemlezingen toegang geven, net zoals het GPU-paneel van Task Manager in Windows) stopten met het bijwerken van GPU-temperatuurlezingen, bevriezend op ongeveer 35-36°C.
Het opnieuw starten van de monitoringssoftware had geen effect, zo stelde de gebruiker, en alleen een volledige systeemherstart kon accurate lezingen herstellen. Tools zoals HWInfo en NVIDIA’s eigen monitoringsapp bleven temperaturen correct melden. De gebruiker benadrukte dat het probleem zich voordeed tijdens normaal gebruik, niet alleen na het ontwaken van het systeem uit de slaapstand.
Gebruikersfeedback op verschillende forums benadrukte een algemene verstoring van normaal ventilatorcurvegedrag en een wijziging van corethermoregulatie, resulterend in graphicsprocessingunits die op onverwacht hoge temperaturen idlen en alarmerend oververhitten onder wat normaal gesproken als standaardoperationele lasten zou worden beschouwd, zoals hier vermeld:
‘Ik kon zien dat er iets mis was. Het weer buiten was waarschijnlijk ongeveer 55°F / 12°C, maar ik was aan het koken in mijn kamer. Mijn raam was open, en toch kon ik geen verschil voelen. Alle ventilatoren draaiden op volle toeren, en de temperaturen leken goed aanvankelijk—rond de 68°C tot 72°C na een tijdje gamen.
‘Aanvankelijk leek dat normaal—tot de volgende ochtend, toen ik besefte dat die temperaturen niet in rust waren, en de ventilatoren nog steeds [draaiden].
‘Ik had enige tijd geleden enkele dingen gefixed en was niet zeker of de waarden te hoog waren gespiekt. Het is eerder gebeurd na het installeren van ASUS AI Suite 3 – de BIOS-instellingen werkten niet eens goed vanwege het.
‘Ik ben teruggegaan naar een oudere stuurprogramma voorlopig.’
Onderoptimaal
De officiële release PDF voor de 576.02-stuurprogramma-update biedt enkele aanwijzingen over wijzigingen die mogelijk hebben bijgedragen tot de nieuwe problemen. In sectie 5.5 erkent NVIDIA dat de GPU-temperatuur onjuist kan worden gerapporteerd op NVIDIA Optimus-systemen, specifiek door nul graden te laten zien wanneer geen toepassingen worden uitgevoerd.

Sectie 5.5 van de officiële 576.02-update-notities behandelt temperatuurmonitoringsproblemen die een groter aantal systemen lijken te hebben beïnvloed dan het Optimus-systeem. Bron: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
De release vermeldt:
5.5 GPU-temperatuur onjuist gerapporteerd op Optimus-systemen
5.5.1 Probleem
Op Optimus-systemen melden temperatuurrapportagetools zoals Speccy of GPU-Z dat de NVIDIA GPU-temperatuur nul is wanneer geen toepassingen worden uitgevoerd.
5.5.2 Verklaring
Op Optimus-systemen wordt de NVIDIA GPU in een lage-energiestatus geplaatst wanneer deze niet wordt gebruikt. Dit zorgt ervoor dat temperatuurrapportagetools onjuiste waarden retourneren. Het activeren van de GPU om de temperatuur op te vragen zou tot zinloze metingen leiden, omdat de GPU-temperatuur als gevolg daarvan zou veranderen.
Deze tools melden alleen accurate temperaturen wanneer de GPU actief is en draait.
NVIDIA Optimus is een GPU-switchingtechnologie die tussen geïntegreerde en discrete graphics schakelt op basis van toepassingsvereisten, om prestaties en energieverbruik automatisch in evenwicht te brengen, ontworpen om batterijlevensduur te besparen en energieverbruik te verminderen. Voor taken zoals gamen of HD-videoweergave activeert Optimus de discrete GPU voor betere prestaties; tijdens lichtere activiteiten zoals webbrowsen, keert het terug naar geïntegreerde (onboard) graphics.
De update lijkt een gedrag te hebben uitgebreid dat eerder beperkt was tot Optimus-systemen, waardoor de getroffen GPU in een lage-energiestatus kan komen wanneer deze inactief is, zelfs wanneer deze niet op een Optimus-systeem wordt gehost, waardoor de temperatuurrapportage in derdensoftware wordt verstoord.
Risicoaanpassing
In de meeste scenario’s is het redelijk om te zeggen dat de VBIOS van de grafische kaart waarschijnlijk permanente GPU-schade had voorkomen. VBIOS handhaaft thermische en vermogenslimieten op firmware-niveau, onafhankelijk van de stuurprogramma.
Daarom zou zelfs als een stuurprogramma onjuist ventilatorgedrag zou veroorzaken of temperaturen onjuist zou melden, de VBIOS nog steeds prestaties zou beperken, ventilatoractiviteit zou verhogen of de GPU zou uitschakelen om hardwarefouten te voorkomen.
Dat betekent niet dat het risico triviaal was – langdurig hoge temperaturen kunnen de prestaties over tijd verslechteren of aangrenzende componenten belasten; bovendien kan een probleem van deze aard een groot aantal getroffen gebruikers misleiden, die mogelijk remedies voor niet-bestaande problemen zullen proberen of zelfs potentieel schade aan hun systemen zullen veroorzaken door het toepassen van niet-relevante ‘oplossingen’.
Het foutieve gedrag veroorzaakt door de update 576.02 was bijzonder alarmerend voor diegenen die betrokken waren bij kunstmatige intelligentie-workflows, waarbij hoge prestatiehardware routinematig tot zijn thermische limieten wordt gedreven voor verlengde perioden.
De problematische 576.02-stuurprogramma inspireerde een bredere reeks klachten na zijn release in mid-april, ondanks aanvankelijke rapporten dat het enkele gunstige prestatieverbeteringen bood. Ondanks de beschikbaarheid van de hotfix en het niveau van verstoring dat 576.02 lijkt te hebben veroorzaakt, blijft het op het moment van schrijven beschikbaar voor download* op de website van NVIDIA.
Nasleep
In termen van de nasleep van de defecte update, zijn er verschillende soorten schade en ongemak gemeld: gebruiker Frankie_T9000 meldde dat zijn GPU crashte bij het opstarten vanwege hitteopbouw onder de foutieve update, en alleen stabiliseerde na undervolting. Hij merkte op ‘het lijkt erop dat het niet permanent is beschadigd, maar ik moet het zo snel mogelijk opnieuw solderen (ik heb pads besteld die woensdag arriveren) vermoed dat de oude thermische pasta meer door de hitteopbouw is verouderd, dus ik ga nieuwe pasta-pads gebruiken.‘
Gisteren meldde een andere gebruiker in dezelfde thread dat: ‘Ik gebruik een aangepaste ventilatorcurve met MSI Afterburner, en het liet zien dat mijn GPU-temperaturen constant 27°C waren, dus de ventilatoren gingen niet aan, wat leidde tot oververhittingsproblemen. Ik dacht dat het een probleem van mij was, maar na het installeren van de vorige stuurprogramma werkte alles weer goed. Ook worden de temperaturen niet correct weergegeven in Task Manager.’
Hoewel NVIDIA (zoals het persistent in elke hotfix-release vermeldt) vaak hotfixes biedt voor specifieke videospellen of platforms, is het risico op warmteschade aan of rond een GPU hoger voor AI-praktijken dan voor videogamers, aangezien intensieve machine learning-processen zoals training of duurzame inferentie een GPU onder consistente langdurige belasting plaatsen – een gebeurtenis die waarschijnlijk alleen periodiek in een spel wordt geactiveerd, dat mogelijk ‘spikes’ in hoog gebruik heeft voor een baasgevecht of een bijzonder veeleisende kaartsectie, maar dat anders is ontworpen als een compromis tussen GPU-exploitatie en systeemstabiliteit.
* Archief: https://archive.ph/ylVR1
First published dinsdag, 22 april 2025












