Ângulo de Anderson
A NVIDIA Lança uma Correção de Erro para o Problema de Superaquecimento do Driver da GPU

Ontem, a NVIDIA (NVDA ) lançou uma correção de erro crítica para conter as consequências de uma versão anterior do driver que havia causado alarme nas comunidades de IA e jogos, fazendo com que os sistemas relatassem falsamente temperaturas de GPU seguras – mesmo enquanto as demandas de refrigeração aumentavam silenciosamente em direção a níveis potencialmente críticos.
No post oficial da NVIDIA sobre a liberação da correção de erro, embora seja apenas o terceiro item da lista de correções, o problema é citado como ‘As utilitários de monitoramento de GPU podem parar de relatar a temperatura da GPU após o PC acordar do modo de suspensão’.
Logo após a liberação do driver Game Ready afetado 576.02, uma thread fixa no sub-Reddit da Stable Diffusion, intitulada Leia para Salvar sua GPU!, se tornou um recurso para problemas anedóticos e atualizações relatadas pelos usuários sobre o novo driver. A partir desses e outros relatos na web, é possível estabelecer uma linha do tempo de problemas emergentes.
O primeiro relato de bug no Reddit parece ter ocorrido no final da tarde de sexta-feira, horário de UTC, no subreddit ZephyrusG14, onde o usuário fricy81 citou um post nos fóruns da NVIDIA (arquivado):

Um usuário nos fóruns da NVIDIA encontra problemas após a atualização para o 576.02. Fonte: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
O usuário nos fóruns da NVIDIA relatou que, após instalar a atualização do driver, ferramentas como o MSI Afterburner e monitores de jogo, como o do Call of Duty (que geralmente acessam leituras de sistema nativas, assim como o painel de GPU do Gerenciador de Tarefas no Windows) pararam de atualizar as leituras de temperatura da GPU, congelando em torno de 35-36°C.
A reinicialização do software de monitoramento não teve efeito, afirmou o usuário, e apenas uma reinicialização completa do sistema restaurou as leituras precisas. Ferramentas como o HWInfo e o aplicativo de monitoramento da NVIDIA continuaram a relatar temperaturas corretamente. O usuário enfatizou que o problema ocorreu durante o uso normal, não apenas após o sistema acordar do modo de suspensão.
Os feedbacks dos usuários em vários fóruns destacaram uma interrupção geral do comportamento normal da curva de ventoinha e uma alteração da regulação térmica de núcleo, resultando em unidades de processamento gráfico em repouso a temperaturas inesperadamente altas e superaquecendo alarmantemente sob cargas operacionais padrão, como detalhado neste comentário:
‘Eu podia dizer que algo estava errado. O tempo lá fora provavelmente estava em torno de 55°F / 12°C, mas eu estava cozinhando vivo no meu quarto. Minha janela estava aberta e, no entanto, eu não podia sentir nenhuma diferença. Todas as ventoinhas estavam funcionando no máximo e as temperaturas pareciam normais no início — em torno de 68°C a 72°C após jogar por um tempo.
‘No início, isso parecia normal — até a manhã seguinte, quando eu percebi que essas não são temperaturas de repouso e as ventoinhas ainda estavam [funcionando].
‘Eu havia feito alguns ajustes de overclocking de IA após consertar algumas coisas recentemente, então eu não sabia se os valores haviam apenas disparado muito alto. Isso aconteceu uma vez antes, após instalar o ASUS AI Suite 3 — as configurações do BIOS não funcionariam corretamente devido a isso.
‘De qualquer forma, eu fui em frente e voltei para um driver mais antigo por agora.’
Sub-Ótimo
A liberação oficial PDF para a atualização do driver 576.02 oferece algumas pistas sobre as alterações que podem ter contribuído para os novos problemas. Na seção 5.5, a NVIDIA reconhece que a temperatura da GPU pode ser relatada incorretamente em sistemas Optimus da NVIDIA, mostrando zero graus quando nenhum aplicativo está em execução.

A seção 5.5 das notas de atualização oficiais do 576.02 aborda problemas de monitoramento de temperatura que parecem ter afetado um número maior de sistemas do que o sistema Optimus. Fonte: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
A liberação afirma:
5.5 Temperatura da GPU Relatada Incorretamente em Sistemas Optimus
5.5.1 Problema
Nos sistemas Optimus, as ferramentas de relatório de temperatura, como o Speccy ou o GPU-Z, relatam que a temperatura da GPU da NVIDIA é zero quando nenhum aplicativo está em execução.
5.5.2 Explicação
Nos sistemas Optimus, quando a GPU da NVIDIA não está sendo usada, ela é colocada em um estado de baixa potência. Isso faz com que as ferramentas de relatório de temperatura retornem valores incorretos. Acordar a GPU para consultar a temperatura resultaria em medições sem sentido, pois a temperatura da GPU muda como resultado.
Essas ferramentas relatam temperaturas precisas apenas quando a GPU está acordada e em execução.
A NVIDIA Optimus é uma tecnologia de commutação de GPU que alterna entre gráficos integrados e discretos com base nas demandas do aplicativo, para equilibrar automaticamente o desempenho e o consumo de energia, projetada para conservar a vida útil da bateria e reduzir o consumo de energia. Para tarefas como jogos ou reprodução de vídeo HD, a Optimus ativa a GPU discreta para um melhor desempenho; durante atividades mais leves, como navegação na web, ela reverte para gráficos integrados (onboard).
A atualização parece ter estendido um comportamento anteriormente limitado a sistemas Optimus, permitindo que a GPU afetada entre em um estado de baixa potência enquanto ociosa, mesmo quando não hospedada em um sistema Optimus, interrompendo assim o relatório de temperatura em ferramentas de terceiros.
Ajuste de Risco
Na maioria dos cenários, é justo dizer que o VBIOS da placa gráfica provavelmente teria impedido danos permanentes à GPU. O VBIOS impõe limites térmicos e de energia no nível de firmware, independentemente do driver.
Portanto, mesmo que um driver cause um comportamento de ventoinha inadequado ou relatar temperaturas incorretamente, o VBIOS ainda reduziria o desempenho, aumentaria a atividade da ventoinha ou desligaria a GPU para prevenir falhas de hardware.
Isso não significa que o risco foi trivial — temperaturas altas sustentadas podem degradar o desempenho ao longo do tempo ou estressar componentes adjacentes; além disso, ausência de uma compreensão comum de que uma atualização de driver causou um problema (nem menos em sistemas onde os drivers são atualizados ‘silenciosamente’), um problema desse tipo poderia enganar uma grande proporção de usuários afetados, que podem tentar soluções para problemas inexistente ou até mesmo causar danos aos seus sistemas aplicando ‘soluções’ não relevantes.
O comportamento errante causado pela atualização 576.02 foi particularmente alarmante para aqueles envolvidos em fluxos de trabalho de inteligência artificial, onde hardware de alto desempenho é frequentemente empurrado a seus limites térmicos por períodos prolongados.
A atualização de driver problemática 576.02 inspirou uma onda mais ampla de reclamações após sua liberação em meados de abril, apesar de relatos iniciais que indicavam que oferecia algumas melhorias de desempenho benéficas. Não obstante a provisão da correção de erro e o nível de interrupção que 576.02 parece ter causado, na época da escrita, ainda está disponível para download* no site da NVIDIA.
Pós-Imagem
Em termos do impacto da atualização defeituosa, há vários tipos de danos e inconveniências relatados: o usuário Frankie_T9000 relatou que sua GPU travou na inicialização devido ao acúmulo de calor sob a atualização com defeito e só se estabilizou após a redução da voltagem. Ele comentou ‘parece que não foi permanentemente danificada, mas preciso repor o pasta térmico o mais rápido possível (tenho pads chegando na quarta-feira) suspeito que o pasta térmico antigo foi envelhecido mais pelo acúmulo de calor, então estou colocando novos pads.‘
Ontem, outro usuário na mesma thread afirmou: ‘Estou usando uma curva de ventoinha personalizada com o MSI Afterburner e ele continuava mostrando que as temperaturas da minha GPU estavam constantemente em 27°C, então as ventoinhas não ligavam, o que levou a problemas de superaquecimento. Pensei que era um problema meu, mas após instalar o driver anterior, tudo voltou a funcionar corretamente novamente. Além disso, as temperaturas não são exibidas corretamente no Gerenciador de Tarefas.’
Embora a NVIDIA (como afirma persistentemente em cada liberação de correção de erro) forneça frequentemente correções de erro para vídeo-jogos ou plataformas específicas, o risco de danos por calor à ou em torno de uma GPU é maior para os praticantes de IA do que para os jogadores de videogames, pois processos de aprendizado de máquina intensivos, como treinamento ou inferência sustentada, colocam uma GPU sob carga consistente de longo prazo – um evento provavelmente a ser disparado apenas periodicamente em um jogo, que pode ‘disparar’ em uso alto para uma batalha de chefe ou uma seção de mapa particularmente exigente, mas que é projetado como um compromisso entre a exploração da GPU e a estabilidade do sistema.
* Arquivo: https://archive.ph/ylVR1
Publicado pela primeira vez na terça-feira, 22 de abril de 2025












