Ángulo de Anderson

NVIDIA lanza una solución temporal para el problema de sobrecalentamiento del controlador de GPU

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-40 and Adobe Firefly

Ayer, NVIDIA lanzó una solución temporal crítica para contener las consecuencias de una versión anterior del controlador que había generado alarma en las comunidades de inteligencia artificial y juegos, ya que hacía que los sistemas informáticos reportaran falsas temperaturas de GPU seguras, incluso cuando las demandas de enfriamiento aumentaban silenciosamente hacia niveles potencialmente críticos.

En la publicación oficial de NVIDIA sobre la solución temporal, aunque solo es el tercer punto en la lista de soluciones, el problema se cita como ‘Las herramientas de monitoreo de GPU pueden dejar de informar la temperatura de la GPU después de que la PC despierte del estado de suspensión’.

Poco después de que se lanzara el controlador Game Ready afectado, 576.02, un hilo destacado en el sub-Reddit de Stable Diffusion, titulado Lee para salvar tu GPU!, se convirtió en un recurso para problemas anecdóticos y actualizaciones informadas por los usuarios sobre el nuevo controlador. A partir de estos y otros informes en la web, se puede establecer una cronología de problemas emergentes.

El primer informe de Reddit sobre el error parece haber ocurrido a finales de la tarde del viernes en la zona horaria UTC, en el sub-Reddit de ZephyrusG14, donde el usuario fricy81 citó un mensaje en los foros de NVIDIA (archivado):

Un usuario en los foros de NVIDIA encuentra problemas después de la actualización 576.02. Fuente: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

Un usuario en los foros de NVIDIA encuentra problemas después de la actualización 576.02. Fuente: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

El usuario en los foros de NVIDIA informó que después de instalar la actualización del controlador, herramientas como MSI Afterburner y monitores en juegos como Call of Duty (que generalmente acceden a lecturas del sistema nativo, al igual que el panel de GPU de Task Manager en Windows) dejaron de actualizar las lecturas de temperatura de la GPU, congelándose en alrededor de 35-36°C.

Reiniciar el software de monitoreo no tuvo efecto, según el usuario, y solo un reinicio completo del sistema restauró las lecturas precisas. Herramientas como HWInfo y la aplicación de monitoreo de NVIDIA continuaron informando temperaturas correctamente. El usuario enfatizó que el problema ocurrió durante el uso normal, no solo después de que el sistema despertara del estado de suspensión.

La retroalimentación de los usuarios en varios foros destacó una interrupción general del comportamiento normal de la curva de ventilador y una alteración de la regulación térmica del núcleo, lo que resultó en unidades de procesamiento de gráficos que se mantuvieron a temperaturas inesperadamente altas en reposo y que se sobrecalentaban alarmantemente bajo cargas operativas estándar, como se detalla en este comentario:

‘Pude notar que algo estaba mal. El clima afuera probablemente estaba alrededor de 55°F / 12°C, pero me sentía como si estuviera cocinando vivo en mi habitación. Mi ventana estaba abierta y, sin embargo, no podía sentir ninguna diferencia. Todos los ventiladores estaban funcionando al máximo y las temperaturas parecían estar bien al principio, alrededor de 68°C a 72°C después de jugar durante un rato.

‘Al principio, parecía normal, hasta que a la mañana siguiente, cuando me di cuenta de que esas no eran temperaturas en reposo y que los ventiladores todavía estaban [funcionando].

‘Había hecho algunas sobrecargas de inteligencia artificial después de arreglar algunas cosas últimamente, así que no estaba seguro de si los valores habían aumentado demasiado. Ya había pasado algo así antes después de instalar ASUS AI Suite 3 – los ajustes de la BIOS no funcionaban correctamente debido a eso.

‘De cualquier manera, seguí adelante y volví a una versión anterior del controlador por ahora.’

Sub-óptimo

El lanzamiento oficial PDF para la actualización del controlador 576.02 ofrece algunas pistas sobre los cambios que pueden haber contribuido a los nuevos problemas. En la sección 5.5, NVIDIA reconoce que la temperatura de la GPU puede informarse incorrectamente en sistemas Optimus de NVIDIA, específicamente mostrando cero grados cuando no se ejecutan aplicaciones.

La sección 5.5 de las notas de la actualización oficial 576.02 aborda problemas de monitoreo de temperatura que parecen haber afectado a un número mayor de sistemas que el sistema Optimus. Fuente: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

La sección 5.5 de las notas de la actualización oficial 576.02 aborda problemas de monitoreo de temperatura que parecen haber afectado a un número mayor de sistemas que el sistema Optimus. Fuente: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

El lanzamiento establece:

5.5 Temperatura de la GPU informada incorrectamente en sistemas Optimus

5.5.1 Problema

En sistemas Optimus, las herramientas de informe de temperatura como Speccy o GPU-Z informan que la temperatura de la GPU de NVIDIA es cero cuando no se ejecutan aplicaciones.

5.5.2 Explicación

En sistemas Optimus, cuando la GPU de NVIDIA no se está utilizando, se coloca en un estado de baja potencia. Esto hace que las herramientas de informe de temperatura devuelvan valores incorrectos. Despertar a la GPU para consultar la temperatura resultaría en mediciones sin sentido porque la temperatura de la GPU cambiaría como resultado.

Estas herramientas solo informarán temperaturas precisas cuando la GPU esté despierta y en funcionamiento.

NVIDIA Optimus es una tecnología de conmutación de GPU que alterna entre gráficos integrados y discretos según la demanda de la aplicación, con el fin de equilibrar automáticamente el rendimiento y el consumo de energía, diseñada para conservar la vida útil de la batería y reducir el consumo de energía. Para tareas como juegos o reproducción de video HD, Optimus activa la GPU discreta para un mejor rendimiento; durante actividades más ligeras como la navegación web, reverts a gráficos integrados (a bordo).

La actualización parece haber extendido un comportamiento previamente limitado a sistemas Optimus, permitiendo que la GPU afectada entre en un estado de baja potencia mientras está inactiva, incluso cuando no se ejecuta en un sistema Optimus, lo que a su vez interrumpe el informe de temperatura en herramientas de terceros.

Ajuste de riesgo

En la mayoría de los escenarios, es justo decir que el VBIOS de la tarjeta gráfica probablemente habría evitado daños permanentes a la GPU. El VBIOS hace cumplir los límites térmicos y de potencia a nivel de firmware, de forma independiente del controlador.

Por lo tanto, incluso si un controlador causara un comportamiento de ventilador incorrecto o informara temperaturas incorrectas, el VBIOS aún reduciría el rendimiento, aumentaría la actividad del ventilador o apagaría la GPU para prevenir daños al hardware.

Eso no significa que el riesgo fuera trivial – temperaturas sostenidas pueden degradar el rendimiento con el tiempo o estresar componentes adyacentes; además, sin una comprensión común de que una actualización del controlador causó un problema (no menos en sistemas donde los controladores se actualizan ‘silenciosamente’), un problema de este tipo podría engañar a una gran proporción de usuarios afectados, que pueden intentar remedios para problemas no existentes o incluso causar daños a sus sistemas al aplicar ‘soluciones’ no relevantes.

El comportamiento errático causado por la actualización 576.02 fue particularmente alarmante para aquellos involucrados en flujos de trabajo de inteligencia artificial, donde se empuja regularmente el hardware de alto rendimiento a sus límites térmicos durante períodos prolongados.

El controlador problemático 576.02 inspiró una oleada más amplia de quejas después de su lanzamiento a mediados de abril, a pesar de los informes iniciales que indicaban que ofrecía algunas mejoras de rendimiento beneficiosas. A pesar de la provisión de la solución temporal y del nivel de interrupción que 576.02 parece haber causado, en el momento de la redacción, todavía está disponible para descarga* en el sitio web de NVIDIA.

Resplandor

En términos de las consecuencias de la actualización defectuosa, hay varios tipos de daños e inconvenientes informados: el usuario Frankie_T9000 informó que su GPU se bloqueó en el arranque debido al aumento de temperatura bajo la actualización defectuosa y solo se estabilizó después de reducir la tensión. Comentó ‘parece que no está dañado permanentemente, pero necesito volver a aplicar el pegamento lo antes posible (tengo almohadillas que llegan el miércoles) sospecho que el pegamento térmico antiguo se ha envejecido más por el aumento de temperatura, así que estoy poniendo pegamento y almohadillas nuevas.

Ayer, otro usuario en el mismo hilo declaró: ‘Estoy utilizando una curva de ventilador personalizada con MSI Afterburner, y me mostraba que mis temperaturas de GPU estaban constantemente a 27°C, así que los ventiladores no se encendían, lo que llevó a problemas de sobrecalentamiento. Pensé que era un problema mío, pero después de instalar el controlador anterior, todo volvió a funcionar correctamente. Además, las temperaturas no se muestran correctamente en el Administrador de tareas.’

Aunque NVIDIA (como establece persistentemente en cada lanzamiento de solución temporal) a menudo proporciona soluciones temporales para juegos o plataformas específicas, el riesgo de daño por calor a la GPU o alrededor de ella es mayor para los practicantes de inteligencia artificial que para los jugadores de videojuegos, ya que los procesos de aprendizaje automático intensivos, como el entrenamiento o la inferencia sostenida, colocan la GPU bajo carga a largo plazo – un evento que probablemente se active solo periódicamente en un juego, que puede ‘disparar’ hacia un uso alto para una batalla de jefe o una sección del mapa particularmente exigente, pero que de otro modo se diseñó como un compromiso entre la explotación de la GPU y la estabilidad del sistema.

 

* Archivo: https://archive.ph/ylVR1

Publicado por primera vez el martes 22 de abril de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai