Kąt Andersona
NVIDIA wydaje poprawkę awaryjną dla kierowcy GPU z powodu problemu z przegrzewaniem

Wczoraj NVIDIA opublikowała pilną poprawkę, aby powstrzymać skutki wcześniejszego wydania sterownika, które wywołało alarm w społecznościach AI i gier, powodując, że systemy fałszywie zgłaszały bezpieczne temperatury GPU – nawet gdy wymagania chłodzenia cichaczem rosły w kierunku potencjalnie krytycznych poziomów.
W oficjalnym poście dotyczącym wydania poprawki, choć tylko trzecim na liście podanych poprawek, problem jest cytowany jako ‘narzędzia do monitorowania GPU mogą przestać zgłaszać temperaturę GPU po wznowieniu pracy komputera z trybu uśpienia’.
Krótko po wydaniu dotkniętego sterownika 576.02, wątek przypięty na subredditzie Stable Diffusion, zatytułowany Przeczytaj, aby uratować swój GPU!, stał się źródłem anegdotycznych problemów i aktualizacji użytkowników dotyczących nowego sterownika. Z tych i innych raportów w sieci można ustalić pewną chronologię pojawiających się problemów.
Pierwszy raport o błędzie na Reddit wydaje się miał miejsce późnym popołudniem czasu uniwersalnego, na subredditzie ZephyrusG14, gdzie użytkownik fricy81 cytował post na forum NVIDIA (zarchiwizowany):

Użytkownik na forum NVIDIA znajduje problemy po aktualizacji 576.02. Źródło: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/
Użytkownik na forum NVIDIA zgłosił, że po zainstalowaniu aktualizacji sterownika, narzędzia takie jak MSI Afterburner i monitory w grach, takie jak ten w Call of Duty (które zwykle dostęp do rodzimych odczytów systemu, podobnie jak panel GPU w Menedżerze zadań w systemie Windows) przestały aktualizować odczyty temperatury GPU, zatrzymując się na poziomie około 35-36°C.
Uruchomienie ponowne oprogramowania monitorującego nie miało wpływu, jak stwierdził użytkownik, i tylko pełne ponowne uruchomienie systemu przywróciło dokładne odczyty. Narzędzia takie jak HWInfo i własna aplikacja monitorująca NVIDIA nadal zgłaszały temperatury poprawnie. Użytkownik podkreślił, że problem wystąpił podczas normalnego użytkowania, a nie tylko po wznowieniu pracy systemu z trybu uśpienia.
Opinie użytkowników na różnych forach podkreślały ogólne zakłócenie normalnego zachowania krzywej wentylatora i zmianę regulacji termicznej, w wyniku czego jednostki przetwarzania graficznego pracowały na nieoczekiwanie wysokich temperaturach, a alarmująco przegrzewały się pod obciążeniem, które zwykle uważa się za standardowe, jak opisano w tym komentarzu:
‘Mogłem powiedzieć, że coś jest nie tak. Pogoda na zewnątrz była prawdopodobnie około 55°F / 12°C, ale gotowałem się żywcem w moim pokoju. Moje okno było otwarte, a jednak nie czułem żadnej różnicy. Wszystkie wentylatory pracowały na maksimum, a temperatury wyglądały dobrze na początku – około 68°C do 72°C po grze przez jakiś czas.
‘Na początku wydawało się to normalne – dopóki następnego ranka nie zrealizowałem, że te temperatury to nie temperatury bezczynności, a wentylatory wciąż [działały].
‘Miałem problemy z przetaktowaniem AI po naprawieniu kilku rzeczy ostatnio, więc nie byłem pewien, czy wartości nie wzrosły zbyt wysoko. To już się zdarzyło raz po zainstalowaniu ASUS AI Suite 3 – ustawienia BIOS nie działały prawidłowo z tego powodu.
‘Tak czy inaczej, poszedłem naprzód i cofnąłem się do starszego sterownika na razie.’
Nieoptymalne
Oficjalna publikacja PDF dla aktualizacji sterownika 576.02 oferuje pewne wskazówki dotyczące zmian, które mogły przyczynić się do nowych problemów. W sekcji 5.5 NVIDIA przyznaje, że temperatura GPU może być zgłaszana niepoprawnie w systemach Optimus, konkretnie pokazując zero stopni, gdy nie są uruchomione żadne aplikacje.

Sekcja 5.5 oficjalnych notatek do aktualizacji 576.02 dotyczy problemów z monitorowaniem temperatury, które wydają się mieć wpływ na większą liczbę systemów niż system Optimus. Źródło: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf
Publikacja stwierdza:
5.5 Temperatura GPU zgłaszana niepoprawnie w systemach Optimus
5.5.1 Problem
W systemach Optimus, narzędzia do monitorowania temperatury, takie jak Speccy lub GPU-Z, zgłaszają, że temperatura GPU NVIDIA jest zero, gdy nie są uruchomione żadne aplikacje.
5.5.2 Wyjaśnienie
W systemach Optimus, gdy GPU NVIDIA nie jest używany, jest on ustawiony w stanie niskiej mocy. To powoduje, że narzędzia do monitorowania temperatury zwracają niepoprawne wartości. Wyzwolenie GPU w celu zapytania o temperaturę skutkowałoby bezsensownymi pomiarami, ponieważ temperatura GPU ulega zmianie w wyniku.
Te narzędzia zgłaszają dokładne temperatury tylko wtedy, gdy GPU jest aktywne i działają.
NVIDIA Optimus to technologia przełączania GPU, która przełącza się między grafiką zintegrowaną a dyskretną w zależności od wymagań aplikacji, w celu automatycznego wyważenia wydajności i zużycia mocy, zaprojektowanego w celu oszczędności baterii i redukcji zużycia mocy. Dla zadań takich jak gry lub odtwarzanie wideo HD, Optimus aktywuje dyskretny GPU dla lepszej wydajności; podczas lżejszych działań, takich jak przeglądanie sieci, przechodzi do grafiki zintegrowanej (wbudowanej).
Aktualizacja wydaje się rozszerzać zachowanie wcześniej ograniczone do systemów Optimus, pozwalając na wejście w stan niskiej mocy, nawet gdy nie jest ono hostowane na systemie Optimus, co z kolei zakłóca raportowanie temperatury w narzędziach trzecich.
Dostosowanie ryzyka
W większości scenariuszy można powiedzieć, że karta graficzna VBIOS najprawdopodobniej uniemożliwiłaby trwałe uszkodzenie GPU. VBIOS egzekwuje ograniczenia termiczne i mocy na poziomie oprogramowania układowego, niezależnie od sterownika.
Nie oznacza to, że ryzyko było trywialne – utrzymujące się wysokie temperatury mogą pogorszyć wydajność w czasie lub stresować sąsiednie komponenty; dodatkowo, brak powszechnego zrozumienia, że zaktualizowany sterownik spowodował problem (nawet w systemach, w których sterowniki aktualizują się “cicho”), problem tego rodzaju mógłby wprowadzić w błąd dużą część dotkniętych użytkowników, którzy mogliby próbować rozwiązań dla nieistniejących problemów lub nawet potencjalnie spowodować uszkodzenie swoich systemów przez zastosowanie nieistotnych “poprawek”.
Niewłaściwe zachowanie spowodowane przez aktualizację 576.02 było szczególnie niepokojące dla tych, którzy są zaangażowani w przepływy pracy sztucznej inteligencji, gdzie wysokowydajne urządzenia są rutynowo napędzane do ich granic termicznych przez dłuższy czas.
Problematiczny sterownik 576.02 wywołał szerszy wybuch skarg po swoim wydaniu w połowie kwietnia, pomimo początkowych raportów, że oferuje pewne korzystne usprawnienia wydajności. Niezależnie od udostępnienia poprawki i poziomu zakłócenia, jaki wydaje się powodować 576.02, w momencie pisania tego tekstu nadal dostępny do pobrania* na stronie NVIDIA.
Pożar
W kwestii skutków wadliwej aktualizacji, istnieje wiele rodzajów szkód i niedogodności, o których donoszą użytkownicy: użytkownik Frankie_T9000 zgłosił, że jego GPU uległ awarii podczas rozruchu z powodu nagromadzenia ciepła pod wpływem wadliwej aktualizacji i ustabilizował się dopiero po obniżeniu napięcia. Skomentował ‘wydaje się, że nie został trwale uszkodzony, ale muszę go ponownie nasmarować jak najszybciej (mam już przychodzące podkładki w środę) podejrzewam, że stara pasta termiczna była bardziej zestarzona przez nagromadzenie ciepła, więc wkładam nową pastę i podkładki.‘
Wczoraj inny użytkownik w tym samym wątku stwierdził: ‘Używam niestandardowej krzywej wentylatora z MSI Afterburner, i stale wyświetlała, że moje temperatury GPU są stałe na 27°C, więc wentylatory nie włączały się, co skutkowało problemami z przegrzewaniem. Myślałem, że to problem po mojej stronie, ale po zainstalowaniu poprzedniego sterownika wszystko wróciło do normy. Również temperatury nie są wyświetlane poprawnie w Menedżerze zadań.’
Mimo że NVIDIA (jak stwierdza stale w każdej publikacji poprawki) często dostarcza poprawki dla konkretnych gier lub platform, ryzyko uszkodzenia cieplnego lub wokół GPU jest większe dla praktyków AI niż dla graczy, ponieważ intensywne procesy uczenia maszynowego, takie jak szkolenie lub utrzymywanie inferencji, umieszczają GPU pod stałym długoterminowym obciążeniem – zdarzenie, które najprawdopodobniej zostanie wywołane tylko okresowo w grze, które może “skoczyć” w wysokie użytkowanie podczas bitwy z bossem lub szczególnie wymagającego fragmentu mapy, ale które jest w przeciwnym razie zaprojektowane jako kompromis między wykorzystaniem GPU a stabilnością systemu.
* Archiwum: https://archive.ph/ylVR1
Pierwotnie opublikowane we wtorek, 22 kwietnia 2025












