Unghiul lui Anderson

NVIDIA a lansat o soluție de urgență pentru problema de supraincălzire a driverului GPU

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-40 and Adobe Firefly

Ieri, NVIDIA a lansat o soluție de urgență critică pentru a conține consecințele unei lansări anterioare a driverului care a declanșat alarma în comunitățile de inteligență artificială și gaming, cauzând sistemele să raporteze în mod fals temperaturi sigure ale GPU-ului – chiar dacă cererile de răcire au crescut în mod ascuns către niveluri potențial critice.

În postarea oficială a NVIDIA despre lansarea soluției de urgență, deși doar pe locul al treilea în lista problemelor rezolvate, problema este menționată ca ‘Uneltele de monitorizare a GPU-ului pot înceta să raporteze temperatura GPU-ului după ce calculatorul se trezește din somn’.

La scurt timp după lansarea driverului afectat Game Ready 576.02, un thread pe subreddit-ul Stable Diffusion, intitulat Citește pentru a-ți salva GPU-ul!, a devenit o resursă pentru probleme anecdote și actualizări raportate de utilizatori cu privire la noul driver. Din acestea și din alte rapoarte de pe web, poate fi stabilit un cronologie a problemelor care au apărut.

Primul raport de pe Reddit despre bug pare să fi apărut târziu în după-amiaza de vineri, ora UTC, pe subreddit-ul ZephyrusG14, unde utilizatorul fricy81 a menționat un post pe forumurile NVIDIA (arhivat):

Un utilizator de pe forumurile NVIDIA găsește probleme după actualizarea 576.02. Sursă: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

Un utilizator de pe forumurile NVIDIA găsește probleme după actualizarea 576.02. Sursă: https://www.nvidia.com/en-us/geforce/forums/game-ready-drivers/13/563010/geforce-grd-57602-feedback-thread-released-41625/3524072/

Utilizatorul de pe forumurile NVIDIA a raportat că, după instalarea actualizării driverului, uneltele precum MSI Afterburner și monitoarele din jocuri, cum ar fi cel din Call of Duty (care, în general, accesează citiri native ale sistemului, la fel ca panoul GPU din Task Manager în Windows), au încetat să actualizeze citirile temperaturii GPU, înghețând la aproximativ 35-36°C.

Repornirea software-ului de monitorizare nu a avut niciun efect, a declarat utilizatorul, și doar o repornire completă a sistemului a restabilit citirile exacte. Uneltele precum HWInfo și aplicația de monitorizare a NVIDIA au continuat să raporteze temperaturi corecte. Utilizatorul a subliniat că problema a apărut în timpul utilizării normale, nu doar după trezirea sistemului din somn.

Feedback-ul utilizatorilor de pe diverse forumuri a evidențiat o perturbare generală a comportamentului normal al curbei de ventilare și o alterare a reglării termice a nucleului, ceea ce a dus la funcționarea unităților de procesare grafică la temperaturi neașteptat de ridicate, și la supraîncălzirea alarmantă în ceea ce ar fi considerat sarcini operaționale standard, așa cum se detaliază în acest comentariu:

‘Am putut să simt că ceva nu este în regulă. Vremea de afară era probabil în jur de 55°F / 12°C, dar eram gata să fiu gătit în camera mea. Fereastra mea era deschisă, și totuși nu puteam simți nicio diferență. Toate ventilatoarele funcționau la maximum, și temperaturile păreau să fie în regulă la început—aproximativ 68°C la 72°C după ce am jucat pentru o perioadă.

‘La început, părea să fie normal—până a doua zi dimineață, când am realizat că acestea nu sunt temperaturi de repaus, și ventilatoarele erau încă [pornite].

‘Am făcut o suprareglare a GPU-ului după ce am reparat câteva lucruri recent, așa că nu eram sigur dacă valorile au sărit prea sus. Acest lucru s-a întâmplat o dată înainte, după ce am instalat ASUS AI Suite 3 – setările BIOS nu au funcționat corect din cauza acestuia.

‘Oricum, am mers înainte și am revenit la un driver mai vechi pentru moment.’

Sub-Optimal

Documentul oficial de lansare PDF pentru actualizarea driverului 576.02 oferă câteva indicii despre modificările care ar fi putut contribui la noile probleme. În secțiunea 5.5, NVIDIA recunoaște că temperatura GPU poate fi raportată în mod incorect pe sistemele Optimus NVIDIA, arătând zero grade atunci când nu rulează nicio aplicație.

Secțiunea 5.5 a notelor oficiale de actualizare 576.02 abordează problemele de monitorizare a temperaturii care par să fi afectat un număr mai mare de sisteme decât sistemul Optimus. Sursă: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

Secțiunea 5.5 a notelor oficiale de actualizare 576.02 abordează problemele de monitorizare a temperaturii care par să fi afectat un număr mai mare de sisteme decât sistemul Optimus. Sursă: https://us.download.nvidia.com/Windows/576.02/576.02-win11-win10-release-notes.pdf

Documentul declară:

5.5 Temperatura GPU raportată în mod incorect pe sistemele Optimus

5.5.1 Problema

Pe sistemele Optimus, uneltele de raportare a temperaturii, cum ar fi Speccy sau GPU-Z, raportează că temperatura GPU NVIDIA este zero atunci când nu rulează nicio aplicație.

5.5.2 Explicație

Pe sistemele Optimus, atunci când GPU NVIDIA nu este utilizat, el este pus într-o stare de putere redusă. Acest lucru face ca uneltele de raportare a temperaturii să returneze valori incorecte. Trezirea GPU-ului pentru a interoga temperatura ar avea ca rezultat măsurători lipsite de sens, deoarece temperatura GPU se schimbă ca urmare.

Aceste unelte vor raporta temperaturi exacte doar atunci când GPU este treaz și rulează.

NVIDIA Optimus este o tehnologie de comutare a GPU care comută între grafică integrată și grafică dedicată în funcție de cerințele aplicației, pentru a echilibra automat performanța și consumul de energie, proiectată pentru a conserva viața bateriei și a reduce consumul de energie. Pentru sarcini precum jocuri sau redarea video HD, Optimus activează GPU dedicat pentru o performanță mai bună; în timpul activităților mai ușoare, cum ar fi navigarea pe web, el revine la grafica integrată (onboard).

Actualizarea pare să fi extins un comportament anterior limitat la sistemele Optimus, permițând GPU-ului afectat să intre într-o stare de putere redusă atunci când este inactiv, chiar și atunci când nu este găzduit pe un sistem Optimus, perturbând astfel raportarea temperaturii în uneltele terțe.

Risk Adjustment

În majoritatea scenariilor, este corect să spunem că VBIOS-ul plăcii grafice ar fi prevenit, probabil, o deteriorare permanentă a GPU-ului. VBIOS impune limite termice și de putere la nivel de firmă, independent de driver.

Prin urmare, chiar dacă un driver ar cauza un comportament incorect al ventilatorului sau ar raporta temperaturi incorect, VBIOS ar trebui să reducă în continuare performanța, să crească activitatea ventilatorului sau să oprească GPU pentru a preveni defectarea hardware-ului.

Acest lucru nu înseamnă că riscul a fost trivial – temperaturi ridicate susținute pot degrada performanța în timp sau stresa componente adiacente; în plus, lipsa unei înțelegeri comune că o actualizare a driverului a cauzat o problemă (mai ales în sistemele în care driverele se actualizează “în mod silențios”), o problemă de acest fel ar putea înșela o proporție mare de utilizatori afectați, care ar putea încerca remedii pentru probleme inexistente sau chiar ar putea cauza daune sistemului prin aplicarea unor “reparatii” irelevante.

Comportamentul defectuos cauzat de actualizarea 576.02 a fost deosebit de alarmant pentru cei implicați în fluxuri de lucru de inteligență artificială, unde hardware-ul de înaltă performanță este rutin pushat la limitele sale termice pentru perioade prelungite.

Driverul problematic 576.02 a inspirat o serie mai largă de plângeri după lansarea sa la jumătatea lunii aprilie, în ciuda rapoartelor inițiale că oferă îmbunătățiri ale performanței. În ciuda furnizării soluției de urgență și a nivelului de perturbare pe care 576.02 pare să-l fi cauzat, la momentul scrierii acestui articol, el rămâne disponibil pentru descărcare* pe site-ul NVIDIA.

Afterglow

În ceea ce privește consecințele actualizării defectuoase, există numeroase tipuri de daune și/sau inconveniente raportate: utilizatorul Frankie_T9000 a raportat că GPU-ul său s-a oprit la pornire din cauza acumulării de căldură sub actualizarea defectuoasă și a fost stabilizat doar după ce a redus tensiunea. El a comentat ‘se pare că nu a fost deteriorat în mod permanent, dar trebuie să reaplic pastă termică cât mai curând (am comandat paduri pentru miercuri) suspectez că vechea pastă termică a fost învinsă de acumularea de căldură, așa că voi pune pastă și paduri noi.

Ieri, un alt utilizator în același thread a declarat: ‘Utilizez o curbă de ventilator personalizată cu MSI Afterburner, și a continuat să arate că temperatura GPU era constantă la 27°C, astfel încât ventilatoarele nu s-au pornit, ceea ce a dus la probleme de supraîncălzire. Am crezut că este o problemă a mea, dar după ce am instalat driverul anterior, totul a funcționat din nou. De asemenea, temperaturile nu sunt afișate corect în Task Manager.’

Deși NVIDIA (așa cum declară persistent în fiecare lansare de soluție de urgență) oferă adesea soluții de urgență pentru anumite jocuri video sau platforme, riscul de daune termice la sau în jurul unui GPU este mai mare pentru practicienii de inteligență artificială decât pentru jucători, deoarece procesele de învățare automată intensive, cum ar fi antrenamentul sau inferența susținută, plasează un GPU sub încărcare constantă pe termen lung – un eveniment care ar putea fi declanșat doar periodic într-un joc, care poate “sări” în utilizare ridicată pentru o luptă cu șefi sau o secțiune de hartă deosebit de solicitantă, dar care este proiectat în general ca o compromis între exploatarea GPU și stabilitatea sistemului.

 

* Arhivă: https://archive.ph/ylVR1

Publicat pentru prima dată marți, 22 aprilie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai