Przegrzewanie: problem drogi powietrza, a nie mocy chłodniczej
W ogromnej większości serwerowni punkt przegrzewania nie oznacza braku mocy chłodniczej: układ chłodniczy pracuje, powietrze nawiewane ma właściwą temperaturę. Problem jest gdzie indziej: zimne powietrze nie dochodzi tam, gdzie powinno, albo ciepłe powietrze wraca tam, gdzie nie powinno.
Zrozumienie przyczyn przegrzewania to więc przede wszystkim śledzenie drogi powietrza w serwerowni: od kratki nawiewnej do wlotu serwerów, a następnie od ich ciepłego wylotu do powrotu jednostek uzdatniania powietrza. Właśnie to pozwala pokazać symulacja CFD, punkt po punkcie, przed rozpoczęciem jakichkolwiek prac.
Czym jest punkt przegrzewania?
Punkt przegrzewania (hot spot) to miejscowa strefa, w której temperatura powietrza na wlocie jednego albo kilku serwerów przekracza zalecenia producenta albo zakresy ASHRAE. Prawie zawsze wynika z mieszania ciepłego powietrza wyrzucanego z zimnym nawiewanym, zanim to drugie dotrze do urządzeń.
Dobrze zaprojektowane data center opiera się na prostej zasadzie: ściśle rozdzielić powietrze zimne od ciepłego. To zasada korytarzy zimnych i ciepłych. Dopóki ten rozdział się utrzymuje, każdy serwer zasysa powietrze o właściwej temperaturze. Gdy zostaje przerwany, przez nieszczelność, przejście albo nierównowagę, pojawia się punkt przegrzewania.

Przyczyny przepływowe: recyrkulacja i obejście
Dwa przeciwstawne, ale dopełniające się zjawiska wyjaśniają większość przegrzań. Oba oznaczają przerwanie rozdziału strefy ciepłej i zimnej.
Recyrkulacja ciepłego powietrza
- Ciepłe powietrze wyrzucane przez serwery omija szafę i wraca na wlot z przodu.
- Typowe w górnej części szaf, gdzie brakuje strumienia zimnego powietrza, a ciepłe „opada”.
- Bezpośrednia przyczyna punktów przegrzewania: temperatura na wlocie rośnie miejscowo.
Obejście zimnego powietrza
- Nawiewane zimne powietrze omija serwery i wraca wprost do jednostki CRAC albo CRAH.
- Marnotrawstwo: ten „stracony” chłód nic nie chłodzi i pogarsza sprawność.
- Często wywołane źle rozmieszczonymi płytami perforowanymi albo niezaślepionymi przejściami.
Recyrkulacja powoduje przegrzania; obejście powoduje marnotrawstwo energii. Oba występują prawie zawsze razem w serwerowni bez obudowy korytarzy i wzajemnie się nasilają, gdy strumienie są niezrównoważone.
Dodanie chłodu może pogorszyć problem
Wobec punktu przegrzewania odruchem jest często obniżenie nastawy albo otwarcie większej liczby płyt. Jeśli jednak przyczyną jest recyrkulacja, zwiększamy głównie Obejście i zużycie energii, nie usuwając strefy ciepłej. Właściwa dźwignia jest prawie zawsze przepływowa, nie chłodnicza.
Przyczyny związane z zagospodarowaniem serwerowni
Geometria serwerowni i jej zagospodarowanie wprost wyznaczają drogę powietrza. Najczęstsze źródła mieszania:
Niepełna obudowa korytarzy
- Korytarze niezamknięte, brakujące drzwi, otwarte sufity.
- Powietrze ciepłe i zimne łączą się nad szafami.
Wadliwe zaślepienie
- Puste miejsca U bez paneli zaślepiających (blanking panels).
- Przejścia kablowe, niezakryte wycięcia w podłodze podniesionej.
Podłoga podniesiona i płyty
- Zbyt mała wysokość przestrzeni podpodłogowej, przeszkody z tras kablowych.
- Zbyt wiele płyt perforowanych albo źle rozmieszczonych.
Każda z tych wad, wzięta osobno, wydaje się drobna. Zsumowane tworzą rozproszone nieszczelności, które niszczą rozdział strefy ciepłej i zimnej oraz przenoszą punkty przegrzewania ze strefy do strefy w miarę zmian w serwerowni.

Przyczyny związane z obciążeniem i eksploatacją
Serwerownia zdrowa w chwili odbioru może wytworzyć punkty przegrzewania w eksploatacji, po prostu dlatego, że obciążenie się zmienia, a rozdział powietrza za tym nie nadążył.
Wzrost obciążenia i gęstość
- Zagęszczanie szaf (obliczenia o dużej intensywności, sztuczna inteligencja, GPU) powyżej przewidzianego strumienia powietrza.
- Skupienie mocy w kilku „ciepłych” szafach, źle rozmieszczonych.
Awarie i redundancja
- Zatrzymanie jednostki CRAC albo CRAH: strumień miejscowy załamuje się i pojawia się punkt przegrzewania.
- Scenariusze awarii (N+1) rzadko sprawdzane na spokojnie przed zdarzeniem.
Dlatego diagnoza nie może ograniczać się do pracy nominalnej: trzeba też symulować scenariusze awaryjne (awaria jednostki, szczyt obciążenia), aby sprawdzić, czy serwerownia pozostaje w granicach.
Dlaczego przegrzewanie kosztuje
Punkt przegrzewania nie jest tylko odchyleniem termicznym: to ryzyko dla dostępności, żywotności sprzętu i rachunku za energię.
Dostępność
- Throttling procesorów, wyłączenia awaryjne, a nawet awarie.
- Utrata usługi w infrastrukturze krytycznej.
Sprzęt
- Przyspieszone starzenie elementów narażonych na ciepło.
- Rosnąca awaryjność, zagrożone gwarancje producenta.
Energia
- Nastawa obniżona „na zapas” dla całej serwerowni.
- Nadmierne zużycie energii i PUE pogorszone w całej eksploatacji.
Usunięcie punktu przegrzewania miejscowo pozwala często podnieść nastawę ogólną serwerowni, a więc obniżyć zużycie energii całego parku, znacznie poza samą strefą.
Wskazanie i uszeregowanie przyczyn metodą symulacji CFD
Symulacja CFD wiernie odtwarza serwerownię, geometrię, szafy, strumienie i moce, oraz oblicza pole temperatury i prędkości w każdym punkcie. Tam gdzie czujniki dają tylko kilka wartości, model ujawnia całą drogę powietrza.
Budując cyfrowego bliźniaka infrastruktury, wskazujemy dokładne źródło każdego punktu przegrzewania, szeregujemy przyczyny (recyrkulacja, obejście, zaślepienie, strumień) i badamy wirtualnie korekty przed ich wykonaniem: obudowa korytarzy, przestawienie płyt, wyrównanie strumieni.


Wskaźniki mierzące zdrowie przepływowe
Kilka wskaźników pozwala obiektywnie wyliczyć recyrkulację, obejście i zapas termiczny serwerowni. Zamieniają mapę CFD na liczby użyteczne w pracy.
| Wskaźnik | Co mierzy | Czytanie |
|---|---|---|
| RCIHI/LO | Zgodność temperatur na wlocie z zakresami zalecanymi i dopuszczalnymi. | Blisko 100 % = serwerownia zdrowa. |
| RTI | Wskaźnik transportu powietrza: stosunek strumienia serwerów do strumienia uzdatniania powietrza. | > 100 % = recyrkulacja, < 100 % = obejście. |
| ΔT | Różnica temperatury między wlotem i wylotem szaf. | Małe ΔT zdradza mieszanie (obejście). |
| Zakresy ASHRAE | Zalecane klasy (A1–A4) temperatury i wilgotności na wlocie. | Każda szafa poza zakresem = punkt przegrzewania. |
Usuwanie przegrzewania i zapobieganie mu
Po uszeregowaniu przyczyn dźwignie korekty są zwykle proste, niedrogie i przepływowe, a nie chłodnicze:
Przywrócenie rozdziału
- Obudowanie korytarzy (zimnego albo ciepłego) i zamknięcie przejść.
- Montaż paneli zaślepiających i zakrycie wycięć w podłodze podniesionej.
Wyrównanie i optymalizacja
- Przestawienie płyt perforowanych najbliżej ciepłych szaf.
- Wyrównanie strumieni, następnie podniesienie nastawy i rozszerzenie free coolingu.
Zapobieganie to wreszcie wprowadzenie CFD już na etapie projektu i utrzymywanie go na bieżąco wraz ze zmianami obciążenia: cyfrowy bliźniak staje się wtedy narzędziem eksploatacji, a nie tylko jednorazowej diagnozy.
Nasi inżynierowie budują cyfrowego bliźniaka Twojej serwerowni, wskazują przyczyny i wyliczają korekty. Porozmawiajmy.





