Strona główna/Centra danych/Przyczyny przegrzewania
Opracowanie techniczne · centra danych

Skąd bierze się przegrzewanie w data center?

Punkty przegrzewania prawie nigdy nie powstają z braku chłodu: rodzą się ze złej drogi powietrza. Recyrkulacje, obejście, niepełna obudowa korytarzy, wzrost obciążenia: omówienie przyczyn, skutków i diagnozy metodą symulacji CFD.

Czytanie 11 min Poziom Średni Bez działań handlowych
Mapa temperatur w serwerowni w CFD — punkt przegrzewania
Mapa temperatur w CFD — serwerownia
01 — Wprowadzenie

Przegrzewanie: problem drogi powietrza, a nie mocy chłodniczej

W ogromnej większości serwerowni punkt przegrzewania nie oznacza braku mocy chłodniczej: układ chłodniczy pracuje, powietrze nawiewane ma właściwą temperaturę. Problem jest gdzie indziej: zimne powietrze nie dochodzi tam, gdzie powinno, albo ciepłe powietrze wraca tam, gdzie nie powinno.

Zrozumienie przyczyn przegrzewania to więc przede wszystkim śledzenie drogi powietrza w serwerowni: od kratki nawiewnej do wlotu serwerów, a następnie od ich ciepłego wylotu do powrotu jednostek uzdatniania powietrza. Właśnie to pozwala pokazać symulacja CFD, punkt po punkcie, przed rozpoczęciem jakichkolwiek prac.

02 — Definicja

Czym jest punkt przegrzewania?

Definicja

Punkt przegrzewania (hot spot) to miejscowa strefa, w której temperatura powietrza na wlocie jednego albo kilku serwerów przekracza zalecenia producenta albo zakresy ASHRAE. Prawie zawsze wynika z mieszania ciepłego powietrza wyrzucanego z zimnym nawiewanym, zanim to drugie dotrze do urządzeń.

Dobrze zaprojektowane data center opiera się na prostej zasadzie: ściśle rozdzielić powietrze zimne od ciepłego. To zasada korytarzy zimnych i ciepłych. Dopóki ten rozdział się utrzymuje, każdy serwer zasysa powietrze o właściwej temperaturze. Gdy zostaje przerwany, przez nieszczelność, przejście albo nierównowagę, pojawia się punkt przegrzewania.

Rozdział korytarza zimnego i ciepłego pokazany w CFD
Zasada korytarza zimnego i ciepłego: dopóki powietrze zimne (niebieskie) i ciepłe (czerwone) się nie mieszają, serwerownia pozostaje zdrowa.
03 — Przyczyny przepływowe

Przyczyny przepływowe: recyrkulacja i obejście

Dwa przeciwstawne, ale dopełniające się zjawiska wyjaśniają większość przegrzań. Oba oznaczają przerwanie rozdziału strefy ciepłej i zimnej.

Recyrkulacja ciepłego powietrza

  • Ciepłe powietrze wyrzucane przez serwery omija szafę i wraca na wlot z przodu.
  • Typowe w górnej części szaf, gdzie brakuje strumienia zimnego powietrza, a ciepłe „opada”.
  • Bezpośrednia przyczyna punktów przegrzewania: temperatura na wlocie rośnie miejscowo.

Obejście zimnego powietrza

  • Nawiewane zimne powietrze omija serwery i wraca wprost do jednostki CRAC albo CRAH.
  • Marnotrawstwo: ten „stracony” chłód nic nie chłodzi i pogarsza sprawność.
  • Często wywołane źle rozmieszczonymi płytami perforowanymi albo niezaślepionymi przejściami.

Recyrkulacja powoduje przegrzania; obejście powoduje marnotrawstwo energii. Oba występują prawie zawsze razem w serwerowni bez obudowy korytarzy i wzajemnie się nasilają, gdy strumienie są niezrównoważone.

Czy wiesz, że?

Dodanie chłodu może pogorszyć problem

Wobec punktu przegrzewania odruchem jest często obniżenie nastawy albo otwarcie większej liczby płyt. Jeśli jednak przyczyną jest recyrkulacja, zwiększamy głównie Obejście i zużycie energii, nie usuwając strefy ciepłej. Właściwa dźwignia jest prawie zawsze przepływowa, nie chłodnicza.

04 — Przyczyny architektoniczne

Przyczyny związane z zagospodarowaniem serwerowni

Geometria serwerowni i jej zagospodarowanie wprost wyznaczają drogę powietrza. Najczęstsze źródła mieszania:

Niepełna obudowa korytarzy

  • Korytarze niezamknięte, brakujące drzwi, otwarte sufity.
  • Powietrze ciepłe i zimne łączą się nad szafami.

Wadliwe zaślepienie

  • Puste miejsca U bez paneli zaślepiających (blanking panels).
  • Przejścia kablowe, niezakryte wycięcia w podłodze podniesionej.

Podłoga podniesiona i płyty

  • Zbyt mała wysokość przestrzeni podpodłogowej, przeszkody z tras kablowych.
  • Zbyt wiele płyt perforowanych albo źle rozmieszczonych.

Każda z tych wad, wzięta osobno, wydaje się drobna. Zsumowane tworzą rozproszone nieszczelności, które niszczą rozdział strefy ciepłej i zimnej oraz przenoszą punkty przegrzewania ze strefy do strefy w miarę zmian w serwerowni.

Obraz CFD nieszczelności powietrznych i przeszkód w serwerowni
CFD ujawnia rozproszone nieszczelności, niezaślepione miejsca i przejścia kablowe, niewidoczne przy oględzinach.
05 — Obciążenie IT

Przyczyny związane z obciążeniem i eksploatacją

Serwerownia zdrowa w chwili odbioru może wytworzyć punkty przegrzewania w eksploatacji, po prostu dlatego, że obciążenie się zmienia, a rozdział powietrza za tym nie nadążył.

Wzrost obciążenia i gęstość

  • Zagęszczanie szaf (obliczenia o dużej intensywności, sztuczna inteligencja, GPU) powyżej przewidzianego strumienia powietrza.
  • Skupienie mocy w kilku „ciepłych” szafach, źle rozmieszczonych.

Awarie i redundancja

  • Zatrzymanie jednostki CRAC albo CRAH: strumień miejscowy załamuje się i pojawia się punkt przegrzewania.
  • Scenariusze awarii (N+1) rzadko sprawdzane na spokojnie przed zdarzeniem.

Dlatego diagnoza nie może ograniczać się do pracy nominalnej: trzeba też symulować scenariusze awaryjne (awaria jednostki, szczyt obciążenia), aby sprawdzić, czy serwerownia pozostaje w granicach.

06 — Skutki

Dlaczego przegrzewanie kosztuje

Punkt przegrzewania nie jest tylko odchyleniem termicznym: to ryzyko dla dostępności, żywotności sprzętu i rachunku za energię.

Dostępność

  • Throttling procesorów, wyłączenia awaryjne, a nawet awarie.
  • Utrata usługi w infrastrukturze krytycznej.

Sprzęt

  • Przyspieszone starzenie elementów narażonych na ciepło.
  • Rosnąca awaryjność, zagrożone gwarancje producenta.

Energia

  • Nastawa obniżona „na zapas” dla całej serwerowni.
  • Nadmierne zużycie energii i PUE pogorszone w całej eksploatacji.

Usunięcie punktu przegrzewania miejscowo pozwala często podnieść nastawę ogólną serwerowni, a więc obniżyć zużycie energii całego parku, znacznie poza samą strefą.

07 — Diagnoza CFD

Wskazanie i uszeregowanie przyczyn metodą symulacji CFD

Symulacja CFD wiernie odtwarza serwerownię, geometrię, szafy, strumienie i moce, oraz oblicza pole temperatury i prędkości w każdym punkcie. Tam gdzie czujniki dają tylko kilka wartości, model ujawnia całą drogę powietrza.

Budując cyfrowego bliźniaka infrastruktury, wskazujemy dokładne źródło każdego punktu przegrzewania, szeregujemy przyczyny (recyrkulacja, obejście, zaślepienie, strumień) i badamy wirtualnie korekty przed ich wykonaniem: obudowa korytarzy, przestawienie płyt, wyrównanie strumieni.

Pole temperatury serwerowni w CFD
Termiczny cyfrowy bliźniak data center
Cyfrowy bliźniak mapuje temperatury na wlocie szafa po szafie i bada korekty przed pracami.
Studium przypadku: DC28 — diagnoza wewnętrzna serwerowni
08 — Wskaźniki

Wskaźniki mierzące zdrowie przepływowe

Kilka wskaźników pozwala obiektywnie wyliczyć recyrkulację, obejście i zapas termiczny serwerowni. Zamieniają mapę CFD na liczby użyteczne w pracy.

WskaźnikCo mierzyCzytanie
RCIHI/LOZgodność temperatur na wlocie z zakresami zalecanymi i dopuszczalnymi.Blisko 100 % = serwerownia zdrowa.
RTIWskaźnik transportu powietrza: stosunek strumienia serwerów do strumienia uzdatniania powietrza.> 100 % = recyrkulacja, < 100 % = obejście.
ΔTRóżnica temperatury między wlotem i wylotem szaf.Małe ΔT zdradza mieszanie (obejście).
Zakresy ASHRAEZalecane klasy (A1–A4) temperatury i wilgotności na wlocie.Każda szafa poza zakresem = punkt przegrzewania.
Typowe wskaźniki wydajności przepływowej serwerowni.
09 — Korekta i zapobieganie

Usuwanie przegrzewania i zapobieganie mu

Po uszeregowaniu przyczyn dźwignie korekty są zwykle proste, niedrogie i przepływowe, a nie chłodnicze:

Przywrócenie rozdziału

  • Obudowanie korytarzy (zimnego albo ciepłego) i zamknięcie przejść.
  • Montaż paneli zaślepiających i zakrycie wycięć w podłodze podniesionej.

Wyrównanie i optymalizacja

  • Przestawienie płyt perforowanych najbliżej ciepłych szaf.
  • Wyrównanie strumieni, następnie podniesienie nastawy i rozszerzenie free coolingu.

Zapobieganie to wreszcie wprowadzenie CFD już na etapie projektu i utrzymywanie go na bieżąco wraz ze zmianami obciążenia: cyfrowy bliźniak staje się wtedy narzędziem eksploatacji, a nie tylko jednorazowej diagnozy.

Punkt przegrzewania albo PUE do poprawy?

Nasi inżynierowie budują cyfrowego bliźniaka Twojej serwerowni, wskazują przyczyny i wyliczają korekty. Porozmawiajmy.

Porozmawiaj z inżynierem
Aby pójść dalej

Specjalizacje i opracowania o centrach danych.

Od diagnozy do optymalizacji energetycznej CFD obejmuje cały termiczny cykl życia centrum danych.

Poznaj dziedzinę

Centra danych: zwiedzaj dalej.

Specjalizacje CFD, zrealizowane projekty i opracowania techniczne: cała dziedzina centrów danych w jednym miejscu.

CFDInżynierowie eksperci
20+Kraje działalności
B+RBadania i innowacje