Serwer przeznaczony do lokalnego uruchamiania modeli AI może pobierać znacznie więcej energii niż typowy serwer aplikacyjny. Problem staje się szczególnie widoczny po podłączeniu kilku kart GPU. Jeżeli cała infrastruktura znajduje się za jednym UPS-em, chwilowy wzrost obciążenia może doprowadzić do przeciążenia urządzenia albo skrócić czas podtrzymania do wartości praktycznie bezużytecznej.
Do obliczenia zapotrzebowania nie wystarczy zsumowanie wartości TDP procesora i kart graficznych. Trzeba uwzględnić pozostałe komponenty serwera, sprawność zasilaczy, obciążenie UPS-a oraz charakterystykę pracy GPU. Dodatkowym problemem są krótkotrwałe skoki poboru, które nie zawsze są widoczne w prostym średnim pomiarze.
Od TDP do rzeczywistego poboru energii

TDP karty GPU nie powinno być automatycznie traktowane jako jej stały pobór mocy. W praktyce obciążenie zależy od modelu karty, limitu mocy, rodzaju zadania i liczby jednocześnie wykorzystywanych jednostek. Inferencja, trening i obciążenie pamięci mogą generować różne profile energetyczne.
Podobnie wygląda sytuacja z procesorem. Do obliczeń należy dodać pamięć RAM, dyski, kontrolery, wentylatory, kartę sieciową i pozostałe urządzenia. W serwerze RACK dochodzi także kwestia przepływu powietrza. Wyższa temperatura może zwiększać prędkość wentylatorów, a tym samym pobór całego systemu.
Przy projektowaniu infrastruktury trzeba więc uwzględnić co najmniej następujące elementy:
- Maksymalny pobór mocy każdej karty GPU przy założonym obciążeniu.
- Pobór procesora, pamięci RAM, dysków i kontrolerów.
- Pobór wentylatorów oraz pozostałych elementów serwera.
- Sprawność zasilaczy przy rzeczywistym poziomie obciążenia.
- Straty energii występujące pomiędzy serwerem a wyjściem UPS.
Najbardziej wiarygodnym źródłem danych jest pomiar całego serwera na wejściu zasilania. Pozwala on uwzględnić elementy, których nie widać w specyfikacji poszczególnych podzespołów.
Dlaczego UPS może się wyłączyć mimo prawidłowych obliczeń
UPS należy dobierać nie tylko według mocy znamionowej wyrażonej w watach. Znaczenie ma również moc pozorna wyrażona w VA oraz dopuszczalne obciążenie konkretnego modelu. Nie każdy UPS o wysokiej wartości VA może bezpiecznie obsłużyć dowolne obciążenie rzeczywiste.
Drugim problemem jest zapas. Jeżeli serwer pobiera 2800 W, UPS o maksymalnym obciążeniu 3000 W nie powinien być traktowany jako optymalny wybór. Pozostaje niewielki margines na wzrost obciążenia, urządzenia dodatkowe i zmianę profilu pracy.
Przy kilku GPU warto wykonać pomiar w kilku stanach: bezczynności, typowej pracy, pełnego obciążenia GPU oraz jednoczesnego obciążenia CPU i GPU. Dopiero porównanie tych wartości pokazuje, jaki zakres mocy występuje w rzeczywistej konfiguracji.
Ważne jest także sprawdzenie sposobu zasilania. Serwery z wieloma zasilaczami mogą być podłączone do dwóch obwodów lub dwóch UPS-ów. W takim układzie trzeba określić, czy urządzenia mogą pracować przy awarii jednego toru oraz jakie obciążenie pozostaje na drugim.
Jak zaplanować zapas mocy dla klastra GPU
W przypadku klastra kilku serwerów nie należy zakładać, że każdy będzie jednocześnie pracował z identycznym obciążeniem. Z drugiej strony projektowanie systemu wyłącznie na podstawie średniego poboru może prowadzić do przeciążenia podczas uruchamiania zadań AI.
Praktyczny model powinien rozdzielać pobór typowy od wartości maksymalnej. Dla każdego węzła można wyznaczyć zmierzone maksimum, a następnie określić wymagany zapas. Jeżeli serwer ma być rozbudowywany o kolejne GPU, ich pobór trzeba uwzględnić już na etapie doboru infrastruktury zasilającej.
Nie bez znaczenia jest także czas podtrzymania. Przy dużym poborze energii pojemność baterii UPS może wystarczyć tylko na kilka minut. Jeżeli celem jest bezpieczne zamknięcie serwerów, należy sprawdzić, czy oprogramowanie UPS może prawidłowo wysłać sygnał do systemu i rozpocząć kontrolowane wyłączenie.
Jeżeli lokalny serwer AI regularnie wyłącza UPS, przyczyną może być zarówno zbyt mała moc urządzenia, jak i nieprawidłowe rozłożenie obciążenia. W pierwszej kolejności warto wykonać pomiar na wejściu zasilania, porównać go z parametrami UPS-a i sprawdzić zachowanie systemu przy maksymalnym obciążeniu GPU.
