Wdrażanie obciążeń AI na instancji GPU 8x NVIDIA H200 NVL
Dowiedz się, jak wdrażać obciążenia AI na instancji GPU 8x NVIDIA H200 NVL z uwzględnieniem jej topologii NVLink
Wprowadzenie
Zalecamy skorzystanie z tego przewodnika, jeśli masz instancję h200-1920-eph lub h200-1920. Instancje 8x NVIDIA H200 NVL (modele h200-1920 i h200-1920-eph) są zorganizowane w dwie grupy po 4 GPU, z łącznością NVLink wyłącznie w obrębie każdej grupy i połączeniem PCIe między obiema grupami. Uwzględnienie tej topologii pozwala uzyskać najlepszą wydajność i stabilność obciążeń AI.
Obecnie instancje 8x NVIDIA H200 NVL są dostępne wyłącznie w regionie Paryż (EU-WEST-PAR).
Ten przewodnik wyjaśnia, jak wdrażać i obsługiwać obciążenia AI na instancji GPU 8x NVIDIA H200 NVL
Wymagania początkowe
- Projekt Public Cloud z dostępem do regionu, w którym dostępne są modele instancji h200-1920 i h200-1920-eph (EU-WEST-PAR)
- Klucz SSH utworzony w celu wdrożenia instancji GPU z systemem Linux
Dostęp do Panelu klienta OVHcloud
- Link bezpośredni:
- Ścieżka nawigacji:
Public Cloud> Wybierz projekt >Instancje
W praktyce
Poniżej znajdziesz informacje niezbędne do wdrożenia instancji 8x NVIDIA H200 NVL, zrozumienia jej topologii, a następnie uruchamiania i monitorowania na niej obciążeń AI.
Wdrażanie instancji
W sekcji Szybki dostęp kliknij Utwórz instancję. Następnie wybierz region EU-WEST-PAR i model instancji h200-1920 lub h200-1920-eph w kategorii Cloud GPU.
Potem wykonaj pozostałe kroki opisane w przewodniku Jak utworzyć instancję Public Cloud i się z nią połączyć. Proces ten może potrwać kilka minut.
Po dostarczeniu instancji zainstaluj sterownik NVIDIA zgodnie z opisem w przewodniku Uruchomienie instancji GPU.
Przegląd sprzętu
Dysk efemeryczny (h200-1920-eph)
Dysk efemeryczny modelu instancji h200-1920-eph jest już sformatowany z systemem plików Ext4. Może być już automatycznie zamontowany w /mnt przez cloud-init.
Aby sprawdzić, czy dysk efemeryczny jest zamontowany, uruchom następujące polecenie:
Jeśli dysk 20 TB ma /mnt jako punkt montowania, jest gotowy do użycia. W przeciwnym razie zamontuj go ręcznie, zastępując /dev/<device> nazwą urządzenia wyświetloną przez lsblk -f:
Dane przechowywane na dysku efemerycznym nie są uwzględniane w kopiach zapasowych instancji i zostają utracone po usunięciu lub zawieszeniu instancji. Zalecamy tworzenie kopii zapasowych ważnych danych w zewnętrznym rozwiązaniu do przechowywania danych, takim jak Object Storage.
Topologia GPU i architektura NVLink
8 GPU jest zorganizowanych w następujący sposób:
Podczas przydzielania obciążeń na tej instancji zalecamy następujące praktyki:
- W miarę możliwości uruchamiaj każde zadanie w obrębie jednej grupy NVLink (4 GPU).
- Gdy jeden model wymaga wszystkich 8 GPU, traktuj obie grupy jak dwa oddzielne klastry: utrzymuj równoległość o dużej intensywności komunikacji (taką jak tensor parallelism) w obrębie każdej grupy, a między grupami stosuj tylko lżejszą komunikację (taką jak pipeline parallelism). Przykład znajdziesz w zalecanych konfiguracjach poniżej.
- Pamiętaj, że korzyści wydajnościowe NVLink dotyczą wyłącznie komunikacji w obrębie każdej grupy 4 GPU.
Utrzymywanie operacji o dużej intensywności komunikacji w obrębie każdej grupy NVLink pozwala uniknąć dużego ruchu na magistrali PCIe, co zapewnia zarówno lepszą wydajność, jak i większą stabilność.
Przed uruchomieniem obciążenia zalecamy sprawdzenie, które GPU należą do której grupy NVLink:
W macierzy GPU połączone przez NVLink mają między sobą wartość NV# (# oznacza liczbę połączeń NVLink). GPU połączone wyłącznie przez PCIe pokazują zamiast tego typ ścieżki PCIe (na przykład PHB, NODE lub SYS). Cztery GPU, które mają między sobą wartości NV#, tworzą jedną grupę NVLink.
Możesz również wyświetlić stan NVLink danego GPU (tutaj GPU 0):
Zalecane konfiguracje
Poniższe przykłady wykorzystują vLLM, aby pokazać, jak wdrożyć model na 4 lub 8 GPU z zachowaniem topologii NVLink.
Aby wdrożyć model na 4 GPU, jawnie wskaż identyfikatory urządzeń, tak by wszystkie należały do tej samej grupy NVLink:
Dobre praktyki eksploatacyjne
Zalecamy:
- sprawdzanie przypisania GPU do grup NVLink przed uruchomieniem obciążenia (
nvidia-smi topo -m). - utrzymywanie wszystkich GPU używanych przez jedno zadanie w tej samej grupie NVLink, chyba że korzystasz z konfiguracji międzygrupowej, takiej jak opisana powyżej konfiguracja z pipeline parallelism.
- monitorowanie stanu NVLink i logów jądra (
dmesg) podczas działania obciążeń. - regularne tworzenie kopii zapasowych ważnych danych.
Zalecane monitorowanie
Zalecamy monitorowanie następujących metryk podczas działania obciążeń:
Błędy GPU i NVLink są zgłaszane przez sterownik NVIDIA w logach jądra jako komunikaty Xid. W celu ciągłego monitorowania NVIDIA DCGM może eksportować te metryki do Twojego narzędzia monitorującego. Polecenia smartctl i nvme są dostarczane przez pakiety smartmontools i nvme-cli (na przykład sudo apt-get install smartmontools nvme-cli w systemie Debian lub Ubuntu).
Sprawdź również
Dołącz do grona naszych użytkowników.