For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/pl/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/pl/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/pl/guides/public-cloud/compute/deploy-8-h200-nvl-gpu-instance.md.

Wdrażanie obciążeń AI na instancji GPU 8x NVIDIA H200 NVL

Pokaż jako Markdown

Dowiedz się, jak wdrażać obciążenia AI na instancji GPU 8x NVIDIA H200 NVL z uwzględnieniem jej topologii NVLink

Wprowadzenie

Zalecamy skorzystanie z tego przewodnika, jeśli masz instancję h200-1920-eph lub h200-1920. Instancje 8x NVIDIA H200 NVL (modele h200-1920 i h200-1920-eph) są zorganizowane w dwie grupy po 4 GPU, z łącznością NVLink wyłącznie w obrębie każdej grupy i połączeniem PCIe między obiema grupami. Uwzględnienie tej topologii pozwala uzyskać najlepszą wydajność i stabilność obciążeń AI.

Info

Obecnie instancje 8x NVIDIA H200 NVL są dostępne wyłącznie w regionie Paryż (EU-WEST-PAR).

Ten przewodnik wyjaśnia, jak wdrażać i obsługiwać obciążenia AI na instancji GPU 8x NVIDIA H200 NVL

Wymagania początkowe

  • Projekt Public Cloud z dostępem do regionu, w którym dostępne są modele instancji h200-1920 i h200-1920-eph (EU-WEST-PAR)
  • Klucz SSH utworzony w celu wdrożenia instancji GPU z systemem Linux

Dostęp do Panelu klienta OVHcloud

  • Link bezpośredni:
  • Ścieżka nawigacji: Public Cloud > Wybierz projekt > Instancje

W praktyce

Poniżej znajdziesz informacje niezbędne do wdrożenia instancji 8x NVIDIA H200 NVL, zrozumienia jej topologii, a następnie uruchamiania i monitorowania na niej obciążeń AI.

Wdrażanie instancji

W sekcji Szybki dostęp kliknij Utwórz instancję. Następnie wybierz region EU-WEST-PAR i model instancji h200-1920 lub h200-1920-eph w kategorii Cloud GPU.

Potem wykonaj pozostałe kroki opisane w przewodniku Jak utworzyć instancję Public Cloud i się z nią połączyć. Proces ten może potrwać kilka minut.

Po dostarczeniu instancji zainstaluj sterownik NVIDIA zgodnie z opisem w przewodniku Uruchomienie instancji GPU.

Przegląd sprzętu

Parametrh200-1920h200-1920-eph
GPU8x NVIDIA H200 NVL8x NVIDIA H200 NVL
Pamięć GPU141 GB HBM3e na GPU (łącznie 1128 GB)141 GB HBM3e na GPU (łącznie 1128 GB)
Topologia GPU2 grupy po 4 GPU2 grupy po 4 GPU
Połączenie wewnątrz grupyNVLink, w obrębie każdej grupy 4 GPUNVLink, w obrębie każdej grupy 4 GPU
Połączenie między grupamiPCIePCIe
vCores224224
Pamięć (RAM)1920 GB1920 GB
Przestrzeń dyskowa400 GB (dysk systemowy) + 4x 7,68 TB passthrough400 GB (dysk systemowy) + 1x 20 TB (dysk efemeryczny)
Sieć publiczna25 Gbit/s25 Gbit/s
Sieć prywatnaDo 25 Gbit/sDo 25 Gbit/s

Dysk efemeryczny (h200-1920-eph)

Dysk efemeryczny modelu instancji h200-1920-eph jest już sformatowany z systemem plików Ext4. Może być już automatycznie zamontowany w /mnt przez cloud-init.

Aby sprawdzić, czy dysk efemeryczny jest zamontowany, uruchom następujące polecenie:

lsblk -f

Jeśli dysk 20 TB ma /mnt jako punkt montowania, jest gotowy do użycia. W przeciwnym razie zamontuj go ręcznie, zastępując /dev/<device> nazwą urządzenia wyświetloną przez lsblk -f:

sudo mount /dev/<device> /mnt
Warning

Dane przechowywane na dysku efemerycznym nie są uwzględniane w kopiach zapasowych instancji i zostają utracone po usunięciu lub zawieszeniu instancji. Zalecamy tworzenie kopii zapasowych ważnych danych w zewnętrznym rozwiązaniu do przechowywania danych, takim jak Object Storage.

8 GPU jest zorganizowanych w następujący sposób:

Schemat dwóch grup NVLink po 4 GPU, połączonych ze sobą przez PCIe
Grupa NVLinkGPUPołączenie w obrębie grupyPołączenie między grupami
Grupa AGPU 0, 1, 2, 3NVLink (wszystkie 4 GPU w pełni połączone)PCIe
Grupa BGPU 4, 5, 6, 7NVLink (wszystkie 4 GPU w pełni połączone)PCIe

Podczas przydzielania obciążeń na tej instancji zalecamy następujące praktyki:

  • W miarę możliwości uruchamiaj każde zadanie w obrębie jednej grupy NVLink (4 GPU).
  • Gdy jeden model wymaga wszystkich 8 GPU, traktuj obie grupy jak dwa oddzielne klastry: utrzymuj równoległość o dużej intensywności komunikacji (taką jak tensor parallelism) w obrębie każdej grupy, a między grupami stosuj tylko lżejszą komunikację (taką jak pipeline parallelism). Przykład znajdziesz w zalecanych konfiguracjach poniżej.
  • Pamiętaj, że korzyści wydajnościowe NVLink dotyczą wyłącznie komunikacji w obrębie każdej grupy 4 GPU.
Info

Utrzymywanie operacji o dużej intensywności komunikacji w obrębie każdej grupy NVLink pozwala uniknąć dużego ruchu na magistrali PCIe, co zapewnia zarówno lepszą wydajność, jak i większą stabilność.

Przed uruchomieniem obciążenia zalecamy sprawdzenie, które GPU należą do której grupy NVLink:

nvidia-smi topo -m

W macierzy GPU połączone przez NVLink mają między sobą wartość NV# (# oznacza liczbę połączeń NVLink). GPU połączone wyłącznie przez PCIe pokazują zamiast tego typ ścieżki PCIe (na przykład PHB, NODE lub SYS). Cztery GPU, które mają między sobą wartości NV#, tworzą jedną grupę NVLink.

Możesz również wyświetlić stan NVLink danego GPU (tutaj GPU 0):

nvidia-smi nvlink --status -i 0

Zalecane konfiguracje

Poniższe przykłady wykorzystują vLLM, aby pokazać, jak wdrożyć model na 4 lub 8 GPU z zachowaniem topologii NVLink.

4 GPU (jedna grupa NVLink)
8 GPU (obie grupy NVLink)
Dwie repliki (po jednej na grupę NVLink)

Aby wdrożyć model na 4 GPU, jawnie wskaż identyfikatory urządzeń, tak by wszystkie należały do tej samej grupy NVLink:

# Numeruj GPU w tej samej kolejności co nvidia-smi (kolejność magistrali PCI)
export CUDA_DEVICE_ORDER=PCI_BUS_ID

# Ogranicz wdrożenie do pierwszej grupy NVLink (dla drugiej grupy użyj 4,5,6,7)
export CUDA_VISIBLE_DEVICES=0,1,2,3

# Ustaw rozmiar tensor parallel na 4
vllm serve <MODEL_SLUG> --tensor-parallel-size 4 ...

Dobre praktyki eksploatacyjne

Zalecamy:

  • sprawdzanie przypisania GPU do grup NVLink przed uruchomieniem obciążenia (nvidia-smi topo -m).
  • utrzymywanie wszystkich GPU używanych przez jedno zadanie w tej samej grupie NVLink, chyba że korzystasz z konfiguracji międzygrupowej, takiej jak opisana powyżej konfiguracja z pipeline parallelism.
  • monitorowanie stanu NVLink i logów jądra (dmesg) podczas działania obciążeń.
  • regularne tworzenie kopii zapasowych ważnych danych.

Zalecane monitorowanie

Zalecamy monitorowanie następujących metryk podczas działania obciążeń:

MetrykaMetodaZalecenie
Stan i błędy NVLinknvidia-smi nvlink --status / nvidia-smi nvlink -eZalecane
Wykrywanie i kondycja GPUnvidia-smi -q / NVIDIA DCGM (dcgmi health)Zalecane
Błędy GPU w logach jądrasudo dmesg -T | grep -iE "xid|nvrm"Zalecane
Info

Błędy GPU i NVLink są zgłaszane przez sterownik NVIDIA w logach jądra jako komunikaty Xid. W celu ciągłego monitorowania NVIDIA DCGM może eksportować te metryki do Twojego narzędzia monitorującego. Polecenia smartctl i nvme są dostarczane przez pakiety smartmontools i nvme-cli (na przykład sudo apt-get install smartmontools nvme-cli w systemie Debian lub Ubuntu).

Sprawdź również

Uruchomienie instancji GPU

Dołącz do grona naszych użytkowników.

Czy ta strona była pomocna?