For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/it/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/it/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/it/guides/public-cloud/compute/deploy-8-h200-nvl-gpu-instance.md.

Distribuire carichi di lavoro di IA su un'istanza 8x NVIDIA H200 NVL

Vedi come Markdown

Scopri come distribuire carichi di lavoro di IA su un'istanza GPU 8x NVIDIA H200 NVL tenendo conto della sua topologia NVLink

Obiettivo

Ti consigliamo di seguire questa guida se disponi di un'istanza h200-1920-eph o h200-1920. Le istanze 8x NVIDIA H200 NVL (modelli h200-1920 e h200-1920-eph) sono organizzate in due gruppi di 4 GPU, con connettività NVLink solo all'interno di ciascun gruppo e un collegamento PCIe tra i due gruppi. Tenere conto di questa topologia ti permette di ottenere le migliori prestazioni e una stabilità ottimale per i tuoi carichi di lavoro di IA.

Info

Attualmente, le istanze 8x NVIDIA H200 NVL sono disponibili solo nella regione di Parigi (EU-WEST-PAR).

Questa guida ti mostra come distribuire e gestire carichi di lavoro di IA su un'istanza GPU 8x NVIDIA H200 NVL

Prerequisiti

  • Disporre di un progetto Public Cloud con accesso alla regione in cui sono disponibili i modelli di istanza h200-1920 e h200-1920-eph (EU-WEST-PAR).
  • Disporre di una chiave SSH creata per distribuire un'istanza GPU Linux.

Accesso allo Spazio Cliente OVHcloud

  • Link diretto:
  • Percorso di navigazione: Public Cloud > Seleziona il tuo progetto > Istanze

Procedura

Di seguito troverai le informazioni necessarie per distribuire un'istanza 8x NVIDIA H200 NVL, comprenderne la topologia e poi eseguire e monitorare i tuoi carichi di lavoro di IA.

Distribuire l'istanza

Nella sezione Accesso rapido, clicca su Creare un'istanza. Seleziona quindi la regione EU-WEST-PAR e scegli il modello di istanza h200-1920 o h200-1920-eph nella categoria Cloud GPU.

Segui poi i passaggi successivi, come descritto nella guida Come creare un'istanza Public Cloud e connettersi. Questa operazione può richiedere qualche minuto.

Una volta consegnata l'istanza, installa il driver NVIDIA come indicato nella guida Creare un'istanza GPU.

Panoramica dell'hardware

Caratteristicah200-1920h200-1920-eph
GPU8x NVIDIA H200 NVL8x NVIDIA H200 NVL
Memoria GPU141 GB HBM3e per GPU (1.128 GB in totale)141 GB HBM3e per GPU (1.128 GB in totale)
Topologia GPU2 gruppi di 4 GPU2 gruppi di 4 GPU
Interconnessione intra-gruppoNVLink, all'interno di ciascun gruppo di 4 GPUNVLink, all'interno di ciascun gruppo di 4 GPU
Interconnessione inter-gruppoPCIePCIe
vCores224224
Memoria (RAM)1.920 GB1.920 GB
Storage400 GB (disco di sistema) + 4x 7,68 TB in passthrough400 GB (disco di sistema) + 1x 20 TB effimero
Rete pubblica25 Gbit/s25 Gbit/s
Rete privataFino a 25 Gbit/sFino a 25 Gbit/s

Disco effimero (h200-1920-eph)

Il disco effimero del modello di istanza h200-1920-eph è già formattato con un file system Ext4. Potrebbe essere già montato automaticamente in /mnt da cloud-init.

Per verificare se il disco effimero è montato, esegui questo comando:

lsblk -f

Se il disco da 20 TB mostra /mnt come punto di montaggio, è pronto per l'uso. In caso contrario, montalo manualmente sostituendo /dev/<device> con il nome del dispositivo mostrato da lsblk -f:

sudo mount /dev/<device> /mnt
Warning

I dati archiviati sul disco effimero non sono inclusi nei backup dell'istanza e vengono persi quando l'istanza viene eliminata o sospesa (shelved). Ti consigliamo di salvare i tuoi dati importanti su una soluzione di storage esterna, come Object Storage.

Le 8 GPU sono organizzate come segue:

Schema dei due gruppi NVLink da 4 GPU, collegati tra loro tramite PCIe
Gruppo NVLinkGPUInterconnessione all'interno del gruppoInterconnessione tra i gruppi
Gruppo AGPU 0, 1, 2, 3NVLink (le 4 GPU sono tutte interconnesse)PCIe
Gruppo BGPU 4, 5, 6, 7NVLink (le 4 GPU sono tutte interconnesse)PCIe

Per distribuire i tuoi carichi di lavoro su questa istanza, ti consigliamo di:

  • eseguire, per quanto possibile, ogni job all'interno di un solo gruppo NVLink (4 GPU).
  • trattare i due gruppi come due cluster distinti quando uno stesso modello richiede tutte le 8 GPU: mantenere i parallelismi più intensivi in termini di comunicazioni (come il tensor parallelism) all'interno di ciascun gruppo e utilizzare tra i due gruppi solo modalità di comunicazione più leggere (come il pipeline parallelism). Un esempio è presentato nelle configurazioni consigliate più avanti.
  • tenere presente che i vantaggi prestazionali di NVLink si applicano solo all'interno di ciascun gruppo di 4 GPU.
Info

Mantenere le operazioni più intensive in termini di comunicazioni all'interno di ciascun gruppo NVLink evita un traffico elevato sul bus PCIe, garantendo così prestazioni migliori e una maggiore stabilità.

Prima di avviare un carico di lavoro, ti consigliamo di verificare quali GPU appartengono a quale gruppo NVLink:

nvidia-smi topo -m

Nella matrice visualizzata, le GPU collegate tramite NVLink presentano tra loro un valore NV# (# corrisponde al numero di collegamenti NVLink). Le GPU collegate solo tramite PCIe mostrano invece un tipo di percorso PCIe (ad esempio PHB, NODE o SYS). Le 4 GPU che presentano tra loro valori NV# formano un gruppo NVLink.

Puoi anche visualizzare lo stato dei collegamenti NVLink di una determinata GPU (qui la GPU 0):

nvidia-smi nvlink --status -i 0

Configurazioni consigliate

Gli esempi seguenti utilizzano vLLM per illustrare la distribuzione di un modello su 4 o 8 GPU nel rispetto della topologia NVLink.

4 GPU (un solo gruppo NVLink)
8 GPU (entrambi i gruppi NVLink)
Due repliche (una per gruppo NVLink)

Per distribuire su 4 GPU, indica esplicitamente gli identificativi dei dispositivi da utilizzare, in modo da assicurarti che appartengano tutti allo stesso gruppo NVLink:

# Numerare le GPU nello stesso ordine di nvidia-smi (ordine del bus PCI)
export CUDA_DEVICE_ORDER=PCI_BUS_ID

# Limitare la distribuzione al primo gruppo NVLink (usa 4,5,6,7 per il secondo gruppo)
export CUDA_VISIBLE_DEVICES=0,1,2,3

# Impostare la dimensione del tensor parallelism a 4
vllm serve <MODEL_SLUG> --tensor-parallel-size 4 ...

Buone pratiche operative

Ti consigliamo di:

  • verificare la corrispondenza tra le GPU e i gruppi NVLink prima di avviare un carico di lavoro (nvidia-smi topo -m).
  • mantenere tutte le GPU utilizzate da uno stesso job all'interno dello stesso gruppo NVLink, a meno che tu non utilizzi una configurazione inter-gruppo come quella in pipeline parallelism descritta sopra.
  • monitorare lo stato di NVLink e i log del kernel (dmesg) durante l'esecuzione dei tuoi carichi di lavoro.
  • salvare regolarmente i tuoi dati importanti.

Monitoraggio consigliato

Ti consigliamo di monitorare le seguenti metriche durante l'esecuzione dei tuoi carichi di lavoro:

MetricaMetodoRaccomandazione
Stato ed errori di NVLinknvidia-smi nvlink --status / nvidia-smi nvlink -eConsigliato
Rilevamento e stato di salute delle GPUnvidia-smi -q / NVIDIA DCGM (dcgmi health)Consigliato
Errori GPU nei log del kernelsudo dmesg -T | grep -iE "xid|nvrm"Consigliato
Info

Il driver NVIDIA segnala gli errori GPU e NVLink nei log del kernel sotto forma di messaggi Xid. Per un monitoraggio continuo, NVIDIA DCGM permette di esportare queste metriche verso il tuo strumento di monitoraggio. I comandi smartctl e nvme sono forniti dai pacchetti smartmontools e nvme-cli (ad esempio sudo apt-get install smartmontools nvme-cli su Debian o Ubuntu).

Per saperne di più

Creare un'istanza GPU

Contatta la nostra Community di utenti.

Questa pagina ti è stata utile?