Distribuire carichi di lavoro di IA su un'istanza 8x NVIDIA H200 NVL
Scopri come distribuire carichi di lavoro di IA su un'istanza GPU 8x NVIDIA H200 NVL tenendo conto della sua topologia NVLink
Obiettivo
Ti consigliamo di seguire questa guida se disponi di un'istanza h200-1920-eph o h200-1920. Le istanze 8x NVIDIA H200 NVL (modelli h200-1920 e h200-1920-eph) sono organizzate in due gruppi di 4 GPU, con connettività NVLink solo all'interno di ciascun gruppo e un collegamento PCIe tra i due gruppi. Tenere conto di questa topologia ti permette di ottenere le migliori prestazioni e una stabilità ottimale per i tuoi carichi di lavoro di IA.
Attualmente, le istanze 8x NVIDIA H200 NVL sono disponibili solo nella regione di Parigi (EU-WEST-PAR).
Questa guida ti mostra come distribuire e gestire carichi di lavoro di IA su un'istanza GPU 8x NVIDIA H200 NVL
Prerequisiti
- Disporre di un progetto Public Cloud con accesso alla regione in cui sono disponibili i modelli di istanza h200-1920 e h200-1920-eph (EU-WEST-PAR).
- Disporre di una chiave SSH creata per distribuire un'istanza GPU Linux.
Accesso allo Spazio Cliente OVHcloud
- Link diretto:
- Percorso di navigazione:
Public Cloud> Seleziona il tuo progetto >Istanze
Procedura
Di seguito troverai le informazioni necessarie per distribuire un'istanza 8x NVIDIA H200 NVL, comprenderne la topologia e poi eseguire e monitorare i tuoi carichi di lavoro di IA.
Distribuire l'istanza
Nella sezione Accesso rapido, clicca su Creare un'istanza. Seleziona quindi la regione EU-WEST-PAR e scegli il modello di istanza h200-1920 o h200-1920-eph nella categoria Cloud GPU.
Segui poi i passaggi successivi, come descritto nella guida Come creare un'istanza Public Cloud e connettersi. Questa operazione può richiedere qualche minuto.
Una volta consegnata l'istanza, installa il driver NVIDIA come indicato nella guida Creare un'istanza GPU.
Panoramica dell'hardware
Disco effimero (h200-1920-eph)
Il disco effimero del modello di istanza h200-1920-eph è già formattato con un file system Ext4. Potrebbe essere già montato automaticamente in /mnt da cloud-init.
Per verificare se il disco effimero è montato, esegui questo comando:
Se il disco da 20 TB mostra /mnt come punto di montaggio, è pronto per l'uso. In caso contrario, montalo manualmente sostituendo /dev/<device> con il nome del dispositivo mostrato da lsblk -f:
I dati archiviati sul disco effimero non sono inclusi nei backup dell'istanza e vengono persi quando l'istanza viene eliminata o sospesa (shelved). Ti consigliamo di salvare i tuoi dati importanti su una soluzione di storage esterna, come Object Storage.
Topologia GPU e architettura NVLink
Le 8 GPU sono organizzate come segue:
Per distribuire i tuoi carichi di lavoro su questa istanza, ti consigliamo di:
- eseguire, per quanto possibile, ogni job all'interno di un solo gruppo NVLink (4 GPU).
- trattare i due gruppi come due cluster distinti quando uno stesso modello richiede tutte le 8 GPU: mantenere i parallelismi più intensivi in termini di comunicazioni (come il tensor parallelism) all'interno di ciascun gruppo e utilizzare tra i due gruppi solo modalità di comunicazione più leggere (come il pipeline parallelism). Un esempio è presentato nelle configurazioni consigliate più avanti.
- tenere presente che i vantaggi prestazionali di NVLink si applicano solo all'interno di ciascun gruppo di 4 GPU.
Mantenere le operazioni più intensive in termini di comunicazioni all'interno di ciascun gruppo NVLink evita un traffico elevato sul bus PCIe, garantendo così prestazioni migliori e una maggiore stabilità .
Prima di avviare un carico di lavoro, ti consigliamo di verificare quali GPU appartengono a quale gruppo NVLink:
Nella matrice visualizzata, le GPU collegate tramite NVLink presentano tra loro un valore NV# (# corrisponde al numero di collegamenti NVLink). Le GPU collegate solo tramite PCIe mostrano invece un tipo di percorso PCIe (ad esempio PHB, NODE o SYS). Le 4 GPU che presentano tra loro valori NV# formano un gruppo NVLink.
Puoi anche visualizzare lo stato dei collegamenti NVLink di una determinata GPU (qui la GPU 0):
Configurazioni consigliate
Gli esempi seguenti utilizzano vLLM per illustrare la distribuzione di un modello su 4 o 8 GPU nel rispetto della topologia NVLink.
Per distribuire su 4 GPU, indica esplicitamente gli identificativi dei dispositivi da utilizzare, in modo da assicurarti che appartengano tutti allo stesso gruppo NVLink:
Buone pratiche operative
Ti consigliamo di:
- verificare la corrispondenza tra le GPU e i gruppi NVLink prima di avviare un carico di lavoro (
nvidia-smi topo -m). - mantenere tutte le GPU utilizzate da uno stesso job all'interno dello stesso gruppo NVLink, a meno che tu non utilizzi una configurazione inter-gruppo come quella in pipeline parallelism descritta sopra.
- monitorare lo stato di NVLink e i log del kernel (
dmesg) durante l'esecuzione dei tuoi carichi di lavoro. - salvare regolarmente i tuoi dati importanti.
Monitoraggio consigliato
Ti consigliamo di monitorare le seguenti metriche durante l'esecuzione dei tuoi carichi di lavoro:
Il driver NVIDIA segnala gli errori GPU e NVLink nei log del kernel sotto forma di messaggi Xid. Per un monitoraggio continuo, NVIDIA DCGM permette di esportare queste metriche verso il tuo strumento di monitoraggio. I comandi smartctl e nvme sono forniti dai pacchetti smartmontools e nvme-cli (ad esempio sudo apt-get install smartmontools nvme-cli su Debian o Ubuntu).
Per saperne di più
Contatta la nostra Community di utenti.