For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/pt/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/pt/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/pt/guides/public-cloud/compute/deploy-8-h200-nvl-gpu-instance.md.

Implementar cargas de trabalho de IA numa instância 8x NVIDIA H200 NVL

Ver como Markdown

Descubra como implementar cargas de trabalho de IA numa instância GPU 8x NVIDIA H200 NVL tendo em conta a sua topologia NVLink

Objetivo

Recomendamos que siga este guia se dispuser de uma instância h200-1920-eph ou h200-1920. As instâncias 8x NVIDIA H200 NVL (modelos h200-1920 e h200-1920-eph) estão organizadas em dois grupos de 4 GPU, com conectividade NVLink apenas dentro de cada grupo e uma ligação PCIe entre os dois grupos. Ter em conta esta topologia permite-lhe obter o melhor desempenho e uma estabilidade ótima para as suas cargas de trabalho de IA.

Info

Atualmente, as instâncias 8x NVIDIA H200 NVL estão disponíveis apenas na região de Paris (EU-WEST-PAR).

Este guia explica como implementar e gerir cargas de trabalho de IA numa instância GPU 8x NVIDIA H200 NVL

Requisitos

  • Dispor de um projeto Public Cloud com acesso à região onde os modelos de instância h200-1920 e h200-1920-eph estão disponíveis (EU-WEST-PAR).
  • Dispor de uma chave SSH criada para implementar uma instância GPU Linux.

Acesso à Área de Cliente OVHcloud

  • Ligação direta:
  • Caminho de navegação: Public Cloud > Selecione o seu projeto > Instâncias

Instruções

Encontrará abaixo as informações necessárias para implementar uma instância 8x NVIDIA H200 NVL, compreender a sua topologia e, em seguida, executar e monitorizar nela as suas cargas de trabalho de IA.

Implementar a instância

Na secção Acesso rápido, clique em Criar uma instância. Em seguida, selecione a região EU-WEST-PAR e escolha o modelo de instância h200-1920 ou h200-1920-eph na categoria Cloud GPU.

Depois, siga os restantes passos, conforme descrito no guia Como criar uma instância Public Cloud e conectar-se a ela. Este processo pode demorar alguns minutos.

Assim que a instância for entregue, instale o driver NVIDIA conforme indicado no guia Criar uma instância GPU.

Apresentação do hardware

Característicah200-1920h200-1920-eph
GPU8x NVIDIA H200 NVL8x NVIDIA H200 NVL
Memória GPU141 GB HBM3e por GPU (1128 GB no total)141 GB HBM3e por GPU (1128 GB no total)
Topologia GPU2 grupos de 4 GPU2 grupos de 4 GPU
Interligação intragrupoNVLink, dentro de cada grupo de 4 GPUNVLink, dentro de cada grupo de 4 GPU
Interligação intergruposPCIePCIe
vCores224224
Memória (RAM)1920 GB1920 GB
Armazenamento400 GB (disco de sistema) + 4x 7,68 TB em passthrough400 GB (disco de sistema) + 1x 20 TB efémero
Rede pública25 Gbit/s25 Gbit/s
Rede privadaAté 25 Gbit/sAté 25 Gbit/s

Disco efémero (h200-1920-eph)

O disco efémero do modelo de instância h200-1920-eph já está formatado com um sistema de ficheiros Ext4. Pode já estar montado automaticamente em /mnt pelo cloud-init.

Para verificar se o disco efémero está montado, execute o seguinte comando:

lsblk -f

Se o disco de 20 TB apresentar /mnt como ponto de montagem, está pronto a utilizar. Caso contrário, monte-o manualmente, substituindo /dev/<device> pelo nome do dispositivo apresentado por lsblk -f:

sudo mount /dev/<device> /mnt
Warning

Os dados armazenados no disco efémero não estão incluídos nas cópias de segurança da instância e perdem-se quando a instância é eliminada ou suspensa (shelved). Recomendamos que guarde os seus dados importantes numa solução de armazenamento externa, como o Object Storage.

As 8 GPU estão organizadas da seguinte forma:

Esquema dos dois grupos NVLink de 4 GPU, ligados entre si por PCIe
Grupo NVLinkGPUInterligação dentro do grupoInterligação entre os grupos
Grupo AGPU 0, 1, 2, 3NVLink (as 4 GPU estão todas interligadas)PCIe
Grupo BGPU 4, 5, 6, 7NVLink (as 4 GPU estão todas interligadas)PCIe

Para distribuir as suas cargas de trabalho nesta instância, recomendamos:

  • executar, sempre que possível, cada tarefa dentro de um único grupo NVLink (4 GPU).
  • tratar os dois grupos como dois clusters distintos quando um mesmo modelo necessitar das 8 GPU: manter os paralelismos que exigem mais comunicações (como o tensor parallelism) dentro de cada grupo e utilizar entre os dois grupos apenas modos de comunicação mais leves (como o pipeline parallelism). É apresentado um exemplo nas configurações recomendadas abaixo.
  • ter em conta que os ganhos de desempenho do NVLink se aplicam apenas dentro de cada grupo de 4 GPU.
Info

Manter as operações que exigem mais comunicações dentro de cada grupo NVLink evita um tráfego elevado no barramento PCIe, o que garante simultaneamente um melhor desempenho e uma maior estabilidade.

Antes de lançar uma carga de trabalho, recomendamos que verifique que GPU pertencem a que grupo NVLink:

nvidia-smi topo -m

Na matriz apresentada, as GPU ligadas por NVLink mostram um valor NV# entre si (# corresponde ao número de ligações NVLink). As GPU ligadas apenas por PCIe mostram, em vez disso, um tipo de caminho PCIe (por exemplo, PHB, NODE ou SYS). As 4 GPU que mostram valores NV# entre si formam um grupo NVLink.

Também pode apresentar o estado das ligações NVLink de uma determinada GPU (neste caso, a GPU 0):

nvidia-smi nvlink --status -i 0

Configurações recomendadas

Os exemplos abaixo utilizam o vLLM para ilustrar a implementação de um modelo em 4 ou 8 GPU respeitando a topologia NVLink.

4 GPU (um único grupo NVLink)
8 GPU (os dois grupos NVLink)
Duas réplicas (uma por grupo NVLink)

Para implementar em 4 GPU, indique explicitamente os identificadores dos dispositivos a utilizar, de forma a garantir que todos pertencem ao mesmo grupo NVLink:

# Numerar as GPU pela mesma ordem que o nvidia-smi (ordem do barramento PCI)
export CUDA_DEVICE_ORDER=PCI_BUS_ID

# Limitar a implementação ao primeiro grupo NVLink (utilize 4,5,6,7 para o segundo grupo)
export CUDA_VISIBLE_DEVICES=0,1,2,3

# Definir o tamanho do tensor parallelism como 4
vllm serve <MODEL_SLUG> --tensor-parallel-size 4 ...

Boas práticas operacionais

Recomendamos:

  • verificar a correspondência entre as GPU e os grupos NVLink antes de lançar uma carga de trabalho (nvidia-smi topo -m).
  • manter todas as GPU utilizadas por uma mesma tarefa dentro do mesmo grupo NVLink, exceto se utilizar uma configuração entre grupos como a de pipeline parallelism descrita acima.
  • monitorizar o estado do NVLink e os registos do kernel (dmesg) durante a execução das suas cargas de trabalho.
  • efetuar regularmente cópias de segurança dos seus dados importantes.

Monitorização recomendada

Recomendamos que monitorize as seguintes métricas durante a execução das suas cargas de trabalho:

MétricaMétodoRecomendação
Estado e erros do NVLinknvidia-smi nvlink --status / nvidia-smi nvlink -eRecomendado
Deteção e estado de funcionamento das GPUnvidia-smi -q / NVIDIA DCGM (dcgmi health)Recomendado
Erros de GPU nos registos do kernelsudo dmesg -T | grep -iE "xid|nvrm"Recomendado
Info

O driver NVIDIA reporta os erros de GPU e NVLink nos registos do kernel sob a forma de mensagens Xid. Para uma monitorização contínua, o NVIDIA DCGM permite exportar estas métricas para a sua ferramenta de monitorização. Os comandos smartctl e nvme são fornecidos pelos pacotes smartmontools e nvme-cli (por exemplo, sudo apt-get install smartmontools nvme-cli em Debian ou Ubuntu).

Quer saber mais?

Criar uma instância GPU

Fale com a nossa comunidade de utilizadores.

Esta página foi útil?