Implementar cargas de trabalho de IA numa instância 8x NVIDIA H200 NVL
Descubra como implementar cargas de trabalho de IA numa instância GPU 8x NVIDIA H200 NVL tendo em conta a sua topologia NVLink
Objetivo
Recomendamos que siga este guia se dispuser de uma instância h200-1920-eph ou h200-1920. As instâncias 8x NVIDIA H200 NVL (modelos h200-1920 e h200-1920-eph) estão organizadas em dois grupos de 4 GPU, com conectividade NVLink apenas dentro de cada grupo e uma ligação PCIe entre os dois grupos. Ter em conta esta topologia permite-lhe obter o melhor desempenho e uma estabilidade ótima para as suas cargas de trabalho de IA.
Atualmente, as instâncias 8x NVIDIA H200 NVL estão disponíveis apenas na região de Paris (EU-WEST-PAR).
Este guia explica como implementar e gerir cargas de trabalho de IA numa instância GPU 8x NVIDIA H200 NVL
Requisitos
- Dispor de um projeto Public Cloud com acesso à região onde os modelos de instância h200-1920 e h200-1920-eph estão disponíveis (EU-WEST-PAR).
- Dispor de uma chave SSH criada para implementar uma instância GPU Linux.
Acesso à Área de Cliente OVHcloud
- Ligação direta:
- Caminho de navegação:
Public Cloud> Selecione o seu projeto >Instâncias
Instruções
Encontrará abaixo as informações necessárias para implementar uma instância 8x NVIDIA H200 NVL, compreender a sua topologia e, em seguida, executar e monitorizar nela as suas cargas de trabalho de IA.
Implementar a instância
Na secção Acesso rápido, clique em Criar uma instância. Em seguida, selecione a região EU-WEST-PAR e escolha o modelo de instância h200-1920 ou h200-1920-eph na categoria Cloud GPU.
Depois, siga os restantes passos, conforme descrito no guia Como criar uma instância Public Cloud e conectar-se a ela. Este processo pode demorar alguns minutos.
Assim que a instância for entregue, instale o driver NVIDIA conforme indicado no guia Criar uma instância GPU.
Apresentação do hardware
Disco efémero (h200-1920-eph)
O disco efémero do modelo de instância h200-1920-eph já está formatado com um sistema de ficheiros Ext4. Pode já estar montado automaticamente em /mnt pelo cloud-init.
Para verificar se o disco efémero está montado, execute o seguinte comando:
Se o disco de 20 TB apresentar /mnt como ponto de montagem, está pronto a utilizar. Caso contrário, monte-o manualmente, substituindo /dev/<device> pelo nome do dispositivo apresentado por lsblk -f:
Os dados armazenados no disco efémero não estão incluídos nas cópias de segurança da instância e perdem-se quando a instância é eliminada ou suspensa (shelved). Recomendamos que guarde os seus dados importantes numa solução de armazenamento externa, como o Object Storage.
Topologia GPU e arquitetura NVLink
As 8 GPU estão organizadas da seguinte forma:
Para distribuir as suas cargas de trabalho nesta instância, recomendamos:
- executar, sempre que possível, cada tarefa dentro de um único grupo NVLink (4 GPU).
- tratar os dois grupos como dois clusters distintos quando um mesmo modelo necessitar das 8 GPU: manter os paralelismos que exigem mais comunicações (como o tensor parallelism) dentro de cada grupo e utilizar entre os dois grupos apenas modos de comunicação mais leves (como o pipeline parallelism). É apresentado um exemplo nas configurações recomendadas abaixo.
- ter em conta que os ganhos de desempenho do NVLink se aplicam apenas dentro de cada grupo de 4 GPU.
Manter as operações que exigem mais comunicações dentro de cada grupo NVLink evita um tráfego elevado no barramento PCIe, o que garante simultaneamente um melhor desempenho e uma maior estabilidade.
Antes de lançar uma carga de trabalho, recomendamos que verifique que GPU pertencem a que grupo NVLink:
Na matriz apresentada, as GPU ligadas por NVLink mostram um valor NV# entre si (# corresponde ao número de ligações NVLink). As GPU ligadas apenas por PCIe mostram, em vez disso, um tipo de caminho PCIe (por exemplo, PHB, NODE ou SYS). As 4 GPU que mostram valores NV# entre si formam um grupo NVLink.
Também pode apresentar o estado das ligações NVLink de uma determinada GPU (neste caso, a GPU 0):
Configurações recomendadas
Os exemplos abaixo utilizam o vLLM para ilustrar a implementação de um modelo em 4 ou 8 GPU respeitando a topologia NVLink.
Para implementar em 4 GPU, indique explicitamente os identificadores dos dispositivos a utilizar, de forma a garantir que todos pertencem ao mesmo grupo NVLink:
Boas práticas operacionais
Recomendamos:
- verificar a correspondência entre as GPU e os grupos NVLink antes de lançar uma carga de trabalho (
nvidia-smi topo -m). - manter todas as GPU utilizadas por uma mesma tarefa dentro do mesmo grupo NVLink, exceto se utilizar uma configuração entre grupos como a de pipeline parallelism descrita acima.
- monitorizar o estado do NVLink e os registos do kernel (
dmesg) durante a execução das suas cargas de trabalho. - efetuar regularmente cópias de segurança dos seus dados importantes.
Monitorização recomendada
Recomendamos que monitorize as seguintes métricas durante a execução das suas cargas de trabalho:
O driver NVIDIA reporta os erros de GPU e NVLink nos registos do kernel sob a forma de mensagens Xid. Para uma monitorização contínua, o NVIDIA DCGM permite exportar estas métricas para a sua ferramenta de monitorização. Os comandos smartctl e nvme são fornecidos pelos pacotes smartmontools e nvme-cli (por exemplo, sudo apt-get install smartmontools nvme-cli em Debian ou Ubuntu).
Quer saber mais?
Fale com a nossa comunidade de utilizadores.