Desplegar cargas de trabajo de IA en una instancia 8x NVIDIA H200 NVL
Descubra cómo desplegar cargas de trabajo de IA en una instancia GPU 8x NVIDIA H200 NVL teniendo en cuenta su topología NVLink
Objetivo
Le recomendamos que siga esta guía si dispone de una instancia h200-1920-eph o h200-1920. Las instancias 8x NVIDIA H200 NVL (modelos h200-1920 y h200-1920-eph) están organizadas en dos grupos de 4 GPU, con conectividad NVLink únicamente dentro de cada grupo y un enlace PCIe entre ambos grupos. Tener en cuenta esta topología le permite obtener el mejor rendimiento y una estabilidad óptima para sus cargas de trabajo de IA.
Actualmente, las instancias 8x NVIDIA H200 NVL solo están disponibles en la región de París (EU-WEST-PAR).
Esta guía explica cómo desplegar y gestionar cargas de trabajo de IA en una instancia GPU 8x NVIDIA H200 NVL
Requisitos
- Disponer de un proyecto Public Cloud con acceso a la región en la que están disponibles los modelos de instancia h200-1920 y h200-1920-eph (EU-WEST-PAR).
- Disponer de una clave SSH creada para desplegar una instancia GPU Linux.
Acceso al área de cliente de OVHcloud
- Enlace directo:
- Ruta de navegación:
Public Cloud> Seleccione su proyecto >Instancias
Procedimiento
A continuación encontrará la información necesaria para desplegar una instancia 8x NVIDIA H200 NVL, entender su topología y, después, ejecutar y supervisar en ella sus cargas de trabajo de IA.
Desplegar la instancia
En la sección Acceso rápido, haga clic en Crear una instancia. A continuación, seleccione la región EU-WEST-PAR y elija el modelo de instancia h200-1920 o h200-1920-eph en la categoría Cloud GPU.
Después, siga los pasos restantes, tal como se indica en la guía Cómo crear una instancia de Public Cloud y conectarse a ella. Este proceso puede tardar unos minutos.
Una vez entregada la instancia, instale el controlador NVIDIA tal como se indica en la guía Desplegar una instancia GPU.
Presentación del hardware
Disco efímero (h200-1920-eph)
El disco efímero del modelo de instancia h200-1920-eph ya está formateado con un sistema de archivos Ext4. Es posible que cloud-init ya lo haya montado automáticamente en /mnt.
Para comprobar si el disco efímero está montado, ejecute el siguiente comando:
Si el disco de 20 TB muestra /mnt como punto de montaje, está listo para usarse. De lo contrario, móntelo manualmente sustituyendo /dev/<device> por el nombre del dispositivo que muestra lsblk -f:
Los datos almacenados en el disco efímero no se incluyen en las copias de seguridad de instancia y se pierden cuando la instancia se elimina o se suspende (shelved). Le recomendamos que guarde sus datos importantes en una solución de almacenamiento externa, como Object Storage.
Topología GPU y arquitectura NVLink
Las 8 GPU están organizadas de la siguiente manera:
Para distribuir sus cargas de trabajo en esta instancia, le recomendamos:
- ejecutar, siempre que sea posible, cada trabajo dentro de un único grupo NVLink (4 GPU).
- tratar los dos grupos como dos clústeres independientes cuando un mismo modelo necesite las 8 GPU: mantener los paralelismos que más comunicaciones requieren (como el tensor parallelism) dentro de cada grupo y utilizar entre ambos grupos solo modos de comunicación más ligeros (como el pipeline parallelism). En las configuraciones recomendadas más abajo se presenta un ejemplo.
- tener en cuenta que las ventajas de rendimiento de NVLink solo se aplican dentro de cada grupo de 4 GPU.
Mantener las operaciones que más comunicaciones requieren dentro de cada grupo NVLink evita un tráfico elevado en el bus PCIe, lo que garantiza a la vez un mejor rendimiento y una mayor estabilidad.
Antes de lanzar una carga de trabajo, le recomendamos que compruebe qué GPU pertenecen a cada grupo NVLink:
En la matriz que se muestra, las GPU conectadas por NVLink presentan un valor NV# entre ellas (# corresponde al número de enlaces NVLink). Las GPU conectadas únicamente por PCIe muestran en su lugar un tipo de ruta PCIe (por ejemplo, PHB, NODE o SYS). Las 4 GPU que presentan valores NV# entre ellas forman un grupo NVLink.
También puede mostrar el estado de los enlaces NVLink de una GPU determinada (aquí, la GPU 0):
Configuraciones recomendadas
Los siguientes ejemplos utilizan vLLM para ilustrar el despliegue de un modelo en 4 u 8 GPU respetando la topología NVLink.
Para desplegar en 4 GPU, indique explícitamente los identificadores de los dispositivos que va a utilizar, con el fin de asegurarse de que todos pertenecen al mismo grupo NVLink:
Buenas prácticas de operación
Le recomendamos:
- comprobar la correspondencia entre las GPU y los grupos NVLink antes de lanzar una carga de trabajo (
nvidia-smi topo -m). - mantener todas las GPU utilizadas por un mismo trabajo dentro del mismo grupo NVLink, salvo si utiliza una configuración entre grupos como la de pipeline parallelism descrita anteriormente.
- supervisar el estado de NVLink y los logs del kernel (
dmesg) durante la ejecución de sus cargas de trabajo. - realizar copias de seguridad periódicas de sus datos importantes.
Monitorización recomendada
Le recomendamos supervisar las siguientes métricas durante la ejecución de sus cargas de trabajo:
El controlador NVIDIA notifica los errores de GPU y de NVLink en los logs del kernel en forma de mensajes Xid. Para una monitorización continua, NVIDIA DCGM permite exportar estas métricas a su herramienta de monitorización. Los comandos smartctl y nvme los proporcionan los paquetes smartmontools y nvme-cli (por ejemplo, sudo apt-get install smartmontools nvme-cli en Debian o Ubuntu).
Más información
Interactúe con nuestra comunidad de usuarios.