For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/de/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/de/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/de/guides/public-cloud/compute/deploy-8-h200-nvl-gpu-instance.md.

KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL bereitstellen

Als Markdown ansehen

Erfahren Sie, wie Sie KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL unter Berücksichtigung ihrer NVLink-Topologie bereitstellen

Ziel

Wir empfehlen Ihnen, dieser Anleitung zu folgen, wenn Sie eine Instanz vom Typ h200-1920-eph oder h200-1920 verwenden. Instanzen mit 8x NVIDIA H200 NVL (Modelle h200-1920 und h200-1920-eph) sind in zwei Gruppen zu je 4 GPUs organisiert, mit NVLink-Konnektivität nur innerhalb jeder Gruppe und PCIe zwischen den beiden Gruppen. Wenn Sie diese Topologie berücksichtigen, erzielen Sie die beste Leistung und Stabilität für Ihre KI-Workloads.

Info

Derzeit sind Instanzen mit 8x NVIDIA H200 NVL nur in der Region Paris (EU-WEST-PAR) verfügbar.

Diese Anleitung erklärt, wie Sie KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL bereitstellen und betreiben

Voraussetzungen

  • Sie verfügen über ein Public Cloud Projekt mit Zugriff auf die Region, in der die Instanzmodelle h200-1920 und h200-1920-eph verfügbar sind (EU-WEST-PAR).
  • Sie haben einen SSH-Schlüssel erstellt, um eine Linux-GPU-Instanz bereitzustellen.

Zugriff auf das OVHcloud Kundencenter

  • Direkter Link:
  • Navigationspfad: Public Cloud > Wählen Sie Ihr Projekt aus > Instanzen

In der praktischen Anwendung

Nachfolgend finden Sie die Informationen, die Sie benötigen, um eine Instanz mit 8x NVIDIA H200 NVL bereitzustellen, ihre Topologie zu verstehen und anschließend Ihre KI-Workloads darauf auszuführen und zu überwachen.

Instanz bereitstellen

Klicken Sie im Bereich Schnellzugriff auf Instanz erstellen. Wählen Sie anschließend die Region EU-WEST-PAR und in der Kategorie Cloud GPU das Instanzmodell h200-1920 oder h200-1920-eph aus.

Folgen Sie dann den weiteren Schritten, wie in der Anleitung Eine Public Cloud Instanz erstellen und darauf zugreifen beschrieben. Dieser Vorgang kann einige Minuten dauern.

Sobald die Instanz ausgeliefert ist, installieren Sie den NVIDIA-Treiber, wie in der Anleitung GPU Instanzen einrichten beschrieben.

Hardware-Übersicht

Merkmalh200-1920h200-1920-eph
GPUs8x NVIDIA H200 NVL8x NVIDIA H200 NVL
GPU-Speicher141 GB HBM3e pro GPU (insgesamt 1.128 GB)141 GB HBM3e pro GPU (insgesamt 1.128 GB)
GPU-Topologie2 Gruppen zu je 4 GPUs2 Gruppen zu je 4 GPUs
Verbindung innerhalb der GruppeNVLink, innerhalb jeder Gruppe von 4 GPUsNVLink, innerhalb jeder Gruppe von 4 GPUs
Verbindung zwischen den GruppenPCIePCIe
vCores224224
Arbeitsspeicher (RAM)1.920 GB1.920 GB
Speicher400 GB (Systemfestplatte) + 4x 7,68 TB (Passthrough)400 GB (Systemfestplatte) + 1x 20 TB (ephemer)
Öffentliches Netzwerk25 Gbit/s25 Gbit/s
Privates NetzwerkBis zu 25 Gbit/sBis zu 25 Gbit/s

Ephemere Festplatte (h200-1920-eph)

Die ephemere Festplatte des Instanzmodells h200-1920-eph ist bereits mit einem Ext4-Dateisystem formatiert. Möglicherweise wurde sie von cloud-init bereits automatisch unter /mnt eingehängt.

Um zu überprüfen, ob die ephemere Festplatte eingehängt ist, führen Sie folgenden Befehl aus:

lsblk -f

Wenn die 20-TB-Festplatte /mnt als Einhängepunkt anzeigt, ist sie einsatzbereit. Andernfalls hängen Sie sie manuell ein und ersetzen Sie dabei /dev/<device> durch den von lsblk -f angezeigten Gerätenamen:

sudo mount /dev/<device> /mnt
Warning

Auf der ephemeren Festplatte gespeicherte Daten sind nicht in den Instanz-Backups enthalten und gehen verloren, wenn die Instanz gelöscht oder ausgesetzt wird. Wir empfehlen Ihnen, Ihre wichtigen Daten auf einer externen Speicherlösung zu sichern, zum Beispiel in Object Storage.

Die 8 GPUs sind wie folgt organisiert:

Schema der zwei NVLink-Gruppen mit je 4 GPUs, untereinander über PCIe verbunden
NVLink-GruppeGPUsVerbindung innerhalb der GruppeVerbindung zwischen den Gruppen
Gruppe AGPU 0, 1, 2, 3NVLink (alle 4 GPUs vollständig miteinander verbunden)PCIe
Gruppe BGPU 4, 5, 6, 7NVLink (alle 4 GPUs vollständig miteinander verbunden)PCIe

Für die Verteilung von Workloads auf dieser Instanz empfehlen wir Folgendes:

  • Führen Sie jeden Job nach Möglichkeit innerhalb einer einzigen NVLink-Gruppe (4 GPUs) aus.
  • Wenn ein einzelnes Modell alle 8 GPUs benötigt, behandeln Sie die beiden Gruppen wie zwei getrennte Cluster: Halten Sie kommunikationsintensive Parallelisierung (wie Tensor Parallelism) innerhalb jeder Gruppe und nutzen Sie zwischen den beiden Gruppen nur weniger kommunikationsintensive Verfahren (wie Pipeline Parallelism). Ein Beispiel finden Sie in den empfohlenen Konfigurationen weiter unten.
  • Beachten Sie, dass die Leistungsvorteile von NVLink nur innerhalb jeder Gruppe von 4 GPUs gelten.
Info

Wenn Sie kommunikationsintensive Operationen innerhalb jeder NVLink-Gruppe halten, vermeiden Sie hohen Datenverkehr auf dem PCIe-Bus und verbessern so sowohl die Leistung als auch die Stabilität.

Bevor Sie einen Workload starten, empfehlen wir Ihnen zu überprüfen, welche GPUs zu welcher NVLink-Gruppe gehören:

nvidia-smi topo -m

In der Matrix zeigen über NVLink verbundene GPUs untereinander einen Wert NV# an (# steht für die Anzahl der NVLink-Verbindungen). Nur über PCIe verbundene GPUs zeigen stattdessen einen PCIe-Pfadtyp an (zum Beispiel PHB, NODE oder SYS). Die 4 GPUs, die untereinander NV#-Werte anzeigen, bilden eine NVLink-Gruppe.

Sie können auch den NVLink-Status einer bestimmten GPU anzeigen (hier GPU 0):

nvidia-smi nvlink --status -i 0

Empfohlene Konfigurationen

Die folgenden Beispiele verwenden vLLM, um zu veranschaulichen, wie Sie ein Modell unter Berücksichtigung der NVLink-Topologie auf 4 oder 8 GPUs bereitstellen.

4 GPUs (eine NVLink-Gruppe)
8 GPUs (beide NVLink-Gruppen)
Zwei Replikate (eines pro NVLink-Gruppe)

Um ein Modell auf 4 GPUs bereitzustellen, geben Sie die IDs der Geräte explizit an, damit sie alle zur selben NVLink-Gruppe gehören:

# GPUs in derselben Reihenfolge wie nvidia-smi nummerieren (PCI-Bus-Reihenfolge)
export CUDA_DEVICE_ORDER=PCI_BUS_ID

# Bereitstellung auf die erste NVLink-Gruppe beschränken (4,5,6,7 für die zweite Gruppe verwenden)
export CUDA_VISIBLE_DEVICES=0,1,2,3

# Tensor-Parallel-Größe auf 4 setzen
vllm serve <MODEL_SLUG> --tensor-parallel-size 4 ...

Bewährte Vorgehensweisen für den Betrieb

Wir empfehlen Ihnen:

  • die Zuordnung der GPUs zu den NVLink-Gruppen zu überprüfen, bevor Sie einen Workload starten (nvidia-smi topo -m).
  • alle von einem Job verwendeten GPUs innerhalb derselben NVLink-Gruppe zu halten, es sei denn, Sie verwenden eine gruppenübergreifende Konfiguration wie die oben beschriebene mit Pipeline Parallelism.
  • den NVLink-Status und die Kernel-Logs (dmesg) während der Ausführung Ihrer Workloads zu überwachen.
  • Ihre wichtigen Daten regelmäßig zu sichern.

Empfohlenes Monitoring

Wir empfehlen Ihnen, während der Ausführung Ihrer Workloads die folgenden Metriken zu überwachen:

MetrikMethodeEmpfehlung
NVLink-Status und -Fehlernvidia-smi nvlink --status / nvidia-smi nvlink -eEmpfohlen
GPU-Erkennung und -Zustandnvidia-smi -q / NVIDIA DCGM (dcgmi health)Empfohlen
GPU-Fehler in den Kernel-Logssudo dmesg -T | grep -iE "xid|nvrm"Empfohlen
Info

GPU- und NVLink-Fehler werden vom NVIDIA-Treiber in den Kernel-Logs als Xid-Meldungen ausgegeben. Für eine kontinuierliche Überwachung kann NVIDIA DCGM diese Metriken an Ihre Monitoring-Lösung exportieren. Die Befehle smartctl und nvme werden von den Paketen smartmontools und nvme-cli bereitgestellt (zum Beispiel sudo apt-get install smartmontools nvme-cli unter Debian oder Ubuntu).

Weiterführende Informationen

GPU Instanzen einrichten

Treten Sie unserer User Community bei.

War diese Seite hilfreich?