KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL bereitstellen
Erfahren Sie, wie Sie KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL unter Berücksichtigung ihrer NVLink-Topologie bereitstellen
Ziel
Wir empfehlen Ihnen, dieser Anleitung zu folgen, wenn Sie eine Instanz vom Typ h200-1920-eph oder h200-1920 verwenden. Instanzen mit 8x NVIDIA H200 NVL (Modelle h200-1920 und h200-1920-eph) sind in zwei Gruppen zu je 4 GPUs organisiert, mit NVLink-Konnektivität nur innerhalb jeder Gruppe und PCIe zwischen den beiden Gruppen. Wenn Sie diese Topologie berücksichtigen, erzielen Sie die beste Leistung und Stabilität für Ihre KI-Workloads.
Derzeit sind Instanzen mit 8x NVIDIA H200 NVL nur in der Region Paris (EU-WEST-PAR) verfügbar.
Diese Anleitung erklärt, wie Sie KI-Workloads auf einer GPU-Instanz mit 8x NVIDIA H200 NVL bereitstellen und betreiben
Voraussetzungen
- Sie verfügen über ein Public Cloud Projekt mit Zugriff auf die Region, in der die Instanzmodelle h200-1920 und h200-1920-eph verfügbar sind (EU-WEST-PAR).
- Sie haben einen SSH-Schlüssel erstellt, um eine Linux-GPU-Instanz bereitzustellen.
Zugriff auf das OVHcloud Kundencenter
- Direkter Link:
- Navigationspfad:
Public Cloud> Wählen Sie Ihr Projekt aus >Instanzen
In der praktischen Anwendung
Nachfolgend finden Sie die Informationen, die Sie benötigen, um eine Instanz mit 8x NVIDIA H200 NVL bereitzustellen, ihre Topologie zu verstehen und anschließend Ihre KI-Workloads darauf auszuführen und zu überwachen.
Instanz bereitstellen
Klicken Sie im Bereich Schnellzugriff auf Instanz erstellen. Wählen Sie anschließend die Region EU-WEST-PAR und in der Kategorie Cloud GPU das Instanzmodell h200-1920 oder h200-1920-eph aus.
Folgen Sie dann den weiteren Schritten, wie in der Anleitung Eine Public Cloud Instanz erstellen und darauf zugreifen beschrieben. Dieser Vorgang kann einige Minuten dauern.
Sobald die Instanz ausgeliefert ist, installieren Sie den NVIDIA-Treiber, wie in der Anleitung GPU Instanzen einrichten beschrieben.
Hardware-Übersicht
Ephemere Festplatte (h200-1920-eph)
Die ephemere Festplatte des Instanzmodells h200-1920-eph ist bereits mit einem Ext4-Dateisystem formatiert. Möglicherweise wurde sie von cloud-init bereits automatisch unter /mnt eingehängt.
Um zu überprüfen, ob die ephemere Festplatte eingehängt ist, führen Sie folgenden Befehl aus:
Wenn die 20-TB-Festplatte /mnt als Einhängepunkt anzeigt, ist sie einsatzbereit. Andernfalls hängen Sie sie manuell ein und ersetzen Sie dabei /dev/<device> durch den von lsblk -f angezeigten Gerätenamen:
Auf der ephemeren Festplatte gespeicherte Daten sind nicht in den Instanz-Backups enthalten und gehen verloren, wenn die Instanz gelöscht oder ausgesetzt wird. Wir empfehlen Ihnen, Ihre wichtigen Daten auf einer externen Speicherlösung zu sichern, zum Beispiel in Object Storage.
GPU-Topologie und NVLink-Architektur
Die 8 GPUs sind wie folgt organisiert:
Für die Verteilung von Workloads auf dieser Instanz empfehlen wir Folgendes:
- Führen Sie jeden Job nach Möglichkeit innerhalb einer einzigen NVLink-Gruppe (4 GPUs) aus.
- Wenn ein einzelnes Modell alle 8 GPUs benötigt, behandeln Sie die beiden Gruppen wie zwei getrennte Cluster: Halten Sie kommunikationsintensive Parallelisierung (wie Tensor Parallelism) innerhalb jeder Gruppe und nutzen Sie zwischen den beiden Gruppen nur weniger kommunikationsintensive Verfahren (wie Pipeline Parallelism). Ein Beispiel finden Sie in den empfohlenen Konfigurationen weiter unten.
- Beachten Sie, dass die Leistungsvorteile von NVLink nur innerhalb jeder Gruppe von 4 GPUs gelten.
Wenn Sie kommunikationsintensive Operationen innerhalb jeder NVLink-Gruppe halten, vermeiden Sie hohen Datenverkehr auf dem PCIe-Bus und verbessern so sowohl die Leistung als auch die Stabilität.
Bevor Sie einen Workload starten, empfehlen wir Ihnen zu überprüfen, welche GPUs zu welcher NVLink-Gruppe gehören:
In der Matrix zeigen über NVLink verbundene GPUs untereinander einen Wert NV# an (# steht für die Anzahl der NVLink-Verbindungen). Nur über PCIe verbundene GPUs zeigen stattdessen einen PCIe-Pfadtyp an (zum Beispiel PHB, NODE oder SYS). Die 4 GPUs, die untereinander NV#-Werte anzeigen, bilden eine NVLink-Gruppe.
Sie können auch den NVLink-Status einer bestimmten GPU anzeigen (hier GPU 0):
Empfohlene Konfigurationen
Die folgenden Beispiele verwenden vLLM, um zu veranschaulichen, wie Sie ein Modell unter Berücksichtigung der NVLink-Topologie auf 4 oder 8 GPUs bereitstellen.
Um ein Modell auf 4 GPUs bereitzustellen, geben Sie die IDs der Geräte explizit an, damit sie alle zur selben NVLink-Gruppe gehören:
Bewährte Vorgehensweisen für den Betrieb
Wir empfehlen Ihnen:
- die Zuordnung der GPUs zu den NVLink-Gruppen zu überprüfen, bevor Sie einen Workload starten (
nvidia-smi topo -m). - alle von einem Job verwendeten GPUs innerhalb derselben NVLink-Gruppe zu halten, es sei denn, Sie verwenden eine gruppenübergreifende Konfiguration wie die oben beschriebene mit Pipeline Parallelism.
- den NVLink-Status und die Kernel-Logs (
dmesg) während der Ausführung Ihrer Workloads zu überwachen. - Ihre wichtigen Daten regelmäßig zu sichern.
Empfohlenes Monitoring
Wir empfehlen Ihnen, während der Ausführung Ihrer Workloads die folgenden Metriken zu überwachen:
GPU- und NVLink-Fehler werden vom NVIDIA-Treiber in den Kernel-Logs als Xid-Meldungen ausgegeben. Für eine kontinuierliche Überwachung kann NVIDIA DCGM diese Metriken an Ihre Monitoring-Lösung exportieren. Die Befehle smartctl und nvme werden von den Paketen smartmontools und nvme-cli bereitgestellt (zum Beispiel sudo apt-get install smartmontools nvme-cli unter Debian oder Ubuntu).
Weiterführende Informationen
Treten Sie unserer User Community bei.