AI Tools - Suivre vos ressources cloud
Découvrez comment monitorer les ressources cloud utilisées par vos AI Tools
Objectif
AI Tools offre des capacités de monitoring complètes pour vos ressources cloud, garantissant des performances et une efficacité optimales.
Ce guide vous accompagnera dans l'accès et l'interprétation des différentes métriques fournies par le dashboard de monitoring, accessible pour les services AI Notebooks, AI Training et AI Deploy via une interface dédiée sur Grafana.
Prérequis
- Un projet AI créé au sein d'un projet Public Cloud dans votre compte OVHcloud
- Un utilisateur AI
- Un accès à l' ou à la CLI AI OVHcloud installée sur votre ordinateur
- Un OVHcloud AI Tool en cours d'exécution (AI Notebooks, AI Training ou AI Deploy)
Accès à l'espace client OVHcloud
- Lien direct :
- Pour accéder à vos services :
Public Cloud> Sélectionnez votre projet >AI Notebooks
En pratique
Accès au monitoring Grafana
Le dashboard de monitoring des AI Tools est accessible via une URL dédiée, fournie dans les détails de l'AI Tool, accessible depuis le Control Panel (interface) ou avec la CLI ovhai. L'URL de monitoring est structurée comme suit : https://monitoring.<REGION>.ai.cloud.ovh.net/d/gpu?var-job=<JOB-ID>.
Pour récupérer l'URL de monitoring de votre AI Tool, vous pouvez utiliser soit la CLI, soit l'interface du Control Panel :
Cliquez sur pour accéder à votre projet Public Cloud, puis rendez-vous dans la catégorie AI & Machine Learning du menu de gauche et choisissez la section AI Notebooks, AI Training ou AI Deploy selon l'AI Tool que vous utilisez.
Vous accédez alors à un tableau listant vos instances, où vous pouvez trouver celle dont vous avez besoin et ses informations générales. Pour afficher les détails de votre instance, cliquez soit sur le nom de l'instance, soit sur le bouton ..., puis sur Gérer.

Depuis cet écran, vous pouvez cliquer sur le bouton Grafana Dashboard, sous Usage monitoring, pour accéder à votre interface de monitoring Grafana.

Détails de l'interface de monitoring pour les AI Tools
Le dashboard de monitoring des AI Tools fournit des informations détaillées sur l'utilisation des ressources de vos instances. Les panneaux disponibles varient selon le service (AI Notebooks, AI Training ou AI Deploy).
AI Notebooks et jobs AI Training
Pour AI Notebooks et AI Training, les fonctionnalités suivantes sont disponibles :
- GPUs (int) : nombre de GPU alloués à votre AI Tool.
- GPU Average Usage (%) : pourcentage moyen d'utilisation du GPU.
- GPU Average Temperature (°C) : température moyenne des GPU.
- GPU Average Power Usage (w) : consommation électrique moyenne des GPU.
- CPU Usage (%) : pourcentage global d'utilisation du CPU.
- Memory Usage (GB) : utilisation et limite de mémoire allouée à votre job.
Métriques GPU détaillées
- GPU Usage : utilisation de chaque GPU alloué à votre notebook ou job.
- GPU Memory Usage : utilisation et limite de mémoire pour chaque GPU.
- SM Clocks : fréquences des Streaming Multiprocessors pour chaque GPU.
- GPU Memory Clocks : fréquences mémoire pour chaque GPU.
- Framebuffer Used : quantité de mémoire framebuffer utilisée.
- GPU Power Usage : consommation électrique de chaque GPU.
- GPU Temperature : température de chaque GPU.
- CPU Usage : utilisation globale du CPU.
- Memory Usage : utilisation et limite de mémoire allouée à votre notebook ou job.
- Network Usage : trafic entrant et sortant sur votre notebook ou job.
- Ephemeral Storage Usage : utilisation et limite du stockage éphémère alloué à votre notebook ou job.
- Volumes Total Size : taille totale des volumes attachés à votre notebook ou job.
- Volumes Total File Count : nombre total de fichiers dans les volumes attachés.
Applications AI Deploy
Pour AI Deploy, qui permet de déployer des applications, les catégories suivantes sont disponibles :
Resource Usage
- GPU Average Usage : pourcentage moyen d'utilisation du GPU.
- GPU Average Memory Usage : utilisation moyenne de la mémoire des GPU.
- CPU Average Usage : pourcentage moyen d'utilisation du CPU.
- Ephemeral Storage Usage : utilisation et limite du stockage éphémère alloué à votre app.
- Network Usage : trafic entrant et sortant sur votre app.
- Memory Total Usage : utilisation totale de la mémoire.
- Volumes Total Size : taille totale des volumes attachés à votre app.
- Volumes Total File Count : nombre total de fichiers dans les volumes attachés.
HTTP
- HTTP Call Latency : temps de réponse des appels HTTP.
- HTTP Call Count : nombre d'appels HTTP effectués.
Auto-scaling
- Replicas : nombre de réplicas.
- Usage Target : utilisation cible pour le scaling.
- CPU Usage : utilisation globale du CPU.
- Memory Usage : utilisation et limite de mémoire allouée à votre app.
- GPU Usage : utilisation de chaque GPU alloué à votre app.
- GPU Memory Usage : utilisation et limite de mémoire pour chaque GPU.
- GPU SM Clocks : fréquences des Streaming Multiprocessors.
- GPU Memory Clocks : fréquences mémoire.
- GPU Power Usage : consommation électrique de chaque GPU.
- Framebuffer Used : quantité de mémoire framebuffer.
- GPU Temperature : température de chaque GPU.
Avertissements
- Les panneaux GPU (usage, mémoire) ne sont disponibles que pour les AI Tools qui consomment des GPU.
- Les AI Tools peuvent utiliser du stockage éphémère pour des données ne se trouvant pas dans un conteneur synchronisé. Si votre utilisation dépasse la limite du stockage éphémère, votre job sera rejeté.
Votre avis nous intéresse !
N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :
- Sur le serveur Discord OVHcloud
Pour une formation ou une assistance technique sur la mise en œuvre de nos solutions, contactez votre commercial ou consultez la page Professional Services pour obtenir un devis et faire analyser votre projet par nos experts.