For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-solutions-resources.md.

AI Tools - Suivre vos ressources cloud

Voir en Markdown

Découvrez comment monitorer les ressources cloud utilisées par vos AI Tools

Objectif

AI Tools offre des capacités de monitoring complètes pour vos ressources cloud, garantissant des performances et une efficacité optimales.

Ce guide vous accompagnera dans l'accès et l'interprétation des différentes métriques fournies par le dashboard de monitoring, accessible pour les services AI Notebooks, AI Training et AI Deploy via une interface dédiée sur Grafana.

Prérequis

  • Un projet AI créé au sein d'un projet Public Cloud dans votre compte OVHcloud
  • Un utilisateur AI
  • Un accès à l' ou à la CLI AI OVHcloud installée sur votre ordinateur
  • Un OVHcloud AI Tool en cours d'exécution (AI Notebooks, AI Training ou AI Deploy)

Accès à l'espace client OVHcloud

  • Lien direct :
  • Pour accéder à vos services : Public Cloud > Sélectionnez votre projet > AI Notebooks

En pratique

Accès au monitoring Grafana

Le dashboard de monitoring des AI Tools est accessible via une URL dédiée, fournie dans les détails de l'AI Tool, accessible depuis le Control Panel (interface) ou avec la CLI ovhai. L'URL de monitoring est structurée comme suit : https://monitoring.<REGION>.ai.cloud.ovh.net/d/gpu?var-job=<JOB-ID>.

Pour récupérer l'URL de monitoring de votre AI Tool, vous pouvez utiliser soit la CLI, soit l'interface du Control Panel :

Depuis l'espace client (UI)
Depuis la CLI ovhai

Cliquez sur pour accéder à votre projet Public Cloud, puis rendez-vous dans la catégorie AI & Machine Learning du menu de gauche et choisissez la section AI Notebooks, AI Training ou AI Deploy selon l'AI Tool que vous utilisez.

Vous accédez alors à un tableau listant vos instances, où vous pouvez trouver celle dont vous avez besoin et ses informations générales. Pour afficher les détails de votre instance, cliquez soit sur le nom de l'instance, soit sur le bouton ..., puis sur Gérer.

Page AI Training avec les entrées de menu AI Notebooks AI Training et AI Deploy mises en évidence et le menu d'actions du job ai-training-demo ouvert sur Manage

Depuis cet écran, vous pouvez cliquer sur le bouton Grafana Dashboard, sous Usage monitoring, pour accéder à votre interface de monitoring Grafana.

Tableau de bord du job ai-training-demo avec le lien Grafana dashboard mis en évidence sous Usage monitoring dans le panneau Access

Détails de l'interface de monitoring pour les AI Tools

Le dashboard de monitoring des AI Tools fournit des informations détaillées sur l'utilisation des ressources de vos instances. Les panneaux disponibles varient selon le service (AI Notebooks, AI Training ou AI Deploy).

AI Notebooks et jobs AI Training

Pour AI Notebooks et AI Training, les fonctionnalités suivantes sont disponibles :

  • GPUs (int) : nombre de GPU alloués à votre AI Tool.
  • GPU Average Usage (%) : pourcentage moyen d'utilisation du GPU.
  • GPU Average Temperature (°C) : température moyenne des GPU.
  • GPU Average Power Usage (w) : consommation électrique moyenne des GPU.
  • CPU Usage (%) : pourcentage global d'utilisation du CPU.
  • Memory Usage (GB) : utilisation et limite de mémoire allouée à votre job.

Métriques GPU détaillées

  • GPU Usage : utilisation de chaque GPU alloué à votre notebook ou job.
  • GPU Memory Usage : utilisation et limite de mémoire pour chaque GPU.
  • SM Clocks : fréquences des Streaming Multiprocessors pour chaque GPU.
  • GPU Memory Clocks : fréquences mémoire pour chaque GPU.
  • Framebuffer Used : quantité de mémoire framebuffer utilisée.
  • GPU Power Usage : consommation électrique de chaque GPU.
  • GPU Temperature : température de chaque GPU.
  • CPU Usage : utilisation globale du CPU.
  • Memory Usage : utilisation et limite de mémoire allouée à votre notebook ou job.
  • Network Usage : trafic entrant et sortant sur votre notebook ou job.
  • Ephemeral Storage Usage : utilisation et limite du stockage éphémère alloué à votre notebook ou job.
  • Volumes Total Size : taille totale des volumes attachés à votre notebook ou job.
  • Volumes Total File Count : nombre total de fichiers dans les volumes attachés.
Tableau de bord Grafana des ressources avec les panneaux GPU Usage GPU Memory Usage CPU Usage Memory Usage Network Usage et Ephemeral storage usage montrant deux pics d'activité GPU

Applications AI Deploy

Pour AI Deploy, qui permet de déployer des applications, les catégories suivantes sont disponibles :

Resource Usage

  • GPU Average Usage : pourcentage moyen d'utilisation du GPU.
  • GPU Average Memory Usage : utilisation moyenne de la mémoire des GPU.
  • CPU Average Usage : pourcentage moyen d'utilisation du CPU.
  • Ephemeral Storage Usage : utilisation et limite du stockage éphémère alloué à votre app.
  • Network Usage : trafic entrant et sortant sur votre app.
  • Memory Total Usage : utilisation totale de la mémoire.
  • Volumes Total Size : taille totale des volumes attachés à votre app.
  • Volumes Total File Count : nombre total de fichiers dans les volumes attachés.

HTTP

  • HTTP Call Latency : temps de réponse des appels HTTP.
  • HTTP Call Count : nombre d'appels HTTP effectués.

Auto-scaling

  • Replicas : nombre de réplicas.
  • Usage Target : utilisation cible pour le scaling.
  • CPU Usage : utilisation globale du CPU.
  • Memory Usage : utilisation et limite de mémoire allouée à votre app.
  • GPU Usage : utilisation de chaque GPU alloué à votre app.
  • GPU Memory Usage : utilisation et limite de mémoire pour chaque GPU.
  • GPU SM Clocks : fréquences des Streaming Multiprocessors.
  • GPU Memory Clocks : fréquences mémoire.
  • GPU Power Usage : consommation électrique de chaque GPU.
  • Framebuffer Used : quantité de mémoire framebuffer.
  • GPU Temperature : température de chaque GPU.

Avertissements

Warning
  • Les panneaux GPU (usage, mémoire) ne sont disponibles que pour les AI Tools qui consomment des GPU.
Warning
  • Les AI Tools peuvent utiliser du stockage éphémère pour des données ne se trouvant pas dans un conteneur synchronisé. Si votre utilisation dépasse la limite du stockage éphémère, votre job sera rejeté.

Votre avis nous intéresse !

N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :

Pour une formation ou une assistance technique sur la mise en œuvre de nos solutions, contactez votre commercial ou consultez la page Professional Services pour obtenir un devis et faire analyser votre projet par nos experts.

Cette page vous a-t-elle aidé ?