For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-training-capabilities.md.

AI Training - Caractéristiques, capacités et limites

Voir en Markdown

Découvrez les principales caractéristiques, capacités et limites de AI Training

Info

AI Training est couvert par les Conditions particulières OVHcloud Public Cloud.

Objectif

Cette page présente les capacités techniques et les limites de l'offre Public Cloud AI Training.

Fonctionnalités

Fonctionnalités disponibles

AI Training vous permet d'entraîner vos modèles facilement, en quelques clics ou quelques commandes. Cette solution exécute votre job d'entraînement sur les ressources cloud de calcul que vous avez choisies (CPU/GPU).

FonctionnalitéDétails
Environnements AI
Environnements Machine Learning préinstallésAI Training est fourni avec un environnement Python générique (Conda) ou des environnements préinstallés, tels que Pytorch, Tensorflow, FastAI, HuggingFace et bien d'autres.
Personnalisation facileAI Training permet l'installation de presque tous les paquets Conda ou Pip. Vous pouvez facilement personnaliser votre environnement selon vos besoins. Il vous permet également d'utiliser votre propre environnement en spécifiant votre image Docker.
Gestion
Plusieurs façons de gérer vos jobs d'entraînementVous pouvez gérer vos jobs AI Training via l'espace client OVHcloud, l'API ou la CLI. Selon vos besoins, vous pouvez également automatiser facilement leur création et leur suppression.
Démarrage et arrêt facilesVous pouvez démarrer et arrêter un job d'entraînement en un clic.
Consulter les logs de votre jobVous pouvez également consulter les logs de votre job d'entraînement via l'espace client OVHcloud, l'API ou la CLI.
Ressources de calcul
Ressources de calcul garantiesSélectionnez la quantité de CPUs ou de GPUs nécessaire lors de la création du job AI Training. Une fois lancé, vous conservez ces ressources tant que votre job est en cours d'exécution.
Exécution en arrière-planVos tâches peuvent être exécutées en arrière-plan, ce qui signifie que la fermeture de votre navigateur Web n'aura aucun effet sur votre travail.
Aucune durée d'exécution maximaleVos tâches peuvent durer aussi longtemps que votre job est en cours d'exécution.
Outils de suiviChaque service AI Training est fourni avec un dashboard Grafana natif, vous permettant de suivre et de surveiller vos ressources CPU, GPU, RAM et stockage.
Stockage
Stockage rapide et flexibleChaque service AI Training est fourni avec un stockage local, mais aussi la possibilité d'attacher un stockage distant depuis Object Storage. De quelques GiB à plusieurs TiB, nous rapprochons vos données de notre puissance de calcul sur un stockage SSD rapide pour de meilleures performances.
Importation de dépôts GitLors de la création de votre job AI Training, vous pouvez spécifier un ou plusieurs dépôts Git à télécharger dans l'environnement de votre job.
Sécurité
Authentification ouverte ou restreinteLors de la création de votre job AI Training, sélectionnez un accès ouvert ou restreint à votre job. Si restreint, l'accès peut être accordé via un token ou des identifiants pour accéder à votre environnement de manière sécurisée.
Valeurs européennesNous respectons votre vie privée et n'utiliserons jamais vos données personnelles à des fins internes.
Disponibilité et facturation
Facturation simpleVous ne payez que ce que vous consommez, facturé à la minute.
Disponible dans de nombreux paysAI Training nécessite un compte OVHcloud. Nous acceptons actuellement des dizaines de pays. Une fois créé, vous aurez accès à l'ensemble des fonctionnalités.

Logs et outils de suivi

Interface en ligne de commande (CLI)

AI Training est compatible avec l'OVHcloud AI CLI. Découvrez comment installer l'OVHcloud AI CLI.

Logs

Pour consulter les logs de votre job, vous pouvez le faire via la CLI ovhai en utilisant la commande suivante :

ovhai job logs <job-id>
Outils de suivi

Pour voir les informations de votre job, vous pouvez le faire avec la CLI ovhai en utilisant la commande ci-dessus :

ovhai job get `<job-id>`

Vous pouvez ensuite accéder à vos métriques via la Monitoring Url.

Vous pouvez également le consulter depuis l'espace client OVHcloud, dans les informations de votre job, en cliquant sur le bouton Go to Graph Dashboard.

Fonctionnalités prévues

Nous améliorons continuellement nos offres. Vous pouvez suivre, voter et proposer des idées à ajouter à notre roadmap sur https://github.com/ovh/public-cloud-roadmap/projects/4.

Capacités et limites

Régions prises en charge pour les jobs

AI Training peut être utilisé depuis n'importe quel pays du monde, dès lors que vous disposez d'un compte OVHcloud. Physiquement, deux datacenters sont disponibles :

  • BHS (Beauharnois, Canada, Amérique)
  • GRA (Gravelines, France, Europe)

Ressources attachées

Ressources de calcul

Vous pouvez choisir soit le nombre de GPUs, soit le nombre de CPUs pour un job AI Training, mais pas les deux. Par défaut, un job utilise un GPU. La ressource mémoire n'est pas personnalisable.

Si vous choisissez GPU :

  • Les ressources CPU, mémoire et stockage local ne sont pas personnalisables mais évoluent de façon linéaire avec chaque GPU supplémentaire.

Si vous choisissez CPU :

  • La ressource mémoire et stockage local n'est pas personnalisable mais évolue de façon linéaire avec chaque CPU supplémentaire.

La quantité maximale de CPU/GPU, de mémoire par CPU/GPU et de stockage local est disponible sur le site OVHcloud, l'espace client et la CLI ovhai.

ovhai capabilities flavor list

À titre indicatif, les limites actuelles sont :

  • CPU : 12 par job.
  • GPU : 4 par job pour V100S, A10, L4, L40s et H100 ; 2 pour A100 ; le H200 n'est disponible que par lots de 4 GPU NVLinked (le nombre de --gpu doit être un multiple de 4 pour ce flavor).
Matériel disponible pour AI Training

La disponibilité du matériel dépend de la région du datacenter :

  • GRA (Gravelines) : NVIDIA H200, NVIDIA H100, NVIDIA Ampere A100, NVIDIA Ampere A10, NVIDIA Tesla V100S, NVIDIA L4, NVIDIA L40s, Intel CPU vCores
  • BHS (Beauharnois) : NVIDIA Tesla V100S, Intel CPU vCores

Exécutez ovhai capabilities flavor list après vous être connecté à la région que vous souhaitez utiliser (ovhai config set <region>) pour obtenir la liste exacte et à jour.

Les tarifs sont disponibles sur la page des tarifs Public Cloud.

Stockage disponible

Stockage local

Chaque job AI Training est fourni avec un espace de stockage local, qui est éphémère. Lorsque vous supprimez votre job, cet espace de stockage est également supprimé. Cet espace de stockage dépend des instances sélectionnées lors de la création de votre job AI Training. Reportez-vous à la section sur les ressources de calcul pour plus d'informations.

Info

Le stockage local est limité et n'est pas la méthode recommandée pour gérer vos données, consultez la documentation OVHcloud sur les données pour plus d'informations.

Stockage attaché

Vous pouvez attacher des volumes de données depuis Public Cloud Object Storage. Pour de meilleures performances, nous recommandons de conserver le bucket Object Storage dans la même région que votre job AI Training. Monter un bucket situé dans une autre région fonctionne également, mais ajoute de la latence réseau inter-régions. Le stockage attaché vous permet de travailler sur plusieurs To de données, tout en restant persistant lorsque vous supprimez votre job AI Training.

Durée d'exécution maximale

Warning

Il n'y a aucune limitation de durée sur l'exécution d'un job AI Training.

Cependant, par défaut, votre job AI Training s'arrête automatiquement après 7 jours consécutifs au statut RUNNING. Vous pouvez également activer le redémarrage automatique pour qu'il redémarre tous les 7 jours, ou contacter notre support pour étendre cette période à 28 jours.

Environnements AI préinstallés

OVHcloud AI Training est fourni avec des environnements AI préinstallés.

Liste des environnements AI disponibles :

  • AutoGluon + MXNet
  • FastAI
  • HuggingFace
  • Miniconda (Python generic)
  • MXNet
  • One image to rule them all
  • PyTorch
  • Scikit-Learn
  • TensorFlow

Personnalisation de l'environnement

Chaque environnement peut être personnalisé directement avec PIP ou CONDA (nous prenons en charge presque tous les paquets et bibliothèques).

Vous pouvez également utiliser vos propres images Docker.

Les images Docker peuvent être hébergées dans un registre public ou privé.

L'utilisation de docker-compose n'est pas possible.

Veuillez noter que les images doivent être construites avec une architecture AMD.

Découvrez comment construire et utiliser votre image Docker personnalisée dans ce tutoriel.

Réseau

  • Le réseau public peut être utilisé pour tous les AI Tools.

  • Le réseau privé (OVHcloud vRack) n'est pas pris en charge.

Ports disponibles vers le réseau public

Chaque job AI Training expose une URL publique dont le port par défaut est 8080. Ce port par défaut peut être configuré lors de la soumission d'un nouveau job. Cette URL est associée à un seul port, mais vous pouvez accéder à d'autres ports que celui par défaut en ajoutant le numéro de port à l'URL de votre job.

Par exemple, si vous souhaitez accéder au port 9000 de votre job, vous devrez ajouter -9000 à l'URL de votre job. L'URL de votre job pour accéder au port 9000 sera alors https://00000000-0000-0000-0000-000000000000-9000.job.gra.ai.cloud.ovh.net/

Quotas par projet Public Cloud

Chaque projet Public Cloud accorde par défaut à un client un maximum de 4 GPUs utilisés simultanément. Contactez notre support si vous avez besoin d'augmenter cette limitation.

Aller plus loin

Parcourez la documentation AI Training complète pour mieux comprendre les concepts principaux et démarrer.

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Nous voulons vos retours !

Nous serions ravis de répondre à vos questions et apprécions tout retour que vous pourriez nous faire.

Vous êtes sur Discord ? Rejoignez notre chaîne via https://discord.gg/ovhcloud et interagissez directement avec l’équipe qui développe nos services AI !

Cette page vous a-t-elle aidé ?