AI Training - Caractéristiques, capacités et limites
Découvrez les principales caractéristiques, capacités et limites de AI Training
AI Training est couvert par les Conditions particulières OVHcloud Public Cloud.
Objectif
Cette page présente les capacités techniques et les limites de l'offre Public Cloud AI Training.
Fonctionnalités
Fonctionnalités disponibles
AI Training vous permet d'entraîner vos modèles facilement, en quelques clics ou quelques commandes. Cette solution exécute votre job d'entraînement sur les ressources cloud de calcul que vous avez choisies (CPU/GPU).
Logs et outils de suivi
Interface en ligne de commande (CLI)
AI Training est compatible avec l'OVHcloud AI CLI. Découvrez comment installer l'OVHcloud AI CLI.
Logs
Pour consulter les logs de votre job, vous pouvez le faire via la CLI ovhai en utilisant la commande suivante :
Outils de suivi
Pour voir les informations de votre job, vous pouvez le faire avec la CLI ovhai en utilisant la commande ci-dessus :
Vous pouvez ensuite accéder à vos métriques via la Monitoring Url.
Vous pouvez également le consulter depuis l'espace client OVHcloud, dans les informations de votre job, en cliquant sur le bouton Go to Graph Dashboard.
Fonctionnalités prévues
Nous améliorons continuellement nos offres. Vous pouvez suivre, voter et proposer des idées à ajouter à notre roadmap sur https://github.com/ovh/public-cloud-roadmap/projects/4.
Capacités et limites
Régions prises en charge pour les jobs
AI Training peut être utilisé depuis n'importe quel pays du monde, dès lors que vous disposez d'un compte OVHcloud. Physiquement, deux datacenters sont disponibles :
BHS(Beauharnois, Canada, Amérique)GRA(Gravelines, France, Europe)
Ressources attachées
Ressources de calcul
Vous pouvez choisir soit le nombre de GPUs, soit le nombre de CPUs pour un job AI Training, mais pas les deux.
Par défaut, un job utilise un GPU.
La ressource mémoire n'est pas personnalisable.
Si vous choisissez GPU :
- Les ressources CPU, mémoire et stockage local ne sont pas personnalisables mais évoluent de façon linéaire avec chaque GPU supplémentaire.
Si vous choisissez CPU :
- La ressource mémoire et stockage local n'est pas personnalisable mais évolue de façon linéaire avec chaque CPU supplémentaire.
La quantité maximale de CPU/GPU, de mémoire par CPU/GPU et de stockage local est disponible sur le site OVHcloud, l'espace client et la CLI ovhai.
À titre indicatif, les limites actuelles sont :
- CPU : 12 par job.
- GPU : 4 par job pour V100S, A10, L4, L40s et H100 ; 2 pour A100 ; le H200 n'est disponible que par lots de 4 GPU NVLinked (le nombre de
--gpudoit être un multiple de 4 pour ce flavor).
Matériel disponible pour AI Training
La disponibilité du matériel dépend de la région du datacenter :
- GRA (Gravelines) : NVIDIA H200, NVIDIA H100, NVIDIA Ampere A100, NVIDIA Ampere A10, NVIDIA Tesla V100S, NVIDIA L4, NVIDIA L40s, Intel CPU vCores
- BHS (Beauharnois) : NVIDIA Tesla V100S, Intel CPU vCores
Exécutez ovhai capabilities flavor list après vous être connecté à la région que vous souhaitez utiliser (ovhai config set <region>) pour obtenir la liste exacte et à jour.
Les tarifs sont disponibles sur la page des tarifs Public Cloud.
Stockage disponible
Stockage local
Chaque job AI Training est fourni avec un espace de stockage local, qui est éphémère. Lorsque vous supprimez votre job, cet espace de stockage est également supprimé. Cet espace de stockage dépend des instances sélectionnées lors de la création de votre job AI Training. Reportez-vous à la section sur les ressources de calcul pour plus d'informations.
Le stockage local est limité et n'est pas la méthode recommandée pour gérer vos données, consultez la documentation OVHcloud sur les données pour plus d'informations.
Stockage attaché
Vous pouvez attacher des volumes de données depuis Public Cloud Object Storage. Pour de meilleures performances, nous recommandons de conserver le bucket Object Storage dans la même région que votre job AI Training. Monter un bucket situé dans une autre région fonctionne également, mais ajoute de la latence réseau inter-régions. Le stockage attaché vous permet de travailler sur plusieurs To de données, tout en restant persistant lorsque vous supprimez votre job AI Training.
Durée d'exécution maximale
Il n'y a aucune limitation de durée sur l'exécution d'un job AI Training.
Cependant, par défaut, votre job AI Training s'arrête automatiquement après 7 jours consécutifs au statut RUNNING. Vous pouvez également activer le redémarrage automatique pour qu'il redémarre tous les 7 jours, ou contacter notre support pour étendre cette période à 28 jours.
Environnements AI préinstallés
OVHcloud AI Training est fourni avec des environnements AI préinstallés.
Liste des environnements AI disponibles :
- AutoGluon + MXNet
- FastAI
- HuggingFace
- Miniconda (Python generic)
- MXNet
- One image to rule them all
- PyTorch
- Scikit-Learn
- TensorFlow
Personnalisation de l'environnement
Chaque environnement peut être personnalisé directement avec PIP ou CONDA (nous prenons en charge presque tous les paquets et bibliothèques).
Vous pouvez également utiliser vos propres images Docker.
Les images Docker peuvent être hébergées dans un registre public ou privé.
L'utilisation de docker-compose n'est pas possible.
Veuillez noter que les images doivent être construites avec une architecture AMD.
Découvrez comment construire et utiliser votre image Docker personnalisée dans ce tutoriel.
Réseau
-
Le réseau public peut être utilisé pour tous les AI Tools.
-
Le réseau privé (OVHcloud vRack) n'est pas pris en charge.
Ports disponibles vers le réseau public
Chaque job AI Training expose une URL publique dont le port par défaut est 8080. Ce port par défaut peut être configuré lors de la soumission d'un nouveau job. Cette URL est associée à un seul port, mais vous pouvez accéder à d'autres ports que celui par défaut en ajoutant le numéro de port à l'URL de votre job.
Par exemple, si vous souhaitez accéder au port 9000 de votre job, vous devrez ajouter -9000 à l'URL de votre job. L'URL de votre job pour accéder au port 9000 sera alors https://00000000-0000-0000-0000-000000000000-9000.job.gra.ai.cloud.ovh.net/
Quotas par projet Public Cloud
Chaque projet Public Cloud accorde par défaut à un client un maximum de 4 GPUs utilisés simultanément. Contactez notre support si vous avez besoin d'augmenter cette limitation.
Aller plus loin
Parcourez la documentation AI Training complète pour mieux comprendre les concepts principaux et démarrer.
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Nous voulons vos retours !
Nous serions ravis de répondre à vos questions et apprécions tout retour que vous pourriez nous faire.
Vous êtes sur Discord ? Rejoignez notre chaîne via https://discord.gg/ovhcloud et interagissez directement avec l’équipe qui développe nos services AI !