AI Training - Premiers pas
Découvrez comment lancer un job AI Training depuis l'espace client (UI)
Objectif
Ce guide couvre l'initialisation d'AI Training et la soumission de jobs via l'espace client OVHcloud.
Prérequis
- un projet Public Cloud
- optionnellement des conteneurs d'objets pour attacher des données au job à l'étape 6, voir notre guide créer un conteneur de données.
Accès à l'espace client OVHcloud
- Lien direct :
- Chemin de navigation :
Public Cloud> Sélectionnez votre projet
En pratique
Étape 1 - Accéder au menu AI Training
Cliquez sur pour accéder à votre projet Public Cloud, puis rendez-vous dans la section AI Training, située sous AI & Machine Learning.
Étape 2 - Démarrer la soumission d'un job
Une fois que vous avez lu les informations générales et validé les conditions contractuelles de ce service, vous pouvez commencer à soumettre vos jobs. En activant le service AI Training, vous accordez à OVHcloud l'accès à vos conteneurs Object Storage. Cet accès est uniquement utilisé pour synchroniser vos données au sein d'AI Training avec vos conteneurs.
Depuis la liste des jobs du dashboard, vous pouvez démarrer la soumission du job en cliquant sur le bouton Lancer un job.
Étape 3 - Sélectionner une région pour votre job
Donnez un nom à votre job. Cela facilitera sa gestion lorsque vous aurez plusieurs jobs en cours d'exécution.
Chaque job est exécuté dans une région OVHcloud. Chaque région dispose de son propre cluster AI Training, avec des capacités potentiellement différentes. Pour plus d'informations, consultez les capacités.
Sélectionnez la région souhaitée et cliquez sur Suivant.
Étape 4 - Spécifier la quantité de ressources
À cette étape, vous pouvez sélectionner la quantité de GPUs ou de CPUs dont vous avez besoin pour votre charge de travail d'entraînement.
La quantité maximale de GPUs ou de CPUs que vous pouvez sélectionner pour votre job dépend de la région. Si vous choisissez un GPU, un ratio fixe de CPU est appliqué en fonction du nombre de GPUs. De la même façon, il existe un ratio fixe de mémoire en fonction du nombre de CPUs. Pour plus d'informations, consultez les capacités.
Une fois la quantité de ressources définie, vous pouvez voir un aperçu du tarif de facturation. Cliquez sur Suivant.
Étape 5 - Fournir une image Docker
Un job est essentiellement un container Docker exécuté au sein de l'infrastructure OVHcloud. Vous devez fournir une image Docker à exécuter. Plusieurs options s'offrent à vous :
Images préconfigurées
OVHcloud fournit un ensemble d'images parmi lesquelles vous pouvez choisir pour faciliter la soumission de vos premiers jobs. Les images fournies sont essentiellement un environnement JupyterLab embarquant certaines technologies de Deep Learning telles que Tensorflow ou MXNet. Ces images doivent être supprimées à terme, le produit étant davantage orienté vers l'utilisation d'images personnalisées.
Images personnalisées
Les images préconfigurées ne peuvent pas couvrir tous vos besoins, vous pouvez donc spécifier votre propre image si nécessaire. Vous pouvez utiliser n'importe quelle image accessible depuis AI Training.
Cela inclut les images publiques (par exemple Dockerhub), les images du registre partagé ou les images de votre registre privé ajouté. Pour plus d'informations, découvrez comment ajouter un registre privé.
Étape 6 - Paramètres de confidentialité
Ensuite, sélectionnez vos paramètres de confidentialité.
L'accès public exposera vos données et votre code à quiconque obtient le lien du job AI Training. Soyez prudent et ne l'utilisez pas avec des données sensibles. À l'inverse, l'accès restreint demandera une combinaison utilisateur/mot de passe ou un token AI pour accéder au contenu du job, garantissant ainsi un environnement sécurisé.
Étape 7 - Cycle de vie du job
Notre principale motivation est de maintenir la plateforme à jour, tant en matière de correctifs de sécurité que d'alignement sur les nouvelles fonctionnalités. Nous devons donc mettre à jour et redémarrer les hôtes de temps à autre, ce qui nécessite de les libérer de toute charge de travail client. Cela nous permet également de traiter les incidents localisés sur un hôte, par exemple lorsqu'un seul GPU tombe en panne à cause d'un défaut matériel (un seul client est impacté, mais nous devons tout de même arrêter l'hôte pour le placer en maintenance PCI, donc toute charge de travail restante doit être évacuée ou replanifiée ailleurs).
Par défaut, votre job s'arrêtera automatiquement après 7 jours consécutifs au statut RUNNING. Soyez assuré que tous vos paramètres et données seront préservés. Vous avez la possibilité d'activer le redémarrage automatique, qui relancera automatiquement votre job tous les 7 jours, garantissant une interruption minimale de votre workflow. Vous pouvez également contacter notre support pour étendre cette période de redémarrage automatique de 7 à 28 jours.
Étape 8 - Configuration avancée
Cette étape est optionnelle.
Tout d'abord, l'image Docker que vous avez fournie à l'étape 6 inclut un entrypoint pour votre container. Vous pouvez remplacer cet entrypoint en spécifiant votre propre commande.
Ensuite, par défaut, votre job AI Training est fourni avec un stockage éphémère (stockage local). Mais à cette étape, vous pouvez également lier des conteneurs Object Storage et des dépôts Git à votre job, en entrée pour votre charge de travail d'entraînement ou en sortie pour vos résultats (par exemple les poids du modèle).
Si vous souhaitez en savoir plus sur la configuration des conteneurs et des dépôts Git dans le job, vous pouvez vous référer à cet exemple d'entraînement de modèle. Pour l'instant, nous allons lancer un job classique sans y ajouter de volume externe.
Enfin, les clés publiques SSH vous permettent d'accéder à votre job à distance.
Étape 9 - Soumettre votre job
À la dernière étape, vous obtenez un aperçu du job que vous avez configuré avant sa soumission. Vous obtenez également la commande équivalente à utiliser avec la CLI ovhai.
Cliquez sur Commander pour confirmer et lancer la création de votre job sur le cluster.
Une fois votre job créé, il apparaîtra dans votre onglet AI Training :
Étape 10 - Consulter votre job
Depuis cette liste, vous pouvez accéder aux détails de votre job en cliquant sur son nom ou en cliquant sur ... puis en sélectionnant Manage. Les détails incluent plusieurs éléments, comme les ressources du job, les statuts, la facturation, les logs et l'URL d'accès. Cette URL est de la forme https://<JOB-ID>.job.<REGION>.ai.cloud.ovh.net/. De plus, vous pouvez accéder à n'importe quel port disponible en l'ajoutant à l'URL du job de cette façon : https://<JOB-ID>-<PORT>.job.<REGION>.ai.cloud.ovh.net/. Vous pouvez consulter la liste des ports disponibles dans les capacités.
Vous pouvez également consulter les logs de votre job en cliquant sur le bouton Logs.
Étape 11 - Arrêter votre job
Si vous avez terminé d'utiliser votre job, si votre modèle a convergé prématurément ou si vous souhaitez simplement l'interrompre, vous pouvez le faire depuis la liste des jobs et la page du job.
Depuis la liste des jobs, vous pouvez consulter les actions disponibles tout à droite de chaque entrée et interrompre le job en cliquant sur Arrêter. Vous pouvez également interrompre le job depuis ses détails, dans la liste des actions, en cliquant sur le bouton d'arrêt 🔴.
Ensuite, si vous n'avez plus besoin de votre job, vous pouvez le supprimer. Pour cela, cliquez simplement sur le bouton ..., puis sélectionnez l'action Supprimer.
Étape 12 - Cloner votre job
Vous pouvez également cliquer sur le bouton de redémarrage 🔄 pour cloner le job avec la même configuration. Cela lancera un nouveau job identique à l'original (par exemple, example-job), vous permettant de relancer votre workflow sans avoir à reconfigurer le job.
Aller plus loin
Le service AI Training est principalement destiné à être utilisé via la CLI ovhai. L'espace client OVHcloud n'offre qu'un sous-ensemble des fonctionnalités et est conçu pour vous aider à démarrer avant d'utiliser la CLI. Découvrez comment installer l'OVHcloud AI CLI.
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Nous voulons vos retours !
N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :
- Sur le serveur Discord OVHcloud