For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-training-submit-job.md.

AI Training - Premiers pas

Voir en Markdown

Découvrez comment lancer un job AI Training depuis l'espace client (UI)

Objectif

Ce guide couvre l'initialisation d'AI Training et la soumission de jobs via l'espace client OVHcloud.

Prérequis

  • un projet Public Cloud
  • optionnellement des conteneurs d'objets pour attacher des données au job à l'étape 6, voir notre guide créer un conteneur de données.

Accès à l'espace client OVHcloud

  • Lien direct :
  • Chemin de navigation : Public Cloud > Sélectionnez votre projet

En pratique

Étape 1 - Accéder au menu AI Training

Cliquez sur pour accéder à votre projet Public Cloud, puis rendez-vous dans la section AI Training, située sous AI & Machine Learning.

Section AI and Machine Learning du menu de l'espace client OVHcloud avec AI Training sélectionné

Étape 2 - Démarrer la soumission d'un job

Une fois que vous avez lu les informations générales et validé les conditions contractuelles de ce service, vous pouvez commencer à soumettre vos jobs. En activant le service AI Training, vous accordez à OVHcloud l'accès à vos conteneurs Object Storage. Cet accès est uniquement utilisé pour synchroniser vos données au sein d'AI Training avec vos conteneurs.

Depuis la liste des jobs du dashboard, vous pouvez démarrer la soumission du job en cliquant sur le bouton Lancer un job.

page d'accueil AI Training

Étape 3 - Sélectionner une région pour votre job

Donnez un nom à votre job. Cela facilitera sa gestion lorsque vous aurez plusieurs jobs en cours d'exécution.

Chaque job est exécuté dans une région OVHcloud. Chaque région dispose de son propre cluster AI Training, avec des capacités potentiellement différentes. Pour plus d'informations, consultez les capacités.

Sélectionnez la région souhaitée et cliquez sur Suivant.

Formulaire Launch a job avec le champ Job name renseigné avec example-job Étape Location avec la région Gravelines GRA sélectionnée

Étape 4 - Spécifier la quantité de ressources

À cette étape, vous pouvez sélectionner la quantité de GPUs ou de CPUs dont vous avez besoin pour votre charge de travail d'entraînement.

La quantité maximale de GPUs ou de CPUs que vous pouvez sélectionner pour votre job dépend de la région. Si vous choisissez un GPU, un ratio fixe de CPU est appliqué en fonction du nombre de GPUs. De la même façon, il existe un ratio fixe de mémoire en fonction du nombre de CPUs. Pour plus d'informations, consultez les capacités.

Une fois la quantité de ressources définie, vous pouvez voir un aperçu du tarif de facturation. Cliquez sur Suivant.

Tableau Resources listant les flavors CPU et GPU disponibles avec leur tarif horaire

Étape 5 - Fournir une image Docker

Un job est essentiellement un container Docker exécuté au sein de l'infrastructure OVHcloud. Vous devez fournir une image Docker à exécuter. Plusieurs options s'offrent à vous :

Images préconfigurées

OVHcloud fournit un ensemble d'images parmi lesquelles vous pouvez choisir pour faciliter la soumission de vos premiers jobs. Les images fournies sont essentiellement un environnement JupyterLab embarquant certaines technologies de Deep Learning telles que Tensorflow ou MXNet. Ces images doivent être supprimées à terme, le produit étant davantage orienté vers l'utilisation d'images personnalisées.

Images personnalisées

Les images préconfigurées ne peuvent pas couvrir tous vos besoins, vous pouvez donc spécifier votre propre image si nécessaire. Vous pouvez utiliser n'importe quelle image accessible depuis AI Training.

Cela inclut les images publiques (par exemple Dockerhub), les images du registre partagé ou les images de votre registre privé ajouté. Pour plus d'informations, découvrez comment ajouter un registre privé.

Étape Docker Image sur l'onglet Custom image avec le champ du chemin de l'image

Étape 6 - Paramètres de confidentialité

Ensuite, sélectionnez vos paramètres de confidentialité.

Warning

L'accès public exposera vos données et votre code à quiconque obtient le lien du job AI Training. Soyez prudent et ne l'utilisez pas avec des données sensibles. À l'inverse, l'accès restreint demandera une combinaison utilisateur/mot de passe ou un token AI pour accéder au contenu du job, garantissant ainsi un environnement sécurisé.

Étape Privacy avec Public access sélectionné

Étape 7 - Cycle de vie du job

Warning

Notre principale motivation est de maintenir la plateforme à jour, tant en matière de correctifs de sécurité que d'alignement sur les nouvelles fonctionnalités. Nous devons donc mettre à jour et redémarrer les hôtes de temps à autre, ce qui nécessite de les libérer de toute charge de travail client. Cela nous permet également de traiter les incidents localisés sur un hôte, par exemple lorsqu'un seul GPU tombe en panne à cause d'un défaut matériel (un seul client est impacté, mais nous devons tout de même arrêter l'hôte pour le placer en maintenance PCI, donc toute charge de travail restante doit être évacuée ou replanifiée ailleurs).

Par défaut, votre job s'arrêtera automatiquement après 7 jours consécutifs au statut RUNNING. Soyez assuré que tous vos paramètres et données seront préservés. Vous avez la possibilité d'activer le redémarrage automatique, qui relancera automatiquement votre job tous les 7 jours, garantissant une interruption minimale de votre workflow. Vous pouvez également contacter notre support pour étendre cette période de redémarrage automatique de 7 à 28 jours.

Étape Expiry affichant l'interrupteur Automatic restart et son infobulle

Étape 8 - Configuration avancée

Cette étape est optionnelle.

Tout d'abord, l'image Docker que vous avez fournie à l'étape 6 inclut un entrypoint pour votre container. Vous pouvez remplacer cet entrypoint en spécifiant votre propre commande.

Ensuite, par défaut, votre job AI Training est fourni avec un stockage éphémère (stockage local). Mais à cette étape, vous pouvez également lier des conteneurs Object Storage et des dépôts Git à votre job, en entrée pour votre charge de travail d'entraînement ou en sortie pour vos résultats (par exemple les poids du modèle).

Si vous souhaitez en savoir plus sur la configuration des conteneurs et des dépôts Git dans le job, vous pouvez vous référer à cet exemple d'entraînement de modèle. Pour l'instant, nous allons lancer un job classique sans y ajouter de volume externe.

Enfin, les clés publiques SSH vous permettent d'accéder à votre job à distance.

Section Advanced configuration dépliée affichant les commandes Docker les volumes et les clés SSH

Étape 9 - Soumettre votre job

À la dernière étape, vous obtenez un aperçu du job que vous avez configuré avant sa soumission. Vous obtenez également la commande équivalente à utiliser avec la CLI ovhai.

résumé de la soumission

Cliquez sur Commander pour confirmer et lancer la création de votre job sur le cluster.

Une fois votre job créé, il apparaîtra dans votre onglet AI Training :

Liste des jobs AI Training affichant example-job en cours

Étape 10 - Consulter votre job

Depuis cette liste, vous pouvez accéder aux détails de votre job en cliquant sur son nom ou en cliquant sur ... puis en sélectionnant Manage. Les détails incluent plusieurs éléments, comme les ressources du job, les statuts, la facturation, les logs et l'URL d'accès. Cette URL est de la forme https://<JOB-ID>.job.<REGION>.ai.cloud.ovh.net/. De plus, vous pouvez accéder à n'importe quel port disponible en l'ajoutant à l'URL du job de cette façon : https://<JOB-ID>-<PORT>.job.<REGION>.ai.cloud.ovh.net/. Vous pouvez consulter la liste des ports disponibles dans les capacités.

Tableau de bord du job affichant l'accès la chronologie du cycle de vie les ressources et la commande ovhai

Vous pouvez également consulter les logs de votre job en cliquant sur le bouton Logs.

Étape 11 - Arrêter votre job

Si vous avez terminé d'utiliser votre job, si votre modèle a convergé prématurément ou si vous souhaitez simplement l'interrompre, vous pouvez le faire depuis la liste des jobs et la page du job.

Depuis la liste des jobs, vous pouvez consulter les actions disponibles tout à droite de chaque entrée et interrompre le job en cliquant sur Arrêter. Vous pouvez également interrompre le job depuis ses détails, dans la liste des actions, en cliquant sur le bouton d'arrêt 🔴.

En-tête du job avec le bouton d'arrêt mis en évidence

Ensuite, si vous n'avez plus besoin de votre job, vous pouvez le supprimer. Pour cela, cliquez simplement sur le bouton ..., puis sélectionnez l'action Supprimer.

Liste des jobs avec le menu d'actions ouvert et Delete mis en évidence

Étape 12 - Cloner votre job

Vous pouvez également cliquer sur le bouton de redémarrage 🔄 pour cloner le job avec la même configuration. Cela lancera un nouveau job identique à l'original (par exemple, example-job), vous permettant de relancer votre workflow sans avoir à reconfigurer le job.

En-tête du job avec le bouton de clonage mis en évidence

Aller plus loin

Le service AI Training est principalement destiné à être utilisé via la CLI ovhai. L'espace client OVHcloud n'offre qu'un sous-ensemble des fonctionnalités et est conçu pour vous aider à démarrer avant d'utiliser la CLI. Découvrez comment installer l'OVHcloud AI CLI.

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Nous voulons vos retours !

N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :

Cette page vous a-t-elle aidé ?