AI Training - Dépannage
Principales erreurs et comment dépanner vos jobs AI Training
Objectif
Ce tutoriel vous donne quelques pistes pour dépanner vos jobs en cas de problème.
Prérequis
- Un job AI Training que vous souhaitez démarrer
- La CLI AI OVHcloud installée
En pratique
Qu'est-ce qu'un job AI Training et comment en exécuter un ?
Toutes les étapes pour démarrer et travailler avec AI Training sont décrites dans le guide AI Training - Bien démarrer.
Comment récupérer mes fichiers une fois l'entraînement terminé ?
Lorsque vous utilisez AI Training, assurez-vous de monter des conteneurs Object Storage sur votre job. Vous devrez sauvegarder vos fichiers sur ces volumes. Une fois votre job d'entraînement terminé (statut DONE), votre job doit synchroniser vos données sur le ou les conteneurs Object Storage montés.
Si aucun volume n'est monté à l'emplacement spécifié, vos fichiers seront enregistrés dans le stockage local et éphémère du job, puis supprimés une fois le job terminé.
Quelles commandes et arguments puis-je utiliser pour le débogage ?
De nombreuses options et sous-commandes sont disponibles dans l'outil CLI ovhai. C'est le moyen d'interaction recommandé avec AI Solutions. Pour l'installer, suivez le guide d'installation de la CLI.
Pour obtenir la liste des sous-commandes et arguments disponibles, utilisez la commande :
Des détails supplémentaires sur chaque sous-commande sont accessibles avec :
Où puis-je trouver l'UUID de mon job ?
Les UUID de vos projets apparaissent dans le Control Panel lorsque vous accédez à la section AI Training.
Vous pouvez également les retrouver en listant vos jobs existants, à l'aide de la CLI ovhai avec la commande suivante :
Si votre job n'apparaît pas dans la liste, vous pouvez utiliser cette commande pour lister tous les jobs :
Pourquoi mon job a-t-il échoué (FAILED) ?
Tout d'abord, vérifiez le code de retour / code d'erreur de votre job
Vous pouvez trouver le code de retour de votre job en exécutant :
Votre code de retour est indiqué dans le champ « Infos » de la section « Status » :
L'information suivante est renvoyée s'il y a eu un problème lors du téléchargement/récupération de votre image. Vérifiez les fautes de frappe dans le nom de l'image et évaluez les problèmes si vous essayez d'accéder à une image non publique.
Vérifiez s'il y a des messages d'erreur
Vos messages stdout (Output) et stderr (Error) peuvent être consultés avec :
Notez que vous pouvez également les consulter depuis le Control Panel, en accédant à AI Training > Job UUID > Logs.
Déboguer de manière interactive
Si les réponses ci-dessus ne vous aident pas à résoudre votre problème, il peut être utile d'exécuter votre job de manière plus interactive.
Pour éviter tout « autostart » de votre image, vous pouvez utiliser un bash avec un sleep infini et vous y connecter en SSH.
Vérifiez que vous pouvez vous connecter à l'hôte SSH en exécutant la commande suivante :
Vous pouvez maintenant lancer vos commandes et/ou utiliser les utilitaires habituels en ligne de commande pour déboguer votre problème au sein du container.
Déboguer votre code
Le moyen le plus simple de déboguer votre code est d'utiliser la session de débogage interactive ci-dessus et d'exécuter/compiler votre code de manière interactive en vérifiant :
- les messages d'erreur
- les erreurs de syntaxe
- les bibliothèques manquantes
- les versions incorrectes
- ...
par exemple en exécutant (des parties de) votre code Python avec :
ou en utilisant tout autre débogueur
Est-il possible de mettre à jour un job en cours d'exécution ?
Il n'est pas possible de mettre à jour un job en cours d'exécution. Si vous souhaitez modifier la spécification d'un job, vous devez interrompre le job en cours puis le recréer.
Comment le produit est-il facturé ?
Durant son cycle de vie, le job doit transiter entre les statuts suivants : QUEUED, INITIALIZING, PENDING, RUNNING, INTERRUPTING, FINALIZING, DONE.
La facturation est à la minute et démarre depuis le début jusqu'à la fin du statut RUNNING du job. Chaque minute entamée est facturée intégralement. Les jobs qui n'atteignent pas le statut RUNNING ne sont pas facturés.
Le prix dépend des ressources de calcul que vous utilisez (CPU et GPU) et de leur durée d'exécution.
Pour plus d'informations sur la facturation d'AI Training et des exemples de tarification, consultez le guide AI Training - Facturation et cycle de vie.
Combien de temps puis-je utiliser mon job AI Training ?
Un job AI Training s'exécute en continu jusqu'à interruption manuelle par l'utilisateur ou jusqu'à sa fin, sauf s'il dépasse 7 jours consécutifs passés au statut RUNNING. Il est alors automatiquement arrêté. Vous pouvez choisir de le redémarrer automatiquement à l'aide de l'option auto-restart (en définissant ce paramètre sur True). Le job redémarre alors à l'identique. Pour augmenter cette limite de 7 jours, vous devrez contacter le support afin de demander une augmentation de ce quota pour votre projet Public Cloud.
Nous voulons vos retours !
N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :
- Sur le serveur Discord OVHcloud
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.