For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-deploy-debug-apps.md.

AI Deploy - Dépannage

Voir en Markdown

Principales erreurs et comment dépanner vos apps AI Deploy

Objectif

Cette page vous donne quelques pistes pour déboguer vos apps si vous rencontrez des problèmes.

Prérequis

En pratique

Comment démarrer une app AI Deploy ?

Toutes les étapes pour démarrer et travailler avec AI Deploy sont décrites ici.

Combien de temps puis-je utiliser mon app AI Deploy ?

Il n’y a aucune limite de durée sur les apps AI Deploy. Une app AI Deploy s’exécute en continu jusqu’à interruption manuelle par l’utilisateur.

Construire votre app

Bonnes pratiques et règles obligatoires pour construire votre app

Lorsque vous déployez vos propres applications et modèles, certaines règles doivent être respectées. Nous les détaillons dans le guide AI Deploy - Construire et utiliser une image Docker personnalisée. Soyez particulièrement attentif aux exigences liées à l’image, comme l’utilisateur OVHcloud et l’architecture Docker utilisée. Sinon, votre déploiement se terminera au statut FAILED.

Exemples d’apps à suivre

Si vous avez besoin d’exemples officiels, suivez ce guide où nous partageons le code source : AI Deploy - Portfolio d'app.

Tester votre app en local et dans le cloud

Avant de payer pour des ressources cloud, n’hésitez pas à tester votre image Docker en local. Pour cela, installez simplement Docker sur votre environnement local.

Pour l’étape de build, comme expliqué dans les règles obligatoires liées dans la section précédente, votre image Docker doit prendre en charge au moins la plateforme linux/amd64 pour être déployée correctement. Sinon, le déploiement échouera.

Effectuez ensuite un docker run comme suit :

# Build your Docker image for at least linux/amd64 architecture
docker buildx build --platform linux/amd64,linux/arm64 ...

# Run your Docker image as OVHcloud user
docker run --rm -it --user=42420:42420 <image-identifier>

Vous imiterez ainsi l’utilisateur OVHcloud. Une fois validée en local, vous pouvez déployer votre app d’abord avec des CPU, moins coûteux que les GPU.

Déploiements

Mon déploiement a échoué

Une app AI Deploy suit un workflow en plusieurs étapes, dont le statut FAILED fait partie. Cet état survient lorsque OVHcloud n’est pas en mesure de déployer votre app, ce qui signifie que l’infrastructure (backend) fonctionne correctement, mais qu’un problème existe du côté de l’image. Vous trouverez plus de détails sur le workflow d’AI Deploy sur la page AI Deploy - Facturation et cycle de vie.

Principaux points à vérifier :

  • Une faute de frappe dans le nom de votre repository, de l’image ou de la version. Testez d’abord le déploiement de votre image en local.
  • Votre image Docker ne respecte pas les règles obligatoires, comme l’utilisateur OVHcloud. Consultez AI Deploy - Construire et utiliser une image Docker personnalisée.
  • Votre image Docker se trouve dans un registre privé et vous n’avez pas autorisé OVHcloud à y accéder.
  • Vous avez atteint vos quotas en termes de CPU ou de GPU. Vous pouvez les vérifier via l’espace client OVHcloud (Project Management / Quotas) ou via la commande ovhai me de la CLI ovhai.

Si vous utilisez la CLI ovhai, vous pouvez obtenir plus de détails sur votre commande avec la commande ovhai debug, et ovhai app logs <app_ID> pour télécharger l’historique des logs.

Mon déploiement est en erreur

Alors qu’un déploiement à l’état FAILED est dû à un problème lié à l’image, au repository, etc., une app à l’état ERROR peut survenir lorsqu’AI Deploy rencontre un problème.

Essayez de redéployer votre app, en modifiant par exemple le datacenter ciblé. Comme dans la réponse précédente, lorsque vous utilisez notre CLI, vous pouvez obtenir plus de détails sur votre commande avec la commande ovhai debug, et ovhai app logs <app_ID> pour télécharger l’historique des logs.

Si le problème persiste, veuillez contacter nos équipes de support.

Mon déploiement semble très long

Lorsqu’AI Deploy initialise votre app, l’image Docker est récupérée (téléchargée) sur notre infrastructure et répliquée sur les réplicas, le cas échéant. Plus l’image Docker est volumineuse, plus le déploiement sur AI Deploy prendra du temps.

Par ailleurs, comme nous récupérons les données depuis le registre de votre choix, si ce registre particulier rencontre des problèmes ou est limité en bande passante ou en débit, cela peut causer des lenteurs.

Dans une situation idéale, pour une image Docker d’environ 1 Go, sans données externes liées, cela devrait prendre moins de 10 minutes.

Stratégies de scaling

Avec AI Deploy, vous pouvez choisir entre deux stratégies de scaling : le scaling statique et l’autoscaling, vous permettant de monter ou descendre en charge selon des déclencheurs tels que l’utilisation du CPU ou de la RAM.

  • La stratégie de scaling statique vous permet de choisir le nombre de réplicas (1 à 10) sur lesquels l’app sera déployée.

  • Avec la stratégie d’autoscaling, il est possible de choisir à la fois le nombre minimum de réplicas (1 par défaut) et le nombre maximum de réplicas.

Retrouvez plus d’informations dans la documentation officielle sur les stratégies de scaling.

Mon app déployée ne scale pas

Si votre app ne scale pas :

  • Vérifiez si vous avez déployé votre app en scaling statique ou en autoscaling.
  • Vérifiez les déclencheurs (utilisation du CPU ou de la RAM) et leur valeur. Par défaut, la valeur est de 75 %.
  • Ouvrez le dashboard de monitoring de votre app (un dashboard Grafana est fourni pour chaque app) et vérifiez si le seuil a été atteint.
  • Reportez-vous au tutoriel de test de charge suivant, qui propose également un exemple de dashboard pour suivre votre scaling : AI Deploy - Comment tester la charge de votre application avec Locust.

Mon app déployée est très lente

Les lenteurs peuvent avoir de multiples origines. En effet, chaque app déployée est la combinaison d’un code applicatif et de ressources, telles que le calcul et le réseau.

Si vous rencontrez des lenteurs, voici quelques pistes à explorer :

  • Ouvrez le dashboard de monitoring de votre app (un dashboard Grafana est fourni pour chaque app) et vérifiez si certaines ressources atteignent 90/100 %, comme la RAM, le CPU, le GPU ou le réseau. Vous pouvez également vérifier la latence globale.
  • Si rien n’est visible, le problème peut se situer entre le client (d’où provient la requête) et l’app déployée. Par exemple, si vous contactez vos apps depuis un point géographiquement éloigné, cela ajoutera de la latence. Essayez de réduire les distances dans votre architecture.
  • Votre image Docker elle-même peut être à l’origine du problème. Essayez d’exécuter votre image Docker en local, et d’interroger votre app en local. Certaines apps peuvent être lourdes à exécuter ou mal optimisées.

Mon déploiement a planté

Comme tout produit cloud, AI Deploy peut connaître des pannes matérielles ou logicielles au fil du temps. Pour limiter ce risque de votre côté, veuillez déployer votre app sur au moins deux réplicas, ce qui nous permet d’assurer une haute disponibilité. À l’heure actuelle, tous les réplicas se trouvent dans la même région, mais cela les protège d’une panne physique de serveur.

Une autre cause possible peut être votre propre image Docker, par exemple en écrivant une quantité incontrôlée de données dans votre répertoire de travail.

Nous recommandons également d’orchestrer votre workflow avec des outils tiers tels qu’Airflow, Prefect, Dagster ou Kestra, qui vous permettent de relancer une app après un plantage.

Si votre app a planté et que vous utilisez la CLI ovhai, vous pouvez obtenir plus d’informations avec ovhai app logs <app_ID> pour télécharger l’historique des logs.

Mes données ne sont pas resynchronisées

AI Deploy ne resynchronise pas vos données distantes. Veuillez suivre les règles officielles pour construire et utiliser une image Docker personnalisée.

Est-il possible de mettre à jour l’image utilisée par mon app ?

Pour que votre app utilise la version mise à jour d’une image Docker, suivez ce guide.

Connectivité

Je ne comprends pas comment me connecter à mon app

AI Deploy fournit un endpoint HTTP pour chaque app déployée. Vous pouvez retrouver votre endpoint via l’espace client OVHcloud (Public Cloud / AI Deploy / My app / Access URL), l’API ou la CLI.

Un endpoint HTTP ressemble à ceci : https://<unique_id>.app.gra.ai.cloud.ovh.net

Votre app sera directement exposée sur cet endpoint HTTP et liée à un port (par défaut, le port 8080).

Selon ce que vous avez déployé, vous disposez alors soit d’un endpoint REST, soit d’une interface web. Vous pouvez consulter notre guide de premiers pas pour des explications complètes.

Je n’arrive pas à me connecter (non autorisé)

Lorsque vous déployez une app, vous pouvez opter pour un accès non restreint (ouvert à internet) ou un accès sécurisé.

Alors que l’accès non restreint signifie que tout le monde est autorisé, un accès sécurisé nécessitera des identifiants. Deux options sont disponibles :

  • Un utilisateur AI. On peut le voir comme une restriction par nom d’utilisateur et mot de passe. Assez simple, mais peu granulaire.
  • Un token AI (solution préférée). Un token est très efficace, car vous pouvez l’associer à des labels. Par exemple, un token pour un ID d’app spécifique, pour une équipe, ...

Si vous avez sélectionné un accès restreint, n’oubliez pas de générer un token applicatif.

J’ai besoin d’exposer plus d’un port

Par conception, AI Deploy relie votre app à un seul endpoint HTTP et un seul port (par défaut 8080). Si vous avez besoin de plus d’un port, la meilleure pratique consiste à répartir votre déploiement sur plusieurs apps. Si cela n’est pas possible, vous pouvez adapter votre endpoint HTTP comme suit : https://<unique_id>-<specific_port>.app.<region>.ai.cloud.ovh.net.

Par exemple, l’URL par défaut de votre app, qui commence par l’ID de l’app et accède au port par défaut, est https://00000000-0000-0000-0000-000000000000.app.gra.ai.cloud.ovh.net. Si vous souhaitez accéder au port 9000, vous devrez ajouter le numéro de port à l’URL de votre app, après l’identifiant unique de l’app : https://00000000-0000-0000-0000-000000000000-9000.app.gra.ai.cloud.ovh.net

Vous serez ainsi routé vers ce port spécifique, même après le lancement de l’app.

Vous pouvez également utiliser gRPC sur vos apps AI Deploy. Pour cela, précisez un port lors du lancement de votre app avec la CLI ovhai, à l’aide de l’attribut --grpc-port <GRPC_PORT>. Vous retrouverez alors votre gRPC Address dans les informations de votre tâche.

Facturation

Je ne comprends pas combien coûtera le déploiement d’une app

Le modèle de tarification d’AI Deploy est assez simple comparé à celui de nos concurrents. Vous payez pour les ressources de calcul (CPU/GPU) pendant la durée de leur utilisation.

  • Exemple simple : si vous déployez une app avec 2 x GPU à 1 euro chacun pendant 6 heures, vous paierez 12 euros au total (2 x 1 € x 6 h), quel que soit le nombre d’appels ou d’utilisateurs reçus.

Les tarifs sont affichés de façon statique sur notre site officiel, dans notre section Public Cloud. Pour une estimation dynamique, utilisez l’espace client OVHcloud. Une estimation sera disponible avant le lancement d’un déploiement.

De plus, pour des informations plus détaillées, veuillez vous référer à notre page AI Deploy - Facturation et cycle de vie.

Je n’arrive pas à obtenir un déploiement en « paiement à l’appel »

Pour l’instant, seul un modèle de « paiement à la minute » est disponible. Nous partageons également l’ambition d’un modèle de « paiement à l’appel », mais celui-ci n’est pas encore disponible.

Votre avis nous intéresse !

N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :

Pour une formation ou une assistance technique sur la mise en œuvre de nos solutions, contactez votre commercial ou consultez la page Professional Services pour obtenir un devis et faire analyser votre projet par nos experts.

Cette page vous a-t-elle aidé ?