For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/ai-machine-learning/ai-deploy-billing.md.

AI Deploy - Facturation et cycle de vie

Voir en Markdown

Découvrez comment la solution AI Deploy est facturée

Info

AI Deploy est couvert par les Conditions particulières OVHcloud Public Cloud.

Objectif

Le service AI Deploy d’OVHcloud facilite le déploiement de modèles et d’applications IA. Vous pouvez déployer des images Docker vers des endpoints HTTP, liés à des ressources CPU ou GPU, sans avoir à les installer ou les exploiter vous-même.

Ce guide couvre le cycle de vie d’une app AI Deploy, ainsi que sa facturation associée.

Introduction

AI Deploy est lié à un projet Public Cloud. L’ensemble du projet est facturé en fin de mois, selon un modèle à l’usage. Cela signifie que vous ne payez que ce que vous consommez, en fonction des ressources de calcul utilisées (CPU et GPU) et de leur durée d’exécution. À l’heure actuelle, nous ne proposons pas de tarification « à l’appel ».

Cycle de vie des apps AI Deploy

AI Deploy d’OVHcloud permet le déploiement d’images Docker, chaque déploiement étant appelé une app. Au cours de son cycle de vie, l’app passera par les statuts suivants :

  • QUEUED : la demande de déploiement de l’app est sur le point d’être traitée.
  • INITIALIZING : l’app démarre et, le cas échéant, les données distantes sont synchronisées depuis Object Storage. Pour en savoir plus sur la synchronisation des données, consultez la documentation Data - Concept and best practices.
  • SCALING : le système alloue d’abord les ressources de calcul nécessaires (CPU/GPU) à l’app. Ensuite, l’image Docker spécifiée est récupérée pour être utilisée par l’app. Ce statut est également atteint lorsque le nombre de réplicas de l’app est augmenté ou diminué.
  • RUNNING : au moins un réplica de l’app est disponible et accessible via son endpoint. Lorsque l’app monte en charge pour créer de nouveaux réplicas, le statut repasse à SCALING. Cependant, il n’y a aucune interruption de service, et le ou les réplicas d’origine restent accessibles pendant ce temps.
  • STANDBY : l’app n’a plus de réplicas en cours d’exécution, mais est prête à remonter en charge dès l’arrivée de trafic. Cela se produit après une période sans requête entrante, lorsque le scaling à 0 est activé. Lorsque du trafic arrive, l’app passe de STANDBY à RUNNING via les états INITIALIZING et SCALING.
  • STOPPING : l’app est en cours d’arrêt, vos ressources de calcul sont libérées. Les données éphémères sont supprimées.
  • STOPPED : l’app s’est terminée normalement. Vous pouvez la redémarrer quand vous le souhaitez ou la supprimer. Elle conservera le même endpoint.
  • FAILED : l’app s’est terminée en erreur, par exemple si l’image Docker est invalide (inaccessible, construite avec linux/arm, …).
  • ERROR : l’app s’est terminée en raison d’une erreur backend (problème du côté d’OVHcloud). Vous pouvez contacter notre support.
  • DELETING : l’app est en cours de suppression. Une fois supprimée, vous ne la verrez plus, elle n’existera plus.
  • DELETED : l’app est entièrement supprimée.
Chronologie du cycle de vie d'une application AI Deploy depuis Launch jusqu'à Delete en passant par Queued Initializing Scaling Running Standby Stopping et Stopped avec le CPU/GPU non facturé en dehors de la phase Running et les données distantes facturées au tarif Object Storage

Principes de facturation

Les apps AI Deploy sont une solution à l’usage, avec une facturation basée sur la consommation de ressources de calcul (CPU ou GPU). Vous pouvez sélectionner le type et la quantité de ressources que vous souhaitez utiliser, et vous ne serez facturé que pour les ressources consommées pendant les phases SCALING et RUNNING des réplicas de votre app.

Nous ne proposons pas de tarification à l’appel pour le moment.

Les ressources incluses dans AI Deploy sont :

  • le service managé AI Deploy (aucune infrastructure à gérer) ;
  • des ressources de calcul CPU/GPU dédiées (selon la quantité sélectionnée) ;
  • un stockage éphémère pendant l’exécution de l’app (espace de stockage lié au dimensionnement des ressources de calcul) ;
  • le trafic réseau entrant/sortant ;
  • l’outil de suivi et les métriques en temps réel (Grafana).

Les ressources optionnelles, non incluses avec AI Deploy, sont :

  • l’espace de stockage distant, facturé selon la tarification Object Storage d’OVHcloud ;
  • pour cet Object Storage optionnel, le trafic sortant lorsqu’il est communiqué en dehors d’OVHcloud ;
  • un registre Docker privé le cas échéant.

Voici un graphique détaillé illustrant chaque étape facturée ou non pendant le workflow AI Deploy :

Chronologie du cycle de vie d'une application AI Deploy de Launch à Delete annotée sous chaque phase avec ce qui se passe et ce qui est facturé notamment les ressources de calcul allouées par réplique pendant Running et les données éphémères perdues une fois Stopped

Détails des ressources de calcul

Lors de la création de l’app, vous pouvez sélectionner des ressources de calcul, appelées CPU ou GPU. Leur tarification officielle est disponible sur le ou sur le site Public Cloud d’OVHcloud.

Les tarifs de calcul sont indiqués à l’heure pour faciliter la lecture des prix, mais la granularité de facturation reste à la minute.

Une fois les ressources de calcul sélectionnées, vous pouvez préciser la stratégie de scaling :

  • Scaling fixe : vous pouvez spécifier un nombre fixe de réplicas, à partir de un. Notez qu’avec un seul réplica, vous ne bénéficierez pas de la haute disponibilité.
  • Autoscaling : vous pouvez spécifier un nombre minimum et maximum de réplicas, ainsi qu’une métrique qui déclenchera la montée ou la descente en charge (utilisation CPU, RAM ou une métrique personnalisée). Chaque réplica bénéficiera de la ressource de calcul sélectionnée précédemment.

Détails du stockage

Stockage local éphémère

Chaque ressource de calcul (CPU ou GPU) est fournie avec un stockage local, que l’on peut considérer comme éphémère puisque cet espace de stockage n’est pas conservé lorsque vous arrêtez ou supprimez une app AI Deploy.

Le dimensionnement dépend de la quantité de ressources de calcul sélectionnée ; consultez les détails sur le site Public Cloud d’OVHcloud.

Cet espace de stockage peut être utilisé par votre image Docker, pour des opérations locales.

Object Storage distant

Lorsque vous travaillez avec des données distantes, vous payez séparément le stockage de ces données. La tarification d’Object Storage est distincte de celle de l’app.

Exemples de tarification

Pour ces exemples, nous prendrons une tarification de 1,95 € / heure par GPU NVIDIA V100s et de 0,03 € / heure par CPU. Les tarifs peuvent varier, veuillez vous référer à la page de tarification officielle.

Exemple 1 : une app GPU pendant 10 heures puis supprimée

Nous déployons une app AI Deploy, avec 2 x GPU, et la laissons tourner pendant 10 heures avant de la supprimer.

Nous recevons des milliers d’appels : c’est inclus (pas de tarification à l’appel, vous payez le calcul en cours d’exécution).

  • ressources de calcul par réplica : 2 x GPU NVIDIA V100s (1,95 € / heure)
  • scaling : fixe
  • réplicas : 1 seul
  • nombre d’appels : illimité
  • durée : 10 heures puis suppression

Calcul du prix pour le calcul : 10 (heures) x 2 (GPU) x 1 (réplica) x 1,93 € (prix / GPU) = 39 euros, facturés en fin de mois.

Exemple 2 : plusieurs apps AI Deploy pendant 5 heures puis supprimées

Nous démarrons 15 x apps AI Deploy en parallèle, chacune avec un vCPU.

Nous recevons des milliers d’appels : c’est inclus (pas de tarification à l’appel, vous payez le calcul en cours d’exécution).

  • ressources de calcul par app avec scaling fixe : 1 x vCPU (0,03 € /heure /cpu)
  • scaling : fixe
  • réplica : 1 seul
  • nombre d’appels : illimité
  • durée : 5 heures puis suppression

Calcul du prix pour le calcul : 15 (app) x 5 (heures) x 1 (CPU) x 0,03 € (prix / CPU) = 2,25 euros, facturés en fin de mois.

Exemple 3 : GPU et autoscaling

Nous démarrons 1 x app AI Deploy avec un autoscaling configuré à 1 réplica minimum et 3 réplicas maximum.

Nous recevons des milliers d’appels : c’est inclus (pas de tarification à l’appel, vous payez le calcul en cours d’exécution).

  • ressources de calcul par réplica : 1 x GPU (1,93 € /heure /gpu)
  • scaling : autoscaling, de 1 à 3 réplicas
  • nombre d’appels : illimité
  • durée : 5 heures avec 1 réplica en cours d’exécution, puis un pic d’1 heure à 3 réplicas, puis arrêt et suppression.

Le calcul du prix pour le calcul variera dans le temps en raison de l’autoscaling : 1 (app) x 5 (heures) x 1 (réplica) x 1 (GPU) x 1,93 € (prix / GPU) = 9,65 euros + 1 (app) x 1 (heure) x 3 (réplicas) x 1 (GPU) x 1,93 € (prix / GPU) = 5,79 euros Total : 15,44 euros, facturés en fin de mois.

Votre avis nous intéresse !

N’hésitez pas à nous faire part de vos questions, retours et suggestions pour améliorer le service :

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Cette page vous a-t-elle aidé ?