For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/tutorials-ai-endpoints.md.

Améliorer votre analyse de données avec AI Endpoints sur la Data Platform

Voir en Markdown

Ne vous souciez plus des datasets imparfaits : importez, nettoyez, et visualisez vos données avec la Data Platform

Objectif

Ne vous souciez plus des datasets imparfaits : importez, nettoyez, et visualisez vos données avec la Data Platform. Mais ce n'est pas tout ! Bénéficiez d'une analyse détaillée grâce à l'IA et allez encore plus loin en demandant à votre LLM de trouver une règle de Machine Learning qui correspond parfaitement à vos données.

Ce guide va vous montrer comment tirer parti des AI Endpoints pour améliorer vos capacités d'analyse de données sur la Data Platform. Vous apprendrez à partir de zéro à générer des prédictions pertinentes à partir de vos données.

Vous trouverez ici toutes les ressources utilisées (fichiers CSV, scripts Python, etc.) pour ce guide. Veuillez télécharger tous les fichiers nécessaires avant de commencer :

TypeNom
Fichier sourcedirty_cafe_sales.csv
Script Python de prétraitementcustom_action_cafe_sales_processing.py
Notebook de prétraitement et requête LLMcafe_sales_preprocessing.ipynb
Introduction — Process overview

Étapes du tutoriel

étape 1 - charger le fichier CSV

La première étape consiste à accéder aux Connectors, créer une nouvelle source, et choisir File Upload pour charger le fichier CSV. Pour ce guide, nous utiliserons le - Dirty Cafe Sales Dataset

étape 1 - charger le fichier CSV — Ai endpoints step

étape 2 - analyser la source et définir les règles de blueprint

Accédez à l'Analyzer depuis les Connectors et cliquez sur la source nouvellement ajoutée pour extraire les métadonnées.

étape 2 - analyser la source et définir les règles de blueprint — Ai endpoints step

Une fois terminé, vous pouvez commencer à définir les règles de blueprint suivantes pour chacun des attributs mentionnés :

AttributRègle de blueprint
payment_method- Skip line si Is null - Skip line si Equal "ERROR" - Skip line si Equal "UNKNOWN"
location- Skip line si Is null - Skip line si Equal "ERROR" - Skip line si Equal "UNKNOWN"
transaction_date- Skip line si Is null - Skip line si Equal "ERROR" - Skip line si Equal "UNKNOWN"
étape 2 - analyser la source et définir les règles de blueprint — Ai endpoints step (2)

étape 3 - créer une table à partir de la source

  1. Ouvrez la section tables en allant dans le Lakehouse Manager.
  2. Cliquez sur Create from a Connectors source et sélectionnez la source dirty cafe sales.csv.
  3. Nommez-la dirty_cafe_sales (nom par défaut)
  4. Cliquez sur Create pour construire et créer la table.
  5. Vérifiez que la table a été créée correctement. En cas de problème, consultez les logs pour identifier les erreurs.
étape 3 - créer une table à partir de la source — Ai endpoints step

étape 4 - dupliquer la table

Dupliquez cette table pour obtenir une nouvelle table vide avec les mêmes attributs et nommez-la clean_cafe_sales. Lancez le "Build" et vérifiez que tout est correct une fois terminé.

étape 4 - dupliquer la table — Ai endpoints step étape 4 - dupliquer la table — Ai endpoints step (2) étape 4 - dupliquer la table — Ai endpoints step (3)
Info

Comme indiqué, la table dupliquée est actuellement vide. Cela s'explique par le fait que seuls les attributs de la table ont été dupliqués, tandis que les données correspondantes doivent encore être chargées séparément.

étape 5 - créer une table vide pour la future visualisation de données

Créez une nouvelle table vide appelée clean_dataset_history et ajoutez les attributs suivants :

Info

Astuce : vous pouvez basculer vers la vue Canvas pour glisser-déposer facilement les attributs, plutôt que de les créer un par un.

  • item
  • location
  • payment_method
  • quantity
  • total_spent
  • transaction_date

étape 6 - créer de nouveaux attributs

Rendez-vous dans les Attributs du Lakehouse Manager, créez de nouveaux Virtual Attributes pour la visualisation de données :

Nom de l'attributDéfinition du Virtual Attribute
avg_quantity_per_day_per_itemSUM(CAST(quantity AS DECIMAL(10,2))) / COUNT(DISTINCT CONCAT(CAST(transaction_date AS VARCHAR), CAST(item AS VARCHAR)))
avg_sales_per_day_per_itemSUM(CAST(total_spent AS DECIMAL(10,2))) / COUNT(DISTINCT CONCAT(CAST(transaction_date AS VARCHAR), CAST(item AS VARCHAR)))
avg_sales_per_day_per_locationSUM(CAST(total_spent AS DECIMAL(10,2))) / COUNT(DISTINCT CONCAT(CAST(transaction_date AS VARCHAR), CAST(location AS VARCHAR)))
yearmonthSUBSTR(CAST(transaction_date AS VARCHAR), 1, 7)

cela devrait ressembler à ceci :

étape 6 - créer de nouveaux attributs — Ai endpoints step

Options de traitement

Vous avez maintenant deux options pour traiter et analyser vos données :

Option 1 : traitement automatisé (étapes 7 à 9)

  • Automatiser le traitement avec un workflow et visualiser les données pour une analyse personnalisée
  • Créer un workflow de Data Processing avec une action custom utilisant un script Python + une action Aggregate (pour l'automatisation et un traitement efficace du dataset)
  • Créer des Queries depuis l'Analytics Manager pour visualiser les données à l'aide des attributs précédemment créés

Option 2 : traitement étape par étape avec LLM (étapes 10 à 11)

  • Traiter les données étape par étape et bénéficier des endpoints d'API LLM pour une analyse de données complète
  • Utiliser un notebook Jupyter pour traiter votre dataset étape par étape
  • Bénéficier des LLM puissants disponibles sur AI Endpoints pour réaliser une analyse de données complète et générer un rapport

Option 1 : traitement automatisé

étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données

Si vous souhaitez traiter les données rapidement et pouvoir les lancer en un seul clic, vous pouvez créer un workflow avec des actions custom et aggregate depuis le Data Processing Engine.

  1. Tout d'abord, créez une nouvelle action "Custom" :
  • Chargez votre fichier Python custom_action_cafe_sales_processing.py
  • nommez l'action custom cafe_sales_data_processing
  • Choisissez la version Python 3.9
  • Ajoutez les dépendances numpy et pandas (saisissez le nom de la librairie et appuyez sur Entrée) et cliquez sur Create
  • Vous pouvez maintenant RUN l'action custom.
étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données — Ai endpoints step

Vous devriez également voir des logs similaires à ceux ci-dessous pour vérifier que ce que vous avez fait est correct :

2025-02-27 08:59:09 [NOTICE] "cafe_sales_data_processing" SUBMITTED
2025-02-27 08:59:09 [NOTICE] "cafe_sales_data_processing" QUEUED
2025-02-27 08:59:10 [NOTICE] "cafe_sales_data_processing" BUILD SUBMITTED
...
2025-02-27 09:00:41 [NOTICE] "cafe_sales_data_processing" Stop cleaning
2025-02-27 09:00:41 [NOTICE] "cafe_sales_data_processing" END (custom) action. Duration: 6.65 sec
...
2025-02-27 09:00:44 [NOTICE] "Flush dataplant cache" END (forepaas-flushall) action. Duration: 2.14 sec
  1. Ensuite, créez l'action "Aggregate" comme suit :

    • Configurez les paramètres de l'action aggregate selon vos besoins
    étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données — Ai endpoints step (2)
  2. Ensuite, créez l'action "Delete" comme suit :

    • Configurez les paramètres de l'action delete selon vos besoins (cette action garantira que vous utilisez une table propre à chaque fois)
    étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données — Ai endpoints step (3)
  3. Enfin, définissez le workflow de traitement :

    • Configurez votre workflow pour connecter l'action delete, l'action custom et l'action aggregate
    étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données — Ai endpoints step (4)

Votre dataset est maintenant propre.

étape 8 - explorer les tables propres

Vous pouvez maintenant vérifier que tout est correct :

  1. Depuis les Tables du Lakehouse Manager, vous devriez voir vos tables créées

    étape 8 - explorer les tables propres — Ai endpoints step
  2. Depuis l'Explorer du Lakehouse Manager, vous pouvez explorer la table clean_cafe_sales

    étape 8 - explorer les tables propres — Ai endpoints step (2)

étape 9 - visualisation des données à l'aide d'attributs personnalisés

Nous pouvons maintenant examiner nos données encore plus en détail visuellement à l'aide de queries dans l'Analytics Manager

  1. Créer la query quantity_per_item

    • Vous devriez voir la quantité moyenne vendue par jour pour chaque item
    étape 9 - visualisation des données à l'aide d'attributs personnalisés — Ai endpoints step
  2. Créer la query total_spent_per_item

    • Vous pourriez voir le montant total moyen vendu par jour pour chaque item
    étape 9 - visualisation des données à l'aide d'attributs personnalisés — Ai endpoints step (2)
  3. Créer la query sales_per_location

    • Vous pourriez voir le montant total moyen vendu par jour pour chaque location
    étape 9 - visualisation des données à l'aide d'attributs personnalisés — Ai endpoints step (3)

Vous pouvez aller plus loin en créant davantage de queries puis en les ajoutant à un Dashboard que vous pourrez ensuite partager avec d'autres.

Option 2 : traitement étape par étape avec LLM

étape 10 - nettoyer le dataset et le sauvegarder dans un bucket S31

Si vous souhaitez suivre le processus de nettoyage des données étape par étape, vous pouvez créer un nouveau notebook depuis le service Data Processing.

  1. Créez un "Base notebook" avec :

    • la version Python 3.9
    • Installez les dépendances numpy, pandas, matplotlib, et seaborn
    étape 10 - nettoyer le dataset et le sauvegarder dans un bucket S3 — Ai endpoints step
  2. Glissez-déposez ou cliquez sur upload pour charger le fichier cafe_sales_preprocessing.ipynb dans la sidebar de fichiers du jupyterhub

    étape 10 - nettoyer le dataset et le sauvegarder dans un bucket S3 — Ai endpoints step (2)

étape 11 - analyse de données en une seule requête avec les AI Endpoints LLM

Une seule requête suffit pour générer tout le code Python dont vous avez besoin pour analyser votre dataset !

  1. Utilisez le modèle Llama 3.3 70B Instruct avec le code Python qui vous permettra d'analyser facilement votre dataset

  2. Générez une clé d'API AI Endpoints et utilisez-la à la ligne prévue à cet effet comme indiqué ci-dessous sur la capture d'écran

    étape 11 - analyse de données en une seule requête avec les AI Endpoints LLM — Ai endpoints step étape 11 - analyse de données en une seule requête avec les AI Endpoints LLM — Ai endpoints step (2)
  3. Utilisez le code Python généré pour analyser vos données et afficher des graphiques

L'avantage de demander à un LLM de générer du code en Python est que vous pourrez le réutiliser lorsque vous ajouterez de nouvelles données à vos ventes de café les mois suivants, garantissant ainsi une méthode d'analyse cohérente.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

1 : S3 est une marque déposée appartenant à Amazon Technologies, Inc. Les services de OVHcloud ne sont pas sponsorisés, approuvés, ou affiliés de quelque manière que ce soit.

Cette page vous a-t-elle aidé ?