Améliorer votre analyse de données avec AI Endpoints sur la Data Platform
Ne vous souciez plus des datasets imparfaits : importez, nettoyez, et visualisez vos données avec la Data Platform
Objectif
Ne vous souciez plus des datasets imparfaits : importez, nettoyez, et visualisez vos données avec la Data Platform. Mais ce n'est pas tout ! Bénéficiez d'une analyse détaillée grâce à l'IA et allez encore plus loin en demandant à votre LLM de trouver une règle de Machine Learning qui correspond parfaitement à vos données.
Ce guide va vous montrer comment tirer parti des AI Endpoints pour améliorer vos capacités d'analyse de données sur la Data Platform. Vous apprendrez à partir de zéro à générer des prédictions pertinentes à partir de vos données.
Vous trouverez ici toutes les ressources utilisées (fichiers CSV, scripts Python, etc.) pour ce guide. Veuillez télécharger tous les fichiers nécessaires avant de commencer :
Étapes du tutoriel
étape 1 - charger le fichier CSV
La première étape consiste à accéder aux Connectors, créer une nouvelle source, et choisir File Upload pour charger le fichier CSV. Pour ce guide, nous utiliserons le - Dirty Cafe Sales Dataset
étape 2 - analyser la source et définir les règles de blueprint
Accédez à l'Analyzer depuis les Connectors et cliquez sur la source nouvellement ajoutée pour extraire les métadonnées.
Une fois terminé, vous pouvez commencer à définir les règles de blueprint suivantes pour chacun des attributs mentionnés :
étape 3 - créer une table à partir de la source
- Ouvrez la section tables en allant dans le Lakehouse Manager.
- Cliquez sur Create from a Connectors source et sélectionnez la source
dirty cafe sales.csv. - Nommez-la dirty_cafe_sales (nom par défaut)
- Cliquez sur Create pour construire et créer la table.
- Vérifiez que la table a été créée correctement. En cas de problème, consultez les logs pour identifier les erreurs.
étape 4 - dupliquer la table
Dupliquez cette table pour obtenir une nouvelle table vide avec les mêmes attributs et nommez-la clean_cafe_sales. Lancez le "Build" et vérifiez que tout est correct une fois terminé.
Comme indiqué, la table dupliquée est actuellement vide. Cela s'explique par le fait que seuls les attributs de la table ont été dupliqués, tandis que les données correspondantes doivent encore être chargées séparément.
étape 5 - créer une table vide pour la future visualisation de données
Créez une nouvelle table vide appelée clean_dataset_history et ajoutez les attributs suivants :
Astuce : vous pouvez basculer vers la vue Canvas pour glisser-déposer facilement les attributs, plutôt que de les créer un par un.
- item
- location
- payment_method
- quantity
- total_spent
- transaction_date
étape 6 - créer de nouveaux attributs
Rendez-vous dans les Attributs du Lakehouse Manager, créez de nouveaux Virtual Attributes pour la visualisation de données :
cela devrait ressembler à ceci :
Options de traitement
Vous avez maintenant deux options pour traiter et analyser vos données :
Option 1 : traitement automatisé (étapes 7 à 9)
- Automatiser le traitement avec un workflow et visualiser les données pour une analyse personnalisée
- Créer un workflow de Data Processing avec une action custom utilisant un script Python + une action Aggregate (pour l'automatisation et un traitement efficace du dataset)
- Créer des Queries depuis l'Analytics Manager pour visualiser les données à l'aide des attributs précédemment créés
Option 2 : traitement étape par étape avec LLM (étapes 10 à 11)
- Traiter les données étape par étape et bénéficier des endpoints d'API LLM pour une analyse de données complète
- Utiliser un notebook Jupyter pour traiter votre dataset étape par étape
- Bénéficier des LLM puissants disponibles sur AI Endpoints pour réaliser une analyse de données complète et générer un rapport
Option 1 : traitement automatisé
étape 7 - nettoyer le dataset avec votre propre workflow de traitement de données
Si vous souhaitez traiter les données rapidement et pouvoir les lancer en un seul clic, vous pouvez créer un workflow avec des actions custom et aggregate depuis le Data Processing Engine.
- Tout d'abord, créez une nouvelle action "Custom" :
- Chargez votre fichier Python
custom_action_cafe_sales_processing.py - nommez l'action custom
cafe_sales_data_processing - Choisissez la version Python 3.9
- Ajoutez les dépendances
numpyetpandas(saisissez le nom de la librairie et appuyez sur Entrée) et cliquez sur Create - Vous pouvez maintenant RUN l'action custom.
Vous devriez également voir des logs similaires à ceux ci-dessous pour vérifier que ce que vous avez fait est correct :
-
Ensuite, créez l'action "Aggregate" comme suit :
- Configurez les paramètres de l'action aggregate selon vos besoins
-
Ensuite, créez l'action "Delete" comme suit :
- Configurez les paramètres de l'action delete selon vos besoins (cette action garantira que vous utilisez une table propre à chaque fois)
-
Enfin, définissez le workflow de traitement :
- Configurez votre workflow pour connecter l'action delete, l'action custom et l'action aggregate
Votre dataset est maintenant propre.
étape 8 - explorer les tables propres
Vous pouvez maintenant vérifier que tout est correct :
-
Depuis les Tables du Lakehouse Manager, vous devriez voir vos tables créées
-
Depuis l'Explorer du Lakehouse Manager, vous pouvez explorer la table
clean_cafe_sales
étape 9 - visualisation des données à l'aide d'attributs personnalisés
Nous pouvons maintenant examiner nos données encore plus en détail visuellement à l'aide de queries dans l'Analytics Manager
-
Créer la query quantity_per_item
- Vous devriez voir la quantité moyenne vendue par jour pour chaque item
-
Créer la query total_spent_per_item
- Vous pourriez voir le montant total moyen vendu par jour pour chaque item
-
Créer la query sales_per_location
- Vous pourriez voir le montant total moyen vendu par jour pour chaque location
Vous pouvez aller plus loin en créant davantage de queries puis en les ajoutant à un Dashboard que vous pourrez ensuite partager avec d'autres.
Option 2 : traitement étape par étape avec LLM
étape 10 - nettoyer le dataset et le sauvegarder dans un bucket S31
Si vous souhaitez suivre le processus de nettoyage des données étape par étape, vous pouvez créer un nouveau notebook depuis le service Data Processing.
-
Créez un "Base notebook" avec :
- la version Python 3.9
- Installez les dépendances
numpy,pandas,matplotlib, etseaborn
-
Glissez-déposez ou cliquez sur upload pour charger le fichier
cafe_sales_preprocessing.ipynbdans la sidebar de fichiers du jupyterhub
étape 11 - analyse de données en une seule requête avec les AI Endpoints LLM
Une seule requête suffit pour générer tout le code Python dont vous avez besoin pour analyser votre dataset !
-
Utilisez le modèle Llama 3.3 70B Instruct avec le code Python qui vous permettra d'analyser facilement votre dataset
-
Générez une clé d'API AI Endpoints et utilisez-la à la ligne prévue à cet effet comme indiqué ci-dessous sur la capture d'écran
- Accédez ici
-
Utilisez le code Python généré pour analyser vos données et afficher des graphiques
L'avantage de demander à un LLM de générer du code en Python est que vous pourrez le réutiliser lorsque vous ajouterez de nouvelles données à vos ventes de café les mois suivants, garantissant ainsi une méthode d'analyse cohérente.
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.
1 : S3 est une marque déposée appartenant à Amazon Technologies, Inc. Les services de OVHcloud ne sont pas sponsorisés, approuvés, ou affiliés de quelque manière que ce soit.