Charger des données source brutes dans votre entrepôt avec l'action Load
Cet article traite des actions qui utilisent le moteur de traitement de données Python propriétaire de la Data Platform. Pour utiliser des clusters Apache Spark, voir l'action Load PySpark
Objectif
Cet article traite des actions qui utilisent le moteur de traitement de données Python propriétaire de la Data Platform. Pour utiliser des clusters Apache Spark, voir l'action Load PySpark.
L'action Load extrait les données brutes des sources et les insère dans les tables primaires de votre entrepôt de données. C'est généralement la première étape de tout système de traitement de données, nécessaire avant d'exécuter tout autre processus sur des données provenant de sources connectées.
Autrement dit, si vous avez configuré un connector via les Connectors, le Projet dispose des informations pour se connecter à la source ainsi que de ses métadonnées, mais ne contiendra pas les données réelles tant qu'elles n'auront pas été chargées à l'aide de l'action Load.
Configurer une action Load
Pour créer une nouvelle action Load, accédez à l'onglet Action du Data Processing Engine (DPE), cliquez sur Nouvelle action et sélectionnez l'action Load.
Choisir une source et une destination
Pour configurer l'action Load, commencez par sélectionner une source dans la liste que vous avez déjà configurée dans l'onglet Sources des Connectors.
Ensuite, une table de destination vers laquelle envoyer vos données. Comme pour les sources, les tables doivent être configurées au préalable dans l'onglet Tables du Lakehouse Manager. Assurez-vous d'avoir construit votre modèle de données, sinon les tables ne seront pas accessibles par les autres composants de la platform.
Mapper les attributs
Une fois la source et la destination sélectionnées, le système mappera automatiquement les attributs de destination de votre table de destination avec les différentes colonnes qu'il a identifiées dans la source de données brute.
Sur l'image ci-dessous, vous pouvez voir que l'attribut date a une valeur de « 1 » à côté de l'icône de bloc-notes. Cela indique le nombre de règles de validation de données, également appelées blueprint rules, définies dans le Lakehouse Manager, qui seront automatiquement appliquées lors du chargement des données. Les blueprint rules permettent aux utilisateurs de filtrer rapidement les données invalides comme les valeurs nulles / cellules vides ou de reformater des valeurs telles que les dates ou les devises.
Notez que vous pourriez vouloir insérer du texte brut directement dans votre table de destination. Cela peut s'avérer utile par exemple lorsque vous souhaitez compter le nombre de points de données ou marquer une certaine source avec un label qui sera utilisé plus tard dans une table d'agrégation. Pour ce faire, sélectionnez < txt > qui définira l'attribut source comme un champ de saisie de texte brut.
Configurer les préférences de l'action
Une fois satisfait du mapping de vos attributs, accédez à l'onglet préférences pour configurer les paramètres de l'action.
Lorsque vous avez terminé d'éditer votre action, cliquez sur Créer pour valider l'action.
Mode avancé
Si vous devez accéder au fichier de configuration JSON de l'action, vous pouvez activer le mode avancé en cliquant sur Avancé en haut de la page.
Utiliser le mode avancé d'une action Load
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.