Transformer des données entre tables avec l'action Aggregate
Cet article traite des actions qui utilisent le moteur de traitement de données Python propriétaire de la Data Platform
Objectif
Cet article traite des actions qui utilisent le moteur de traitement de données Python propriétaire de la Data Platform. Pour utiliser des clusters Apache Spark, voir l'action Aggregate PySpark.
L'action Aggregate vous permet de transférer des données depuis n'importe quelle table préexistante vers n'importe quelle autre table, y compris la même table. La portée de l'action Aggregate — qui permet généralement la gestion SQL ainsi que la jointure de plusieurs tables et le regroupement des résultats — est large, ce qui en fait l'une des actions les plus utilisées dans les workflows de traitement de données.
Configurer une action Aggregate
Une action Aggregate est composée d'une liste d'une ou plusieurs tables source depuis lesquelles les valeurs seront extraites et placées dans une seule table de destination. Chaque attribut de destination doit être mappé à un attribut source.
Lorsque plusieurs tables source sont sélectionnées, il est nécessaire de spécifier une condition de jointure, tout comme cela se fait en SQL.
Notez que laisser un attribut de destination non mappé dans la configuration de l'action Aggregate déclenchera une erreur lorsque l'action sera lancée. Si vous préférez laisser le champ de destination vide, veillez simplement à le retirer de la liste des attributs mappés.
Lorsque des attributs de destination sont retirés de la liste des attributs mappés, le comportement suivant est à prévoir :
- Si l'action Aggregate insère de nouvelles lignes, elle remplira simplement la colonne de l'attribut de destination avec des valeurs NULL.
- Si l'action Aggregate met à jour des lignes existantes (c'est-à-dire insère par-dessus des données existantes), elle laissera la valeur précédente intacte, qu'elle soit NULL ou non.
Des exemples de cas d'usage pour des tables source uniques et multiples sont décrits ci-dessous.
Transférer des données brutes vers une table primaire
Créez une nouvelle action Aggregate :
Sélectionnez la table source (à gauche) et la table de destination. Les attributs correspondants sont automatiquement assignés lorsque cela est possible. Il est possible de sélectionner manuellement les attributs mappés entre la source et la destination.
Si nécessaire, vous pouvez changer le mapping vers SQL ou texte brut en cliquant sur le bouton MAP et en sélectionnant SQL ou txt.
Dans la section des attributs, il est également possible de changer le mode de calcul de chaque attribut. Dans l'exemple ci-dessus, SELECT a été choisi mais d'autres options sont disponibles.
Appuyez sur Créer en haut à droite pour créer l'action.
Joindre un référentiel à une table primaire
Pour spécifier une jointure, cliquez sur Ajouter une source situé juste en dessous de la table source, il vous sera alors demandé de sélectionner une table avec laquelle effectuer la jointure. Sélectionnez le type de jointure dans le menu déroulant, et saisissez les conditions de jointure dans l'interface. Plusieurs tables source peuvent être jointes.
Les attributs de toutes les tables jointes peuvent ensuite être sélectionnés dans la section des attributs en bas, soit depuis les menus déroulants, soit en utilisant SQL.
Configurer les préférences de l'action
Une fois satisfait du mapping de vos attributs, utilisez l'onglet préférences pour configurer les paramètres de l'action.
Utiliser le mode avancé
Si vous devez accéder au fichier de configuration JSON de l'action, vous pouvez activer le mode avancé en cliquant sur Avancé en haut de la page.
Utiliser le mode avancé d'une action Aggregate
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.