For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/tutorials-segmentation-workflow-dates.md.

Découvrir la segmentation basée sur le périmètre de dates configuré dans le workflow

Voir en Markdown

Souvent, pour un usage quotidien, vous aurez besoin que vos actions du Data Processing Engine (DPE) gèrent les données correspondant aux X derniers jours jusqu'à aujourd'hui

Objectif

Souvent, pour un usage quotidien, vous aurez besoin que vos actions du Data Processing Engine (DPE) gèrent les données correspondant aux X derniers jours jusqu'à aujourd'hui.

D'autres fois, vous aurez besoin que vos actions n'agissent que sur un ensemble historique de dates. Ce type de segmentation fonctionne globalement comme la « Segmentation sur les valeurs d'un attribut d'une table », sauf que les valeurs proviennent des dates que vous définissez dans la configuration du workflow, plutôt que d'une table du Lakehouse Manager.

Exemples concrets d'utilisation

  • Récupérer les données d'une source uniquement des X derniers jours jusqu'à aujourd'hui. (usage quotidien à dates relatives)
  • Récupérer les données d'une source entre 2 dates précises (récupération de données historiques, usage ponctuel)
  • Recalculer une table agrégée uniquement entre 2 dates (usage quotidien à dates relatives ou usage ponctuel )

Si vos données source contiennent un attribut de date, il est possible de diviser l'action en processus distincts qui traiteront individuellement une date précise ou un groupe de dates. Dans ce cas, chaque tâche appliquera un filtre sur la date qu'elle doit extraire.

Info

Vous pouvez trouver la page de documentation produit actuelle sur la segmentation, détaillant le comportement et les spécifications de la fonctionnalité sur cette page.

Prérequis

Avant d'utiliser ce type de segmentation, certains points doivent être vérifiés :

1. L'attribut var_name est-il indexé dans la table source ?

Si ce n'est pas le cas, la requête d'extraction sera bien plus lente.

2. Y a-t-il suffisamment de CPU sur les bases de données source et destination ?

  • Gardez à l'esprit que les opérations select et insert sont gourmandes en CPU.
  • Par exemple, si votre base de données ne dispose que d'1 CPU, il est probablement risqué de configurer 6 workers pour sélectionner et insérer simultanément dans l'instance du SGBD...
Info

Règle générale : 1 CPU devrait être disponible pour chaque worker s'exécutant simultanément.

3. Éviter de générer trop de tâches dans une même stage.

Pour garantir de bonnes performances du Data Processing Engine (DPE), nous conseillons d'éviter de définir des stages de plus de 500 tâches.

Ce n'est pas une limite stricte, car cela ne provoquera pas immédiatement de bug au-delà de ce seuil, mais des dégradations de performance peuvent être observées. Pour réduire le nombre de tâches, vous pouvez définir une bucket size plus élevée, afin que chaque tâche traite davantage de valeurs (ce qui signifie moins de tâches au final).

Compatibilité

Cette option de segmentation n'est compatible qu'avec les actions et sources suivantes :

Types d'actionTypes de source
Load; Aggregate; Diff; Delete_Diff; Delete; CustomDatabases: MySQL, PostgreSQL, SQLServer, Impala, Hive, BiqQuery, ElasticSearch, Cassandra, Redshift, Oracle; API: Facebook, Twitter, Google Analytics, YouTube Private, YouTube Public, HTTP REST

Comment utiliser ce type de segmentation ?

Voici un aperçu rapide comparant le mode visible et le mode JSON avancé.

prestage

Attribut de la source / var_name : attribut SQL qui sera utilisé pour le filtrage de la source.

Bucket size / Chunksize : nombre de valeurs à filtrer pour chaque tâche.

Autres astuces

Vous pouvez utiliser des formules SQL

Pour segmentation.var_name (dans la dernière partie de l'attribut), vous pouvez utiliser des formules SQL, tant qu'elles sont compatibles avec votre SGBD. Notez que le SGBD peut évoluer avec le temps, vous devrez donc peut-être revérifier et corriger ces formules SQL si vous décidez de les utiliser.

Par exemple, vous pourriez avoir :

"segmentation": 
{
   "active": true,
   "type": "workflow_dates",
   "var_name": "DATE(datetime)",
   "chunksize": 1
 }

Comment cela fonctionne-t-il en coulisses ?

Ce mode de segmentation fonctionne de la même manière que la segmentation basée sur un attribut d'une table de Projet. La seule différence est que les valeurs proviennent du périmètre de dates du workflow, plutôt que d'un attribut de table du Lakehouse Manager, il n'y a donc pas besoin de pré-stage.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

Cette page vous a-t-elle aidé ?