For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/tutorials-segmentation-predefined-values.md.

Découvrir la segmentation basée sur un ensemble de valeurs prédéfinies

Voir en Markdown

Vos actions peuvent être exécutées sur un ensemble de valeurs de votre choix tout en segmentant sur celles-ci en même temps

Objectif

Vos actions peuvent être exécutées sur un ensemble de valeurs de votre choix tout en segmentant sur celles-ci en même temps.

Exemples d'utilisation :

  • Segmenter sur un ensemble précis de sites ou d'articles de e-commerce
  • Appliquer une règle métier A à un sous-ensemble de données A avec une action aggregate A, et une règle métier B à un sous-ensemble de données B dans une action aggregate B.
Info

Vous pouvez trouver la page de documentation produit actuelle sur la segmentation, détaillant le comportement et les spécifications de la fonctionnalité sur cette page.

Prérequis

Avant d'utiliser ce type de segmentation, certains points doivent être vérifiés :

1. L'attribut var_name est-il indexé dans la table source ?

Si ce n'est pas le cas, la requête d'extraction sera bien plus lente.

2. Y a-t-il suffisamment de CPU sur les bases de données source et destination ?

  • Gardez à l'esprit que les opérations select et insert sont gourmandes en CPU.
  • Par exemple, si votre base de données ne dispose que d'1 CPU, il est probablement risqué de configurer 6 workers pour sélectionner et insérer simultanément dans l'instance du SGBD...
Info

Règle générale : 1 CPU devrait être disponible pour chaque worker s'exécutant simultanément.

3. Éviter de générer trop de tâches dans une même stage.

Pour garantir de bonnes performances du Data Processing Engine (DPE), nous déconseillons d'avoir des stages avec plus de 500 tâches.

Ce n'est pas une limite stricte, mais des dégradations de performance peuvent être observées au-delà de 500 tâches. Pour réduire le nombre de tâches, vous pouvez définir une bucket size plus élevée, afin que chaque tâche traite davantage de valeurs (ce qui signifie moins de tâches au final).

Compatibilité

Cette option de segmentation n'est compatible qu'avec les actions et sources suivantes :

Types d'actionTypes de source
Load; Aggregate; Diff; Delete_Diff; Delete; CustomDatabases: MySQL, PostgreSQL, SQLServer, Impala, Hive, BiqQuery, ElasticSearch, Cassandra, Redshi

Comment utiliser ce type de segmentation ?

Voici un aperçu rapide comparant le mode visible et le mode JSON avancé.

prestage

Attribut de la source / var_name : attribut SQL qui sera utilisé pour le filtrage de la source.

Bucket size / Chunksize : nombre de valeurs à filtrer pour chaque tâche.

Ensemble prédéfini / values : ensemble de valeurs codées en dur à filtrer.

Autres astuces

Vous pouvez utiliser des formules SQL

Pour segmentation.var_name (dans la dernière partie de l'attribut), vous pouvez utiliser des formules SQL, tant qu'elles sont compatibles avec votre SGBD. Notez que le SGBD peut évoluer avec le temps, vous devrez donc peut-être revérifier et corriger ces formules SQL si vous décidez de les utiliser.

Par exemple, vous pourriez avoir :

{
  "segmentation": {
    "active": true,
    "type": "predefined_set",
    "var_name": "DATE(datetime)",
    "values": ["2020-01-01","2020-01-02"]
    "chunksize": 1
  }
}

Comment cela fonctionne-t-il en coulisses ?

Ce mode de segmentation fonctionne de la même manière que la segmentation basée sur un attribut d'une table de Projet. La seule différence est que les valeurs sont déjà définies dans la configuration, plutôt qu'un attribut de table du Lakehouse Manager, il n'y a donc pas besoin de pré-stage.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

Cette page vous a-t-elle aidé ?