For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/lakehouse-manager-datasets.md.

Organiser les tables en datasets dans le Lakehouse Manager

Voir en Markdown

Les Datasets sont des regroupements logiques de tables partageant des paramètres par défaut, sous forme Standard ou External

Objectif

Les Datasets sont des regroupements logiques de tables, qui leur permettent de partager certains paramètres par défaut.la Platform prend en charge les Datasets Standard ainsi que External pour gérer vos tables.

Par défaut, un dataset standard nommé default_dataset vous est attribué. Ce dataset standard utilisera le Lakehouse Manager Engine, basé sur Apache Iceberg.

Datasets
Warning

Une fois un dataset créé, il existe une période d'attente de 60 secondes avant qu'il puisse être utilisé pour des requêtes.

Datasets

Les Datasets ont été conçus dans l'optique d'encourager les utilisateurs à gérer les paramètres d'une table au niveau du groupe/dataset. Vous pouvez Éditer, Dupliquer et Supprimer des datasets depuis la vue liste.

Standard Dataset

Le Lakehouse Manager joue le double rôle de service de gestion des données et de moteur de stockage pour le dataset standard. Vous pouvez en apprendre davantage sur ce moteur en cliquant sur le lien discover pendant la création d'un dataset.

Cliquez sur le bouton New Dataset pour commencer à créer un nouveau dataset, puis sélectionnez standard dataset. Remplissez tous les champs requis du dataset et cliquez sur Create.

Standard Dataset — Datasets Standard Dataset — Datasets (2)

Comment les données sont stockées

Le Lakehouse Manager sépare l'organisation logique de vos données de l'endroit où les octets vivent réellement. Trois concepts sont faciles à confondre, il est donc utile de les distinguer :

  • Datasets : une enveloppe logique qui regroupe des tables. Un dataset ne stocke aucune donnée lui-même.
  • Tables : les objets physiques, stockés dans Apache Iceberg et gérés par le Lakehouse Manager.
  • Buckets : un espace de stockage d'objets compatible S31 pour les fichiers non structurés, indépendant du Lakehouse. Voir Buckets.

Un dataset n'est donc pas un bucket : c'est un regroupement logique de tables.

Info

Comme un dataset ne contient que des métadonnées, partager ou déplacer un dataset ne copie jamais de données : cela modifie ce vers quoi le Lakehouse pointe. Voir Partage inter-projets.

Gestion des Datasets

La page de configuration affiche toutes les informations que vous devez connaître sur votre dataset. Vous pouvez éditer la description et les tags de vos datasets, et consulter également les politiques de résidence des données - moteur de stockage utilisé et emplacement de résidence des données.

Dataset Management — Datasets

Dans l'onglet tables, vous pouvez voir toutes les tables associées faisant partie du dataset. Il est important de se rappeler qu'il s'agit uniquement d'une vue, et que vous ne pouvez éditer aucune des tables depuis ce menu.

Dataset Management — Datasets (2)

Le menu policy tags vous permet d'attribuer des policy tags à l'échelle du dataset, qui seront ensuite appliqués à toutes les tables faisant partie du dataset. Vous pouvez choisir parmi les policy tags disponibles, ou même en créer sur le moment. Ici se trouve le guide étape par étape pour associer des policy tags.

Dataset Management — Datasets (3)

Organiser vos données : l'approche médaillon

La Data Platform n'impose pas d'architecture Bronze / Silver / Gold (« médaillon ») : vous êtes libre de modéliser votre lakehouse de la manière qui convient à votre cas d'usage. Par défaut, un dataset vous est provisionné (default_dataset).

Cela dit, gérer des couches médaillon avec des datasets est un pattern valide qui s'intègre naturellement au reste de la platform. Un pipeline typique ressemble à ceci :

  1. Bronze : données brutes, ingérées via les Connectors.
  2. Silver : nettoyées, validées et dédupliquées par les actions du Data Processing Engine.
  3. Gold : enrichies, jointes et agrégées par les actions du Data Processing Engine, prêtes à être consommées dans l'Analytics Manager ou votre outil BI.

Chaque couche est un dataset ; les transformations entre les couches sont des actions orchestrées dans un workflow.

Partage inter-projets (bêta)

Info

Cette fonctionnalité est actuellement en bêta. Merci de nous signaler tout problème rencontré.

Par défaut, chaque projet sur la Data Platform est entièrement isolé : il n'existe aucun moyen implicite d'accéder à un dataset depuis un autre projet. Le partage inter-projets permet au propriétaire d'un dataset de l'exposer, depuis le projet source, à un ou plusieurs projets destinataires de manière contrôlée, sans rompre les limites de sécurité existantes.

Ce que le partage fait, et ne fait pas

  • Le partage s'effectue au niveau du dataset, entre projets au sein de la même organisation. Vous ne pouvez pas partager avec une autre organisation.
  • Un dataset partagé est un singleton, pas une copie. Les lectures, écritures, constructions, et l'utilisation dans les notebooks et actions personnalisées s'appliquent aux mêmes données sous-jacentes, tant du côté source que du côté destinataire.
  • Pour l'instant, le partage est complet : l'intégralité du dataset est exposée au projet destinataire.
  • L'isolation entre projets non liés reste strictement appliquée.

Permissions et rôles

Le partage est géré depuis le projet source.

  • Un dataset partagé est exposé en READ & WRITE.
  • Le rôle LM & AM Editor est requis pour partager un dataset ou pour supprimer un partage existant.
Warning

L'accès à un dataset partagé est toujours évalué dans le contexte du projet destinataire, et non du projet source. Lorsque l'utilisateur B du projet B lit un dataset partagé depuis le projet A, la platform demande « l'utilisateur B a-t-il accès à ce dataset dans le projet B ? », jamais « dans le projet A ». Comme l'utilisateur B n'existe pas dans le projet A, cette seconde question renverrait toujours faux. Vos règles d'accès restent donc ancrées dans le projet destinataire.

Info

Un module Advanced Data Access Control plus granulaire est à l'étude pour des permissions plus fines sur les objets partagés.

Partager un dataset

  1. Depuis le projet source, ouvrez le dataset que vous souhaitez partager et allez dans son onglet Configuration.
  2. Cliquez sur Manage share settings.
Share a dataset — Share
  1. Sélectionnez un ou plusieurs projets dans la liste des projets disponibles de votre organisation, puis confirmez.
Share a dataset — Share (2)
  1. Vous recevrez un email confirmant que le dataset a été partagé.

Le projet source affiche les informations d'utilisation pour chaque projet avec lequel le dataset a été partagé, afin que vous puissiez suivre qui consomme les données partagées.

Sur le projet destinataire

Les datasets partagés apparaissent dans le menu Datasets du Lakehouse Manager du projet destinataire, aux côtés des datasets propres au projet. Ils sont signalés par une icône de partage et le type Lakehouse Manager (shared).

On the receiving project — Share

Ouvrir un dataset partagé affiche ses détails en mode lecture seule : la configuration du dataset et la structure des tables restent gérées depuis le projet source. Les tables associées peuvent être prévisualisées en cliquant sur l'icône d'aperçu.

On the receiving project — Share (2)

Le dataset partagé peut être utilisé comme source dans les Connectors et dans Trino, de sorte que les utilisateurs du projet destinataire travaillent avec ses données exactement comme ils le feraient avec un dataset dédié.

Dans l'Explorer

Dans l'Explorer, utilisez l'option list by dataset pour trouver une nouvelle catégorie Shared Datasets. Toutes les tables provenant de datasets partagés avec ce projet sont listées ici.

In the Explorer — Share
Info

Les tables de datasets partagés ne peuvent être interrogées qu'à l'aide de l'éditeur SQL. La prise en charge du visual builder n'est pas encore disponible.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

1 : S3 est une marque déposée appartenant à Amazon Technologies, Inc. Les services de OVHcloud ne sont pas sponsorisés, approuvés, ou affiliés de quelque manière que ce soit.

Cette page vous a-t-elle aidé ?