Gérer les tables dans le Lakehouse Manager
Lorsque vous accédez à l'onglet Tables, vous serez en mode d'affichage Canvas, sélectionné par défaut
Objectif
Les Tables vous offrent un contrôle total sur votre data lake / data warehouse (tables et attributs) en fournissant une structure visuelle et logique des tables au sein des datasets sur un seul écran.
Lorsque vous accédez à l'onglet Tables, vous serez en mode d'affichage Canvas, sélectionné par défaut. Ce mode d'affichage est conçu pour offrir une représentation visuelle de vos données. Cependant, cette représentation peut devenir difficile à suivre s'il y a trop de tables. C'est pourquoi nous proposons également le mode d'affichage Liste.
Notez que certaines fonctionnalités ne sont disponibles que dans l'un des modes d'affichage. Par exemple, lier des tables de datasets externes n'est possible qu'en vue Canvas.
Créer une table
Survolez l'icône + (ou le bouton New table si vous êtes en mode liste) pour voir les options de création d'une nouvelle table sur le schéma :
- Créer une table en téléversant un fichier
- Créer une table à partir d'une source
- Créer une table vide
Le tutoriel de démarrage contient le guide étape par étape pour créer une table à partir d'une source et créer une table vide. Voyons ici comment créer une table en téléversant un fichier :
- Cliquez sur ➕ et sélectionnez - Upload a file
- Téléversez le fichier à l'aide des options affichées à l'écran. (La prise en charge actuelle concerne les fichiers CSV et XLSX)
- Définissez le nom et les autres paramètres de la table puis cliquez sur create.
Le fichier téléversé passera maintenant par l'analyzer et un processus d'extraction de méta, et une tâche sera déclenchée qui construira la table et la chargera avec les données.
Pourquoi déclarer une table dans le catalogue logique
L'onglet Tables n'est pas une simple couche cosmétique au-dessus d'Iceberg : c'est la source unique de métadonnées sur laquelle repose le reste de la platform.
- Identity Access Manager : policy tags et conditions CEL (Advanced Data Access Control)
- Lineage inter-composants : la page Attributes
- Sémantique métier : dimensions et mesures, dictionnaires, liens parent/enfant
- Découverte : l'Explorer et le canvas
- Intégrations : Analytics Manager et Machine Learning Manager
Une table créée avec un CREATE TABLE direct (depuis Superset ou une action Custom SQL) existe bien dans Iceberg, mais reste orpheline côté platform : invisible dans les UI, en dehors de la gouvernance, et en dehors du lineage.
Rendre visible une table créée en externe
Pour intégrer une telle table dans le catalogue logique, vous pouvez :
- La déclarer dans Tables avant d'écrire : créez la table vide (ou définissez-la comme cible logique de votre action), puis écrivez dedans ; ou
- Exécuter un Update Metadata après coup pour prendre en compte une table déjà écrite.
Nous étudions si cette étape peut être simplifiée via un catalogue unifié. En attendant, déclarer la table en amont est la méthode fiable.
Tables
Le Lakehouse Manager a été construit dans l'optique d'encourager les utilisateurs à adopter les meilleures pratiques en matière de gestion des données. Les tables du Lakehouse Manager sont presque identiques à vos tables de base de données SQL habituelles (en fait, elles sont implémentées à l'aide de SQL).
Sur l'interface du Lakehouse Manager, lorsque vous survolez une table (vue Liste) ou cliquez dessus (vue Canvas), vous verrez qu'une série de boutons s'affiche. Vous pouvez les utiliser pour interagir avec la table ; voici quelques interactions courantes :
-
➕ - ajouter un attribut (peut être une dimension ou une mesure).
-
🔍 - prévisualiser la table dans l'Explorer.
-
✏️ - éditer la table.
-
▶️ - construire la table.
-
🗑 - supprimer la table.
Consultez la documentation détaillée complète ici
Lier des tables parent et enfant
Cette fonctionnalité n'est disponible qu'en mode canvas.
Lier des tables n'est possible que pour les tables de datasets externes
Le Lakehouse Manager vous permet de lier une table (le parent) à d'autres tables (tables enfants) afin de modéliser un système de type « héritage » pour les informations de votre data warehouse.
Concrètement, cela permet de centraliser les informations dans une seule table référentielle - la table parent - qui est à son tour référencée dans de nombreuses autres tables enfants via des ID. Lier des tables permet d'automatiser la configuration des actions Aggregate (qui vous permettent de joindre plusieurs tables en une seule table agrégée lors de leur exécution) lorsque vous les créez dans le Data Processing Engine
La ou les clés primaires de la table parent doivent être présentes dans la table enfant - si ce n'est pas le cas, elles seront automatiquement créées lors de la liaison des deux tables.
Par exemple, si vous représentez un article de presse dans vos données. Il existe une table appelée articles avec les champs article_id, headline, content, date et author. Mais au lieu de placer un nom dans le champ author, vous pourriez avoir la valeur ID d'un utilisateur dans une table séparée authors avec des champs tels que author_id, first_name, et last_name. Ainsi, si vous devez mettre à jour le nom d'un auteur, vous n'avez besoin de le faire que dans la table authors (parent) ; car la table articles (enfant) ne contient que l'ID de l'enregistrement de l'auteur correspondant.
Liez une table parent à une table enfant en cliquant sur le cercle blanc en bas de la table parent (1) et en faisant glisser la flèche vers la table enfant (2).
En règle générale, il est préférable de commencer par la table qui contient toutes les données de référence, et de la lier à une table qui ne contient qu'un ID référençant cette table initiale.
Conventions de nommage
Lors du nommage des tables et des attributs dans le Lakehouse Manager, il est important de suivre certaines conventions et d'éviter certains mots réservés spécifiques pour éviter des problèmes inattendus. Ces restrictions découlent principalement des implémentations SQL sous-jacentes et des bonnes pratiques d'intégrité des données.
- Règles générales de nommage :
- Sensibilité à la casse : il est généralement recommandé d'utiliser des minuscules et des underscores (par exemple,
my_table_name,column_id) pour la cohérence et pour éviter d'éventuels problèmes avec les bases de données sensibles à la casse. - Caractères : limitez-vous aux caractères alphanumériques (a-z, 0-9) et aux underscores (
_). Évitez les caractères spéciaux, les espaces ou les tirets, car ils peuvent poser problème dans les requêtes ou les intégrations. - Commencer par une lettre : les noms de table et d'attribut devraient idéalement commencer par une lettre.
- Noms descriptifs : choisissez des noms qui décrivent clairement les données qu'ils contiennent.
- Sensibilité à la casse : il est généralement recommandé d'utiliser des minuscules et des underscores (par exemple,
Mots réservés
Certains mots sont réservés par le système de base de données sous-jacent ou ont une signification particulière au sein du Lakehouse Manager. Utiliser ces mots seuls comme nom de table ou d'attribut peut entraîner des erreurs. Cependant, ils peuvent généralement être utilisés comme partie d'un nom plus long (par exemple, count_records est autorisé, mais COUNT ne l'est pas).
Pour garantir la compatibilité, évitez d'utiliser les mots réservés suivants :
Si vous rencontrez une erreur liée à un nom de table ou d'attribut, consultez le tableau ci-dessus. En cas de doute, essayez d'utiliser un nom plus descriptif incluant un préfixe ou un suffixe (par exemple, user_count au lieu de COUNT).
Découvrir le mode canvas
Vous pouvez naviguer dans le schéma en cliquant sur un espace vide du schéma puis en déplaçant votre curseur. S'il y a beaucoup de tables, vous pouvez déplacer la fenêtre de navigation de la vue (indiquée par 2) en cliquant dessus et en déplaçant votre curseur. De plus, vous pouvez zoomer/dézoomer sur votre schéma de données (indiqué par 3).
À tout moment de l'organisation de vos tables, le Lakehouse Manager sauvegarde automatiquement toutes les modifications visuelles de votre schéma de données.
Utilisez les options d'annulation/rétablissement (indiquées par 1) pour revenir en arrière/avancer sur toute modification que vous venez d'effectuer dans le schéma. Vous reviendrez à un état immédiatement antérieur de votre travail, ou avancerez vers celui-ci.
Onglets filtrés
la platform vous permet de choisir de travailler sur un ensemble sélectionné de tables (qui peut être spécifique à une équipe ou à un Projet au sein de votre organisation). Vous pouvez ajouter un nouvel onglet filtré pour cela (indiqué par 6).
Remarque - l'onglet par défaut contient All Tables avec All Users.
Interagir avec une table
Survolez une table avec votre souris pour afficher certaines interactions de table et survolez l'icône ... pour afficher les autres.
Consultez notre documentation sur les interactions de table pour en savoir plus sur les actions disponibles sur une table.
Interagir avec un attribut
En mode d'affichage Canvas, vous pouvez également manipuler facilement les attributs de chaque table. Survoler un attribut avec votre curseur affichera les interactions d'attribut :
-
Le définir comme Primary key en cliquant sur ⭐️ (disponible uniquement pour les tables de datasets externes)
-
Éditer l'attribut en cliquant sur ✏️
-
Supprimer l'attribut 🗑
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.