Ingestion et transformation des données
Faites entrer les données, puis rendez-les exploitables en requêtes.
De la source brute à la table modélisée
L'ingestion vient en premier. Le streaming depuis Apache Kafka connecte un broker en tant que source et maintient une table à jour à partir d'un topic. Le pipeline de supervision de flotte IoT est l'exemple travaillé le plus long, faisant passer des messages d'appareils jusqu'aux dashboards en deux parties, et est ce qui se rapproche le plus ici d'une architecture de référence complète.
La transformation vient ensuite. Les tutoriels sur le SDK Python montrent comment une action personnalisée lit une table, la modifie dans un dataframe et la réécrit. La transformation SQL réalise le même travail en SQL sur le moteur Trino. Les modèles de données avec des jeux de données externes construisent des tables sur des données que la platform ne copie jamais. La segmentation est le chapitre sur la performance : diviser une tâche en tâches parallèles par date, attribut, jeu de fichiers ou compte, à travers sept guides courts couvrant chaque mode.
Lisez-les dans l'ordre pour un pipeline complet, ou choisissez celui qui correspond à la source dont vous disposez.
Diffuser des données depuis Apache Kafka→
Maintenez une table à jour à partir d'un topic.
Construire un pipeline de supervision de flotte IoT→
Des messages d'appareils jusqu'aux dashboards, en deux parties.
Transformer des données avec le SDK Python→
Lisez une table, modifiez-la dans un dataframe, réécrivez-la.
Transformation SQL→
Le même travail en SQL sur le moteur Trino.
Modèles de données avec des jeux de données externes→
Modélisez sur des données que la platform ne copie jamais.
Appliquer la segmentation à vos tâches→
Divisez une tâche en tâches parallèles, sept modes couverts.
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.