Diffuser des événements Apache Kafka dans la Data Platform
Apache Kafka est un magasin d'événements distribué et une platform de traitement de flux développée par l'Apache Software Foundation
Objectif
Apache Kafka est un magasin d'événements distribué et une platform de traitement de flux développée par l'Apache Software Foundation. Grâce au connecteur Kafka, vous pouvez vous connecter à votre serveur Kafka et intégrer en temps réel les données que vous recevez sur le serveur à votre Projet.
Dans cet article, nous partons du principe que vous connaissez les concepts de base d'Apache Kafka, tels que les messages et les offsets. Si ce n'est pas le cas, sachez simplement que les serveurs Apache Kafka stockent les données qu'ils reçoivent dans différents topics et que ces données arrivent sous forme de petits blocs appelés messages. Pour garder une trace de l'ordre d'arrivée des messages, chacun d'eux possède un numéro d'offset, plus il est bas, plus le message est arrivé tôt.
Ajouter une source Kafka sur la Platform
Vue d'ensemble de l'écran de configuration
Une fois que vous avez trouvé Kafka dans le Platform store, cliquez sur Select et vous pourrez voir l'écran de configuration comme indiqué ci-dessous :
Pour vous connecter à votre serveur, vous devrez indiquer l'adresse du serveur et, si le serveur le requiert, le nom d'utilisateur ainsi que le mot de passe.
Configurer vos topics
Une fois la connexion avec votre serveur établie avec succès, vous pouvez sélectionner les topics dont vous souhaitez récupérer les données en cochant les cases à leur gauche.
Si un topic est coché, vous pouvez le survoler et cliquer sur l'icône en forme de stylo pour configurer la façon dont les données qu'il reçoit seront transférées vers la Platform (la politique d'offset par défaut).
Il existe deux options par défaut de politique d'offset :
- Latest : lit les données en temps réel au fur et à mesure de leur arrivée. Les messages plus anciens seront ignorés.
- Earliest : commence à lire les données à partir du message le plus ancien du topic. Une fois que tous les messages du topic ont été lus, tous les nouveaux messages seront lus en temps réel (de façon similaire à latest).
Vous avez également la possibilité de commencer la lecture à partir d'un offset personnalisé, mais cette option n'est pas configurée au niveau du connecteur mais au niveau du job de traitement. C'est pourquoi elle est expliquée dans le tutoriel complet Apache Kafka
Lorsque vous chargez des données provenant d'une source Kafka dans une table du Lakehouse Manager via le Data Processing Engine, le dernier offset lu est stocké dans les métadonnées de la table de destination. Cela signifie que :
- si vous reprenez l'ingestion de messages dans cette même table, l'ingestion démarrera au dernier message lu
- si vous démarrez l'ingestion de messages dans une nouvelle table de destination, l'ingestion démarrera au paramètre par défaut configuré soit au niveau du connecteur (offset latest/earliest), soit au niveau du job (offset personnalisé)
Formats de messages pris en charge
La Platform prend en charge les types de messages suivants en entrée pour l'analyse des métadonnées et l'ingestion :
Formats JSON plats
Formats de messages non pris en charge
Actuellement, la Platform ne prend pas en charge les formats suivants :
Chaînes de caractères simples
Messages imbriqués
N'hésitez pas à nous contacter en nous envoyant une demande si le format que vous utilisez n'est pas encore pris en charge !
Utiliser les données d'Apache Kafka dans la Platform
Si vous souhaitez savoir comment utiliser la connexion Kafka dans le reste de la platform, vous pouvez consulter notre tutoriel Apache Kafka dédié.
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.