For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/connectors-sources-kafka.md.

Diffuser des événements Apache Kafka dans la Data Platform

Voir en Markdown

Apache Kafka est un magasin d'événements distribué et une platform de traitement de flux développée par l'Apache Software Foundation

Objectif

Apache Kafka est un magasin d'événements distribué et une platform de traitement de flux développée par l'Apache Software Foundation. Grâce au connecteur Kafka, vous pouvez vous connecter à votre serveur Kafka et intégrer en temps réel les données que vous recevez sur le serveur à votre Projet.

Kafka dans le store
Info

Dans cet article, nous partons du principe que vous connaissez les concepts de base d'Apache Kafka, tels que les messages et les offsets. Si ce n'est pas le cas, sachez simplement que les serveurs Apache Kafka stockent les données qu'ils reçoivent dans différents topics et que ces données arrivent sous forme de petits blocs appelés messages. Pour garder une trace de l'ordre d'arrivée des messages, chacun d'eux possède un numéro d'offset, plus il est bas, plus le message est arrivé tôt.

Ajouter une source Kafka sur la Platform

Vue d'ensemble de l'écran de configuration

Une fois que vous avez trouvé Kafka dans le Platform store, cliquez sur Select et vous pourrez voir l'écran de configuration comme indiqué ci-dessous :

Écran de configuration Kafka

Pour vous connecter à votre serveur, vous devrez indiquer l'adresse du serveur et, si le serveur le requiert, le nom d'utilisateur ainsi que le mot de passe.

Configurer vos topics

Une fois la connexion avec votre serveur établie avec succès, vous pouvez sélectionner les topics dont vous souhaitez récupérer les données en cochant les cases à leur gauche.

Écran des topics Kafka

Si un topic est coché, vous pouvez le survoler et cliquer sur l'icône en forme de stylo pour configurer la façon dont les données qu'il reçoit seront transférées vers la Platform (la politique d'offset par défaut).

Configuration des topics Kafka

Il existe deux options par défaut de politique d'offset :

  • Latest : lit les données en temps réel au fur et à mesure de leur arrivée. Les messages plus anciens seront ignorés.
  • Earliest : commence à lire les données à partir du message le plus ancien du topic. Une fois que tous les messages du topic ont été lus, tous les nouveaux messages seront lus en temps réel (de façon similaire à latest).
Info

Vous avez également la possibilité de commencer la lecture à partir d'un offset personnalisé, mais cette option n'est pas configurée au niveau du connecteur mais au niveau du job de traitement. C'est pourquoi elle est expliquée dans le tutoriel complet Apache Kafka

Lorsque vous chargez des données provenant d'une source Kafka dans une table du Lakehouse Manager via le Data Processing Engine, le dernier offset lu est stocké dans les métadonnées de la table de destination. Cela signifie que :

  • si vous reprenez l'ingestion de messages dans cette même table, l'ingestion démarrera au dernier message lu
  • si vous démarrez l'ingestion de messages dans une nouvelle table de destination, l'ingestion démarrera au paramètre par défaut configuré soit au niveau du connecteur (offset latest/earliest), soit au niveau du job (offset personnalisé)

Formats de messages pris en charge

La Platform prend en charge les types de messages suivants en entrée pour l'analyse des métadonnées et l'ingestion :

Formats JSON plats

{
'key':'value',
'anotherkey':'anothervalue'
}

Formats de messages non pris en charge

Actuellement, la Platform ne prend pas en charge les formats suivants :

Chaînes de caractères simples

'example message'

Messages imbriqués

{
'key':'value',
'nestedkey':{
'a':'b'
}
}
Info

N'hésitez pas à nous contacter en nous envoyant une demande si le format que vous utilisez n'est pas encore pris en charge !

Utiliser les données d'Apache Kafka dans la Platform

Si vous souhaitez savoir comment utiliser la connexion Kafka dans le reste de la platform, vous pouvez consulter notre tutoriel Apache Kafka dédié.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

Cette page vous a-t-elle aidé ?