SDK des actions personnalisées
Lisez et écrivez les données du projet depuis le code qui s'exécute à l'intérieur.
À quoi sert le SDK
Le Custom Actions SDK est la bibliothèque Python utilisée pour interagir avec un projet depuis le compute propre du projet. Il est disponible dans les actions Custom, les actions Custom PySpark et les notebooks Jupyter intégrés, de sorte que le code puisse être écrit et testé dans un notebook puis collé dans une action sans changement. Lorsqu'une fonction n'est pas disponible dans l'un de ces contextes, sa propre page le précise.
Démarrages rapides
Quatre parcours courts, un par cible : lire un dataset, lire un bucket, lire une source enregistrée, et les variantes PySpark de ces mêmes lectures. Chacun est une action complète que vous pouvez coller et exécuter, et le premier arrêt naturel si vous n'avez jamais utilisé le SDK.
Se connecter aux données du projet
Son point d'entrée est connect(), qui prend une chaîne de connexion et renvoie un connecteur pour ce que cette chaîne désigne : un dataset, une table, un bucket, ou une source enregistrée. L'objet renvoyé diffère selon la cible, c'est pourquoi les guides de connecteurs couvrent chacun séparément. bulk_insert() est l'équivalent pour l'écriture, prenant un dataframe pandas vers une table de destination par lots.
PySpark est géré via des méthodes compatibles Spark sur le même objet connecteur, de sorte qu'une action PySpark lit les tables comme des dataframes Spark plutôt que pandas. La référence du SDK liste toutes les signatures.
Avancé
Ces guides couvrent ce qui rend une action prête pour la production : des variables d'environnement à la place de valeurs codées en dur, la segmentation pour qu'une action devienne des tâches parallèles, la surcharge d'une action Load, l'import de modules Python personnalisés depuis Git, et l'émission d'événements de lineage.
Les exemples de code importent toujours depuis forepaas.*. Ces noms de modules restent inchangés sur la platform aujourd'hui, et les exemples seront mis à jour lorsque le renommage du SDK sera déployé.
Démarrage rapide : dataset→
Un premier script sur une table de projet.
Démarrage rapide : bucket→
Un premier script sur un bucket de projet.
Démarrage rapide : source→
Un premier script sur une source enregistrée.
Démarrage rapide : PySpark→
Un premier script PySpark.
Connecteurs et chaînes de connexion→
Chaque option de chaîne de connexion, et ce que chacune renvoie.
Référence du SDK : connect et bulk_insert→
Les deux fonctions de point d'entrée, avec la signature de bulk_insert.
Suivre le lineage des données→
Émettre du lineage depuis du code personnalisé et des notebooks.
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.