For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/developers-python-sdk-reference.md.

Référence du SDK : connect et bulk_insert

Voir en Markdown

Les deux fonctions par lesquelles commence chaque script du Custom Actions SDK : connect() pour accéder à un dataset, une table, un bucket ou une source

Objectif

Les deux fonctions par lesquelles commence chaque script du Custom Actions SDK : connect() pour accéder à un dataset, une table, un bucket ou une source, et bulk_insert() pour réécrire un dataframe.

La fonction connect

La fonction connect() est, la plupart du temps, le point d'entrée principal pour interagir avec le projet.

Elle prend une chaîne de connexion en paramètre et retourne un objet Connector.
Par exemple :

from forepaas.dwh import connect

connection_string = "dwh/default_dataset/"
connector_default = connect(connection_string)

Changez la chaîne de connexion pour vous connecter à différentes sources au sein de l'environnement Data Platform.
Par conséquent, l'objet et les méthodes disponibles, retournés par connect(...), seront différents.

Notre article sur les connecteurs et les chaînes de connexion explique chaque option disponible plus en détail et ci-dessous vous trouverez la liste des méthodes pour deux connecteurs courants :

La fonction bulk_insert

La fonction bulk_insert() est un élément très important du SDK. Vous pouvez l'utiliser pour réinsérer des données dans une table. Comme le montre le code ci-dessous, elle prend en paramètres un Connecteur Dataset, un nom de table et un DataFrame pandas.

import pandas as pd
from forepaas.dwh import connect
from forepaas.dwh import bulk_insert

# établit la connexion au dataset par défaut
cn = connect("dwh/default_dataset/")

# extrait les données de la table sans SQL requis
df = cn.select("stations_rides")

# effectue votre transformation personnalisée dans le dataframe
df.loc[df["station_name"] == 'Harlem-Lake', "rides"] = 0

# réinsère votre dataframe dans la table de destination
stats = bulk_insert(cn, "stations_rides", df) 

bulk_insert(connector, table, data, source_default_schema={}, batch_size=None)

Paramètres d'entrée

NomTypeDescriptionExemple
connectorConnectorInstance de connecteur issue de la fonction connect()cn = connect("dwh/default_dataset/")
tablestrnom de la table de destination où les données vont être chargées-
dataframepandas.DataFrameDataframe de données à insérer, doit avoir les mêmes noms et types de colonnes que la table cible.-
default_schemadict--
batch_sizeinttaille du batch d'insertion-

Sortie

TypeDescriptionExemple
Tuple(stats, error)tuple des statistiques de l'insertion-

Support PySpark

La Data Platform propose un support étendu pour manipuler les données avec PySpark. Tout se fait via des méthodes compatibles Spark dans l'objet Connector.
Consultez notre article sur PySpark pour plus de détails.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

Cette page vous a-t-elle aidé ?