For AI agents: the complete documentation index is available at https://docs.ovhcloud.com/fr/llms.txt, the full documentation bundle is available at https://docs.ovhcloud.com/fr/llms-full.txt, and this page is available as Markdown at https://docs.ovhcloud.com/fr/guides/public-cloud/data-platform/dpe-spark-history-server.md.

Spark History Server

Voir en Markdown

Il s'applique aux actions basées sur PySpark (Load PySpark, Aggregate PySpark, Custom PySpark) et aux workflows qui les exécutent

Objectif

Le Spark History Server vous permet d'inspecter l'historique d'exécution de vos jobs Spark directement depuis le Data Processing Engine, sans avoir à mettre en place d'outillage externe.

Il s'applique aux actions basées sur PySpark (Load PySpark, Aggregate PySpark, Custom PySpark) et aux workflows qui les exécutent. Il ne couvre pas les notebooks.

Une fois activé, chaque job PySpark enregistre ses event logs. Vous démarrez le serveur lorsque vous devez les consulter, parcourir vos exécutions récentes, ouvrir l'interface Spark UI de chaque exécution (en direct ou terminée), l'analyser avec DataFlint, et appliquer des règles de rétention pour maîtriser le stockage.

Vue d'ensemble du Spark history server
Info

Le serveur est facturé par DPU pendant sa durée de fonctionnement. Il ne fonctionne qu'à la demande et s'arrête automatiquement après une période d'inactivité, afin que vous ne payiez pas pour du temps d'inactivité.

Démarrer et arrêter le serveur

Le History Server ne fonctionne que lorsque vous en avez besoin. Utilisez le bouton Start en haut à droite de la page pour le lancer ; son statut (Stopped / Running), sa durée de fonctionnement et le temps restant avant l'arrêt automatique s'affichent à côté.

Le serveur s'arrête de lui-même après la période d'inactivité définie dans les Preferences, afin qu'il ne reste jamais actif plus longtemps que nécessaire. Vous pouvez également l'arrêter manuellement à tout moment.

Overview

L'onglet Overview résume votre environnement et liste vos exécutions Spark récentes.

Statistics

Le panneau Statistics vous donne un aperçu de votre environnement :

  • Applications : nombre total d'applications et combien sont actuellement en cours.
  • Storage : taille totale des event logs stockés et la quantité en attente de nettoyage.
  • Activity : heure de la dernière exécution et durée d'exécution Spark moyenne.

Recent applications

Le tableau Recent applications liste vos exécutions Spark les plus récentes avec leur nom d'action ou de workflow, leur numéro de job, leur Spark app ID, leur statut, la fin d'exécution, la durée d'exécution Spark, et la taille.

Depuis chaque ligne, vous accédez en un clic à :

  • Spark UI : l'interface Spark standard pour explorer les stages, les tasks et les détails d'exécution.
  • DataFlint : une vue d'analyse enrichie avec des insights de performance et des conseils d'optimisation, propulsée par le projet open-source DataFlint.

L'ouverture de Spark UI vous donne accès à l'interface Spark standard complète pour l'exécution, où vous pouvez explorer les jobs, les stages et les tasks :

Recent applications — Spark history server spark ui

DataFlint superpose des insights de performance et des conseils d'optimisation sur cette même exécution :

Recent applications — Spark history server dataflint
Info

Vous pouvez également accéder à une exécution spécifique depuis la page Jobs : sélectionnez un job Spark (une action ou un workflow PySpark) pour l'ouvrir dans le Spark History Server.

Suivre les jobs en cours

Les jobs en cours d'exécution apparaissent en haut du tableau, marqués comme live. Dès que l'interface d'un job est prête, vous pouvez ouvrir sa Spark UI en direct et sa vue DataFlint sans attendre la fin de l'exécution.

Info

Les interfaces en direct ne sont disponibles pour les jobs en cours que si l'option Live Spark UI est activée dans les Preferences.

Preferences

L'onglet Preferences contrôle ce qui est capturé, la taille du serveur, le moment où il s'arrête, et la durée de conservation des logs.

Preferences — Spark history server preferences

Event logs

Activé par défaut. Enregistre l'activité détaillée de chaque job PySpark pour analyse dans le Spark History Server, y compris les insights de performance et les conseils d'optimisation propulsés par DataFlint.

Lorsque cette option est désactivée, l'analyse n'est pas disponible pour les prochains jobs. L'historique des exécutions existantes est conservé.

Info

Les event logs sont stockés dans le bucket S31 DPE de votre projet. Les règles de Retention ci-dessous contrôlent la part de ce stockage qu'ils utilisent.

Live Spark UI

Désactivé par défaut. Expose la Spark UI en direct des jobs PySpark afin que vous puissiez les observer s'exécuter sans attendre les event logs. Le paramètre s'applique aux prochaines exécutions.

Ressources du serveur et arrêt automatique

  • Server resources : la puissance de calcul allouée au serveur, de 1 à 4 DPU. Le changement s'applique au prochain démarrage du serveur.
  • Auto-stop : arrête automatiquement le serveur après la période d'inactivité sélectionnée. Options : Never, After 2 hours, ou After 8 hours. La valeur par défaut est 24 hours.

Retention

Les event logs sont nettoyés automatiquement chaque jour. Une application est supprimée dès qu'elle dépasse l'une des limites activées ci-dessous ; les applications les plus récentes sont toujours conservées. Définissez une limite sur 0 (ou Unlimited) pour la désactiver. Utilisez Clean up now pour lancer le nettoyage immédiatement.

  • Retention (days) : durée de conservation des applications. Options : 7 (par défaut), 30, 90, 365, ou Unlimited.
  • Maximum applications kept : options 100 (par défaut), 10, 50, 100, 500, ou Unlimited.
  • Maximum total size : options 1, 5, 10, ou 50 GB, ou Unlimited.

Aller plus loin

Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.

Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.

Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.

Rejoignez notre communauté d'utilisateurs.

1 : S3 est une marque déposée appartenant à Amazon Technologies, Inc. Les services de OVHcloud ne sont pas sponsorisés, approuvés, ou affiliés de quelque manière que ce soit.

Cette page vous a-t-elle aidé ?