Spark History Server
Il s'applique aux actions basées sur PySpark (Load PySpark, Aggregate PySpark, Custom PySpark) et aux workflows qui les exécutent
Objectif
Le Spark History Server vous permet d'inspecter l'historique d'exécution de vos jobs Spark directement depuis le Data Processing Engine, sans avoir à mettre en place d'outillage externe.
Il s'applique aux actions basées sur PySpark (Load PySpark, Aggregate PySpark, Custom PySpark) et aux workflows qui les exécutent. Il ne couvre pas les notebooks.
Une fois activé, chaque job PySpark enregistre ses event logs. Vous démarrez le serveur lorsque vous devez les consulter, parcourir vos exécutions récentes, ouvrir l'interface Spark UI de chaque exécution (en direct ou terminée), l'analyser avec DataFlint, et appliquer des règles de rétention pour maîtriser le stockage.
Le serveur est facturé par DPU pendant sa durée de fonctionnement. Il ne fonctionne qu'à la demande et s'arrête automatiquement après une période d'inactivité, afin que vous ne payiez pas pour du temps d'inactivité.
Démarrer et arrêter le serveur
Le History Server ne fonctionne que lorsque vous en avez besoin. Utilisez le bouton Start en haut à droite de la page pour le lancer ; son statut (Stopped / Running), sa durée de fonctionnement et le temps restant avant l'arrêt automatique s'affichent à côté.
Le serveur s'arrête de lui-même après la période d'inactivité définie dans les Preferences, afin qu'il ne reste jamais actif plus longtemps que nécessaire. Vous pouvez également l'arrêter manuellement à tout moment.
Overview
L'onglet Overview résume votre environnement et liste vos exécutions Spark récentes.
Statistics
Le panneau Statistics vous donne un aperçu de votre environnement :
- Applications : nombre total d'applications et combien sont actuellement en cours.
- Storage : taille totale des event logs stockés et la quantité en attente de nettoyage.
- Activity : heure de la dernière exécution et durée d'exécution Spark moyenne.
Recent applications
Le tableau Recent applications liste vos exécutions Spark les plus récentes avec leur nom d'action ou de workflow, leur numéro de job, leur Spark app ID, leur statut, la fin d'exécution, la durée d'exécution Spark, et la taille.
Depuis chaque ligne, vous accédez en un clic à :
- Spark UI : l'interface Spark standard pour explorer les stages, les tasks et les détails d'exécution.
- DataFlint : une vue d'analyse enrichie avec des insights de performance et des conseils d'optimisation, propulsée par le projet open-source DataFlint.
L'ouverture de Spark UI vous donne accès à l'interface Spark standard complète pour l'exécution, où vous pouvez explorer les jobs, les stages et les tasks :
DataFlint superpose des insights de performance et des conseils d'optimisation sur cette même exécution :
Vous pouvez également accéder à une exécution spécifique depuis la page Jobs : sélectionnez un job Spark (une action ou un workflow PySpark) pour l'ouvrir dans le Spark History Server.
Suivre les jobs en cours
Les jobs en cours d'exécution apparaissent en haut du tableau, marqués comme live. Dès que l'interface d'un job est prête, vous pouvez ouvrir sa Spark UI en direct et sa vue DataFlint sans attendre la fin de l'exécution.
Les interfaces en direct ne sont disponibles pour les jobs en cours que si l'option Live Spark UI est activée dans les Preferences.
Preferences
L'onglet Preferences contrôle ce qui est capturé, la taille du serveur, le moment où il s'arrête, et la durée de conservation des logs.
Event logs
Activé par défaut. Enregistre l'activité détaillée de chaque job PySpark pour analyse dans le Spark History Server, y compris les insights de performance et les conseils d'optimisation propulsés par DataFlint.
Lorsque cette option est désactivée, l'analyse n'est pas disponible pour les prochains jobs. L'historique des exécutions existantes est conservé.
Les event logs sont stockés dans le bucket S31 DPE de votre projet. Les règles de Retention ci-dessous contrôlent la part de ce stockage qu'ils utilisent.
Live Spark UI
Désactivé par défaut. Expose la Spark UI en direct des jobs PySpark afin que vous puissiez les observer s'exécuter sans attendre les event logs. Le paramètre s'applique aux prochaines exécutions.
Ressources du serveur et arrêt automatique
- Server resources : la puissance de calcul allouée au serveur, de 1 à 4 DPU. Le changement s'applique au prochain démarrage du serveur.
- Auto-stop : arrête automatiquement le serveur après la période d'inactivité sélectionnée. Options : Never, After 2 hours, ou After 8 hours. La valeur par défaut est 24 hours.
Retention
Les event logs sont nettoyés automatiquement chaque jour. Une application est supprimée dès qu'elle dépasse l'une des limites activées ci-dessous ; les applications les plus récentes sont toujours conservées. Définissez une limite sur 0 (ou Unlimited) pour la désactiver. Utilisez Clean up now pour lancer le nettoyage immédiatement.
- Retention (days) : durée de conservation des applications. Options : 7 (par défaut), 30, 90, 365, ou Unlimited.
- Maximum applications kept : options 100 (par défaut), 10, 50, 100, 500, ou Unlimited.
- Maximum total size : options 1, 5, 10, ou 50 GB, ou Unlimited.
Aller plus loin
Si vous avez besoin d'une formation ou d'une assistance technique pour la mise en oeuvre de nos solutions, contactez votre commercial ou cliquez sur ce lien pour obtenir un devis et demander une analyse personnalisée de votre projet à nos experts de l’équipe Professional Services.
Posez vos questions, faites-nous part de vos commentaires et interagissez directement avec l’équipe qui développe la Data Platform sur le canal Discord dédié.
Si vous avez besoin d'une assistance concernant vos services OVHcloud, créez une demande depuis notre centre d'aide.
Rejoignez notre communauté d'utilisateurs.
1 : S3 est une marque déposée appartenant à Amazon Technologies, Inc. Les services de OVHcloud ne sont pas sponsorisés, approuvés, ou affiliés de quelque manière que ce soit.