Apache Spark : développement et optimisation Big Data
Code Formation: 7005
| Ajouter aux favorisCompétence principale visée
Concevoir, développer et optimiser des traitements Big Data distribués avec Apache Spark afin de les intégrer dans des environnements de production.Objectifs pédagogiques
-
Développer des traitements distribués performants avec Apache Spark et Spark SQL
-
Optimiser les performances et l'utilisation des ressources d'un cluster Spark
-
Concevoir et déployer des pipelines Big Data robustes intégrés à une plateforme Data moderne
Public
-
Data Engineers, Développeurs Big Data,
-
Architectes Data
-
Data Scientists
-
Développeurs Python ou Scala souhaitant industrialiser leurs traitements de données
Prérequis
-
Bonne maîtrise de Python ou Scala
-
Connaissances de SQL
-
Notions de traitement distribué ou de Big Data
PARTIE 1 - L'architecture Spark et le traitement distribué
-
Les principes fondamentaux de Spark et son architecture
-
Positionnement de Spark dans l'écosystème Big Data
-
Architecture Driver / Executors
-
Gestion des partitions
-
DAG Scheduler
-
Tolérance aux pannes
-
Gestion de la mémoire
-
Exécution distribuée
-
TRAVAUX PRATIQUES - Installation d'un environnement Spark
-
Analyse d'un premier traitement distribué
-
Visualisation de l'exécution avec Spark UI
PARTIE 2 - Traitements Big Data performants
-
Les pipelines de transformation de données distribués.
-
DataFrames
-
Spark SQL
-
Lecture et écriture de données
-
Formats Parquet, JSON et CSV
-
Jointures distribuées
-
Agrégations
-
Fonctions de fenêtres
-
Catalyst Optimizer
-
TRAVAUX PRATIQUES - Développement d'un pipeline ETL distribué
-
Traitement d'un jeu de données volumineux
-
Optimisation d'une requête Spark SQL
PARTIE 3 - Les performances en production
- Goulots d'étranglement et performances des traitements
-
Partitionnement
-
Broadcast Join
-
Cache et Persistence
-
Shuffle
-
Optimisation mémoire
-
Monitoring
-
Spark History Server
-
Analyse des performances
-
TRAVAUX PRATIQUES - Diagnostic d'un traitement lent
-
Optimisation progressive des performances
-
Comparaison avant / après optimisation
PARTIE 4 - Industrialiser les traitements Big Data
- Déployer Spark dans une architecture Data moderne
-
Spark et Data Lake
-
Spark et Kafka
-
Structured Streaming
-
Déploiement sur Kubernetes
-
Bonnes pratiques d'industrialisation
-
Monitoring
-
Exploitation en production
-
TRAVAUX PRATIQUES - Étude de cas fil rouge
- Conception complète d'une plateforme Big Data permettant
-
l'ingestion des données,
-
la transformation distribuée des données,
-
le traitement temps réel,
-
la supervision des données,
-
le déploiement sur une infrastructure Cloud-native.
-
Evaluation des acquis de formation
Evaluation des acquis des apprenants réalisée en fin de formation, par un questionnaire contextualisé.Taux de réussite
94.3% des apprenants ont acquis la compétence principale visée
Résultat obtenu pour 177 participants évalués ayant suivi une formation dans la thématique sur les 5 dernières années
Évaluation de la satisfaction
Evaluation du ressenti des participants en fin de formation (Niveau 1 KIRKPATRICK)
Résultats de l’évaluation
Le niveau de satisfaction globale est évalué à 4.3/5 par les participants.
Evaluations réalisées auprès des 199 participants ayant suivi une formation dans la thématique sur les 5 dernières années
