Nouveau
Possible en Intra-entreprise

Apache Spark : développement et optimisation Big Data

Code Formation: 7005

| Ajouter aux favoris
L’augmentation des volumes de données et le développement des architectures Data distribuées nécessitent de disposer d’outils capables de traiter efficacement de grandes quantités de données. Apache Spark s’est imposé comme une technologie majeure pour le traitement distribué, aussi bien en mode batch qu’en temps réel.
Image
60 % de la formation sont consacrés à des travaux pratiques et à une étude de cas fil rouge permettant de concevoir un pipeline Big Data complet, depuis l'ingestion des données jusqu'au déploiement en production

Compétence principale visée

Concevoir, développer et optimiser des traitements Big Data distribués avec Apache Spark afin de les intégrer dans des environnements de production.

Objectifs pédagogiques

  • Développer des traitements distribués performants avec Apache Spark et Spark SQL

  • Optimiser les performances et l'utilisation des ressources d'un cluster Spark

  • Concevoir et déployer des pipelines Big Data robustes intégrés à une plateforme Data moderne

     

Public

  • Data Engineers, Développeurs Big Data,

  • Architectes Data 

  • Data Scientists

  • Développeurs Python ou Scala souhaitant industrialiser leurs traitements de données 

     

Prérequis

  • Bonne maîtrise de Python ou Scala

  • Connaissances de SQL

  • Notions de traitement distribué ou de Big Data 

     

PARTIE 1 - L'architecture Spark et le traitement distribué

  • Les principes fondamentaux de Spark et son architecture

    • Positionnement de Spark dans l'écosystème Big Data

    • Architecture Driver / Executors

    • Gestion des partitions

    • DAG Scheduler

    • Tolérance aux pannes

    • Gestion de la mémoire

    • Exécution distribuée 

TRAVAUX PRATIQUES - Installation d'un environnement Spark 

  • Analyse d'un premier traitement distribué

  • Visualisation de l'exécution avec Spark UI 

PARTIE 2 - Traitements Big Data performants

  • Les pipelines de transformation de données distribués.

    • DataFrames 

    •  Spark SQL

    • Lecture et écriture de données

    • Formats Parquet, JSON et CSV

    • Jointures distribuées

    • Agrégations

    • Fonctions de fenêtres

    • Catalyst Optimizer 

TRAVAUX PRATIQUES - Développement d'un pipeline ETL distribué 

  • Traitement d'un jeu de données volumineux

  • Optimisation d'une requête Spark SQL 

PARTIE 3 - Les performances en production

  • Goulots d'étranglement et performances des traitements
    • Partitionnement

    • Broadcast Join

    • Cache et Persistence

    • Shuffle

    • Optimisation mémoire

    • Monitoring

    • Spark History Server

    • Analyse des performances 

TRAVAUX PRATIQUES - Diagnostic d'un traitement lent 

  • Optimisation progressive des performances 

  • Comparaison avant / après optimisation 

PARTIE 4 - Industrialiser les traitements Big Data

  • Déployer Spark dans une architecture Data moderne
    • Spark et Data Lake 

    • Spark et Kafka 

    • Structured Streaming 

    • Déploiement sur Kubernetes

    • Bonnes pratiques d'industrialisation 

    • Monitoring 

    • Exploitation en production

TRAVAUX PRATIQUES - Étude de cas fil rouge 

  • Conception complète d'une plateforme Big Data permettant 
    • l'ingestion des données,

    • la transformation distribuée des données,

    • le traitement temps réel, 

    • la supervision des données,

    • le déploiement sur une infrastructure Cloud-native. 

Alternance d'exposés, illustrations, études de cas, travaux pratiques et échanges avec des experts du domaine Un support de cours sera remis à chacun des participants
Evaluation des acquis de formation
Evaluation des acquis des apprenants réalisée en fin de formation, par un questionnaire contextualisé.
Taux de réussite

94.3% des apprenants ont acquis la compétence principale visée

Résultat obtenu pour 177 participants évalués ayant suivi une formation dans la thématique sur les 5 dernières années

Évaluation de la satisfaction

Evaluation du ressenti des participants en fin de formation (Niveau 1 KIRKPATRICK)

Résultats de l’évaluation

Le niveau de satisfaction globale est évalué à 4.3/5 par les participants.

Evaluations réalisées auprès des 199 participants ayant suivi une formation dans la thématique sur les 5 dernières années

Actualisée le 01-10-2026