Nouveau
Possible en Intra-entreprise

Orchestration de pipelines avec Apache Airflow

Code Formation: 7006

| Ajouter aux favoris
La multiplication des traitements et des flux de données rend nécessaire l’automatisation et la supervision de leur enchaînement. Apache Airflow permet d’orchestrer des workflows complexes, de planifier les traitements, de gérer leurs dépendances et d’en assurer le suivi.
Image
60 % du temps est consacré à des travaux pratiques, permettant aux apprenants de mettre immédiatement en œuvre les notions abordées et de construire progressivement un pipeline complet avec Apache Airflow.

Compétence principale visée

Concevoir, orchestrer et fiabiliser des pipelines de données avec Apache Airflow afin d’automatiser leur exécution et leur exploitation en production

Objectifs pédagogiques

  • Concevoir et planifier des workflows de données sous forme de DAGs
  • Orchestrer et intégrer des traitements en gérant leurs dépendances, leur parallélisation et leurs interactions avec des systèmes externes
  • Superviser et fiabiliser les pipelines afin d'assurer leur bonne exécution et leur reprise en cas d'incident.

Public

  • Data Engineers, Data Scientists et développeurs
  • Ingénieurs DevOps et architectes Data

Prérequis

  • Connaissances de base en Python et en environnement Linux

  • Connaissances des principes fondamentaux des bases de données et du langage SQL 

     

PARTIE 1 - Introduction à Apache Airflow

  • Enjeux de l'orchestration des traitements

  • Positionnement et cas d'usage d'Airflow

  • Concepts fondamentaux : DAG, Task, DAG Run, Task Instance

  • Architecture : Scheduler, DAG Processor, Executor/Workers, Metadata Database, interface Web

TRAVAUX PRATIQUES - Prise en main d'Airflow

  • Découverte de l'environnement

  • Création d'un premier DAG

  • Correction d'une erreur de parsing

  • Déclenchement et suivi d'une exécution

  • Consultation et analyse des logs

PARTIE 2 - Concevoir et planifier un DAG

  • Structure d'un DAG

  • Operators et tâches

  • Dépendances entre tâches

  • Bonnes pratiques : atomicité et idempotence

  • Scheduling et expressions Cron

  • Logical Date et Data Interval

  • Catchup et Backfill

TRAVAUX PRATIQUES - Concevoir et planifier un workflow

  • Création d'un DAG composé de plusieurs tâches

  • Mise en œuvre de dépendances

  • Configuration de différentes planifications

  • Manipulation des Data Intervals

  • Expérimentation du Catchup et du Backfill

PARTIE 3 - Construire des workflows complexes

  • Traitements séquentiels et parallèles

  • Fan-Out / Fan-In

  • Contexte d'exécution

  • XCom et échanges entre tâches

  • Branching et Trigger Rules

TRAVAUX PRATIQUES - Construire un pipeline dynamique

  • Parallélisation de traitements

  • Exploitation du contexte d'exécution

  • Échange d'informations avec XCom

  • Sélection conditionnelle d'un traitement

PARTIE 4 - Intégrer Airflow aux systèmes externes

  • Principe des Providers

  • Operators et Hooks

  • Airflow Connections

  • Connexion aux bases de données

  • Gestion des informations de connexion

TRAVAUX PRATIQUES - Intégration avec PostgreSQL

  • Configuration d'une Connection

  • Utilisation du Provider PostgreSQL

  • Exécution de requêtes SQL depuis un DAG

  • Manipulation d'une connexion avec un Hook

  • Chargement de données dans PostgreSQL

PARTIE 5 - Déclencher des traitements à partir des données

  • Principe des Sensors

  • Attente d'une ressource externe

  • Assets et orchestration orientée données

  • Relations Producer / Consumer entre DAGs

TRAVAUX PRATIQUES - Construire un pipeline piloté par les données

  • Attente de la disponibilité d'un fichier

  • Déclenchement d'un traitement

  • Publication d'un Asset

  • Déclenchement automatique d'un DAG consommateur

PARTIE 6 - Fiabiliser et superviser les pipelines

  • Gestion des erreurs

  • Retries et Retry Delay

  • Timeouts

  • Idempotence et reprise après incident

  • Analyse des logs

  • Relance des traitements

  • Bonnes pratiques d'exploitation

TRAVAUX PRATIQUES - Fiabiliser un pipeline

  • Simulation d'une erreur

  • Configuration des retries

  • Analyse et diagnostic à partir des logs

  • Correction et reprise du traitement 

Alternance d'exposés, illustrations, études de cas, travaux pratiques et échanges avec des experts du domaine Un support de cours sera remis à chacun des participants
Evaluation des acquis de formation
Evaluation des acquis des apprenants réalisée en fin de formation, par un questionnaire contextualisé.
Taux de réussite

94.3% des apprenants ont acquis la compétence principale visée

Résultat obtenu pour 177 participants évalués ayant suivi une formation dans la thématique sur les 5 dernières années

Évaluation de la satisfaction

Evaluation du ressenti des participants en fin de formation (Niveau 1 KIRKPATRICK)

Résultats de l’évaluation

Le niveau de satisfaction globale est évalué à 4.3/5 par les participants.

Evaluations réalisées auprès des 199 participants ayant suivi une formation dans la thématique sur les 5 dernières années

Actualisée le 01-10-2026