Expert Airflow (H/F) (IT) / Freelance
Cherry Pick est à la recherche d'un Expert Airflow (H/F) pour l'un de ses clients qui opère dans le secteur de l'automobile.
Contexte de mission
Dans le cadre de la stabilisation d’une plateforme Amazon Managed Workflows for Apache Airflow (MWAA) rencontrant des dysfonctionnements récurrents, la mission consiste à intervenir en Task Force afin d’identifier les causes racines, rétablir rapidement la stabilité de la plateforme et sécuriser durablement son fonctionnement.
L’intervention nécessite un véritable expert Airflow / MWAA , capable d’aller au-delà du développement de DAGs pour intervenir sur l’architecture, le paramétrage, les performances et les mécanismes internes d’Airflow.
Missions principales et rôle
Réaliser un diagnostic flash des incidents, dysfonctionnements et goulots d’étranglement.
Identifier les causes racines des problèmes rencontrés.
Mettre en œuvre des correctifs immédiats afin de restaurer la stabilité de la plateforme.
Reprendre et analyser les conclusions des expertises précédentes.
Auditer l’architecture, la configuration et le paramétrage de l’environnement MWAA.
Analyser les problématiques liées aux Schedulers, Executors, Celery et à la base de métadonnées Airflow .
Investiguer les problématiques de parallélisme, mémoire, ressources et dimensionnement.
Analyser les logs et métriques afin d’identifier les problèmes de performance.
Investiguer notamment les fuites mémoire, locks BDD, problèmes de capacité et d’auto-scaling MWAA .
Construire une feuille de route corrective priorisée .
Piloter la mise en œuvre des actions de remédiation.
Mesurer l’efficacité des corrections via des KPIs de performance et de stabilité .
Accompagner les équipes internes dans l’application des bonnes pratiques Airflow / MWAA.
Contribuer à la pérennisation de la plateforme et à l’amélioration de son architecture.
Objectifs
Court terme : rétablir rapidement la stabilité et la disponibilité de la plateforme MWAA.
Moyen terme : identifier précisément les causes structurelles des dysfonctionnements.
Long terme : mettre en place une architecture et une configuration robustes, performantes et maintenables.
Réduire durablement le taux d’incidents et les problèmes de performance.
Transférer l’expertise aux équipes en place.