Chargement en cours

Expert Airflow (IT) / Freelance

PARIS, 75
il y a 1 jour

Contexte & Enjeux

  • Dans le cadre du passage à l'échelle de sa plateforme Data (croissance rapide de 100 à plus de 500 DAGs en production), l'environnement AWS MWAA du client subit des ralentissements majeurs et une instabilité récurrente.

  • L'équipe technique dispose déjà d'un premier historique de recommandations, mais fait face à un effet de balancier : la résolution d'une anomalie en entraîne de nouvelles. L'objectif actuel est de sortir d'un mode uniquement réactif (pompier) pour reprendre la main de manière proactive sur la plateforme, comprendre les fondements infra/système, et offrir une sérénité totale sur le delivery et les déploiements.

  • Missions & Responsabilités

  • Le consultant aura les mains libres et la responsabilité directe de la stabilité de la plateforme Airflow, en lien étroit avec les équipes Ops et Tech Lead :

Urgence & Stabilisation Immédiate (Court Terme) :

  • Réaliser un diagnostic flash des métriques de production et traiter la cause racine des pannes récurrentes (No space left on device, Deadlocks BDD, blocages Virtual Hand, dérives de parsing DagBag).

  • Isoler et corriger les comportements asynchrones non reproductibles (erreurs survenant uniquement en production liées aux dépendances de plugins).

  • Apporter des correctifs opérationnels immédiats pour restaurer la fiabilité des exécutions.

  • Audit Infra, Tuning & Proactivité (Moyen Terme) :

  • Évaluer le dimensionnement global de MWAA (arbitrage et réglages des instances, scaling horizontal vs vertical des workers, allocation de mémoire/CPU, gestion des slots et de la concurrence).

  • Mettre en place et affiner l'observabilité de l'infrastructure via AWS CloudWatch (suivi du heartbeat du Scheduler, des connexions MetaDB, de la charge des workers) pour détecter les anomalies avant la panne.

  • Analyser l'impact du code des DAGs sur la plateforme (distinction entre temps de parsing et temps d'exécution, suppression du code top-level bloquant, accompagnement sur l'usage des DAG Factory).

Pérennisation & Trajectoire Future (Long Terme) :

  • Définir la trajectoire d'évolution infra, notamment la sortie des workers vers des conteneurs Docker pour isoler les traitements.

  • Garantir la sécurité et la fiabilité des déploiements dans la CI/CD pour que les équipes projets puissent délivrer leurs pipelines sans risquer de déstabiliser la plateforme.

  • Transmettre les bonnes pratiques de configuration aux équipes en place.

#J-18808-Ljbffr
Entreprise
Onyx-Conseil
Plateforme de publication
WHATJOBS
Soyez le premier à postuler aux nouvelles offres
Soyez le premier à postuler aux nouvelles offres
Créez gratuitement et simplement une alerte pour être averti de l’ajout de nouvelles offres correspondant à vos attentes.
* Champs obligatoires
Ex: boulanger, comptable ou infirmière
Alerte crée avec succès