Data Engineer Hadoop / PySpark — Datalake d'un grand groupe bancaire (IT)
Vous aimez les plateformes de données qui tournent vraiment en production ? Rejoignez l'équipe qui fait vivre le datalake des fonctions Technologies & Opérations d'un grand groupe bancaire. La DSI fournit aux directions technologiques, aux opérations et à la banque de proximité les applications et les données dont elles ont besoin au quotidien. Le datalake Hadoop en est une pièce centrale : il alimente le pilotage et les usages analytiques de plusieurs directions. Vous intervenez en lien direct avec la production applicative et l'équipe Dev
Ops, au sein d'une équipe IT internationale. Vos principales missions : Concevoir et mettre en production de nouvelles ingestions de données : collecte, préparation, transformation. Maintenir et faire évoluer les outils de gestion des pipelines de données (Py
Spark, shell scripting). Porter auprès de l'équipe Dev
Ops les évolutions nécessaires de la plateforme. Rédiger des spécifications techniques claires et exploitables par l'équipe. Ce que la mission vous apporte : Un datalake en production, avec de vrais volumes et de vrais utilisateurs métier. Une équipe internationale : l'anglais est utilisé au quotidien. Une ouverture vers le cloud (GCP / Big
Query) pour qui veut élargir sa stack. Environnement technique : Hadoop, Py
Spark, Spark, Hive, Python, SQL, Git, Jenkins, Jira, Unix / Linux ? Scrum. Profil candidat: Data Engineer de 3 à 6 ans d'expérience, à l'aise sur une plateforme Hadoop en production. Excellente maîtrise de Hadoop, du développement Python / Py
Spark et de Hive ; bonne connaissance de SQL, Git, Jenkins, Jira et du shell scripting Unix / Linux. Pratique de Scrum. Anglais courant, écrit et oral. Atouts : Indexima, Alteryx, Altair, GCP / Big
Query, bibliothèques Python orientées API.