Senior Full-Stack Engineer, Data platforms (GCP) H/F - IBM FNC (H/F)
En tant qu'ingénieur de données spécialisé dans les plateformes de données de Google, vous serez chargé de concevoir, de développer et de maintenir des solutions d'ingénierie des données au sein de l'écosystème Google Cloud. Vous utiliserez divers services Google pour développer des pipelines de données par lots et en temps réel, effectuer des migrations de données et concevoir des couches de données.
Vos principales responsabilités seront les suivantes :- Conception de pipelines de données : concevoir et développer des solutions d'ingénierie des données à l'aide de services Google tels que Data
Proc, Data
Flow, Pub
Sub, Big
Query, Big
Table, Cloud Spanner, Cloud
SQL et Alloy
DB pour le traitement des données par lots et en temps réel.- Développement de la migration des données : développer et gérer des pipelines de données par lots et en temps réel pour l'entrepôt de données et le lac de données, en garantissant une migration et une intégration efficaces des données.
- Gestion de la plateforme de données : planifier et gérer la plateforme de données à l'aide de Google Cloud Scheduler et de Cloud Composer (Airflow), en garantissant un flux de travail et une gestion des pipelines de données fluides.
- Mise en œuvre de solutions de données : mettre en œuvre des solutions d'ingénierie des données à l'aide de Google Cloud Storage, Big
Table, Big
Query Data
Proc avec Spark et Hadoop, Google Data
Flow avec Apache Beam ou Python, ainsi que d'autres technologies open source.- Optimiser les pipelines de données : optimiser et maintenir les pipelines de données pour garantir leur efficacité, leur évolutivité et leur fiabilité, afin d'assurer une sortie de données de haute qualité.
- Connaissance de l'écosystème Google Cloud : maîtrise de la conception, de la mise en place et de la maintenance de solutions d'ingénierie des données sur l'écosystème Google Cloud, y compris des services tels que Google Data
Proc, Data
Flow, Pub
Sub, Big
Query, Big
Table, Cloud Spanner, Cloud
SQL et Alloy
DB.
- Expérience dans l'utilisation de pipelines de données : maîtrise du développement et de la gestion de pipelines de données par lots et en temps réel pour les entrepôts de données et les lacs de données, y compris la migration et l'intégration des données.
- Connaissance des technologies open source : maîtrise de l'utilisation de Google Cloud Storage, Big
Table, Big
Query Data
Proc avec Spark et Hadoop, Google Data
Flow avec Apache Beam ou Python, ainsi que d'autres technologies open source telles qu'Apache Airflow, dbt, Spark/Python ou Spark/Scala.
- Expérience en gestion de plateformes de données : compréhension de la planification et de la gestion de la plateforme de données à l'aide de Google Cloud Scheduler et Cloud Composer (Airflow).
- Connaissance des solutions d'ingénierie des données : maîtrise de la mise en œuvre de solutions d'ingénierie des données à l'aide de divers services Google et de technologies open source.
- Maîtrise d'Apache Airflow : une expérience de l'utilisation d'Apache Airflow pour la planification et la gestion de pipelines de données est un atout. Une bonne connaissance de Cloud Composer (Airflow) est également souhaitable.
- Connaissance de dbt : une expérience avec dbt et son application dans les solutions d'ingénierie des données est un atout.
- Connaissance de Spark/Scala : une expérience avec Spark/Scala est un atout pour le développement et la gestion de pipelines de données.