Chargement en cours

Site Reliability Engineer (SRE) / Ingénieur Production – Observabilité & Fiabilité (H/F) (IT) /[...]

SAINT JEAN DE BRAYE
il y a 15 heures

Contexte :

Dans le cadre du renforcement de son pôle Observabilité & Fiabilité, un acteur majeur de la protection sociale recherche un Site Reliability Engineer (SRE) expérimenté.

Vous rejoindrez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un système d'information critique composé de plusieurs milliers de serveurs et de plus de 160 applications.

Vos missions :

  • Assurer le maintien en conditions opérationnelles des plateformes et infrastructures.
  • Superviser les environnements de production et traiter les alertes et incidents.
  • Diagnostiquer les incidents complexes et coordonner leur résolution.
  • Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.
  • Optimiser les tableaux de bord, métriques et règles d'alerting.
  • Réduire le bruit opérationnel et améliorer l'observabilité des services.
  • Participer aux cellules de crise et aux démarches d'amélioration continue.
  • Automatiser les tâches d'exploitation et contribuer aux pratiques DevOps.
  • Maintenir la documentation technique et les procédures d'exploitation.
  • Participer aux astreintes (1 semaine sur 5).

Environnement technique :

  • Kubernetes
  • Docker
  • Prometheus
  • Grafana
  • Splunk
  • Tempo
  • Linux
  • Windows
  • PostgreSQL
  • MariaDB
  • Python
  • Shell Linux
  • Spring Boot
  • JBoss
  • VMware
  • DevOps
  • ITIL
  • SRE
#J-18808-Ljbffr
Entreprise
Onyx-Conseil
Plateforme de publication
WHATJOBS
Offres pouvant vous intéresser
Soyez le premier à postuler aux nouvelles offres
Soyez le premier à postuler aux nouvelles offres
Créez gratuitement et simplement une alerte pour être averti de l’ajout de nouvelles offres correspondant à vos attentes.
* Champs obligatoires
Ex: boulanger, comptable ou infirmière
Alerte crée avec succès