Stage - observabilité de l'ia générative F/H Gratification selon le stage
Votre futur métier
En un coup d’oeil
Développer des solutions numériques innovantes pour accompagner la transition énergétique
Traiter, analyser et sécuriser les données
En détail
Au sein de l'équipe Observabilité de la DSI Enedis, vous contribuerez à construire l'observabilité des services internes d 'intelligence artificielle générative.
Ces services s'appuient notamment sur des modèles de langage ( LLM ) exécutés sur une infrastructure GPU interne et intégrés aux environnements de développement des équipes de la DSI. Une première instrumentation reposant sur OpenTelemetry a déjà été mise en place.
Votre objectif sera de poursuivre cette démarche afin de disposer d'une vision de bout en bout de la qualité de service et de l'utilisation des solutions d'IA generative pour répondre aux 2 questions suivantes :
- Le service fonctionne-t-il correctement ?
- Disponibilité, performance, latence, erreurs, fonctionnement des différents composants et santé de l’infrastructure GPU.
- Comment le service est-il utilisé ?
- Volumétrie, tendances d’adoption, sollicitations des différents modèles et indicateurs d’usage agrégés
Ce stage vous permettra de travailler sur un environnement mêlant observabilité, systèmes distribués, intelligence artificielle générative, infrastructures GPU et développement logiciel.
Vos missions 1. Étendre l'observabilité de bout en bout de la chaîne d'IA générative, depuis les environnements de développement jusqu'aux services d'IA, en incluant notamment les serveurs utilisant le Model Context Protocol (MCP) et les composants aujourd'hui non instrumentés.
2. Instrumenter et mesurer les performances des différents composants, notamment l'infrastructure GPU, en vous appuyant sur OpenTelemetry et les capacités d'Elastic Observability. La démonstration de référence OpenTelemetry (OTel Demo 3.0) pourra servir de banc d'essai pour concevoir et valider les instrumentations.
3. Construire des tableaux de bord et indicateurs exploitables permettant de suivre à la fois la santé technique du service et son utilisation : disponibilité, erreurs, latence, consommation des ressources GPU, volumétrie et tendances d'adoption.
Environnement technique
- Observabilité : OpenTelemetry (SDK et Collector), Elastic Observability, Kibana
- IA et infrastructures : vLLM, modèles de langage, serveurs GPU NVIDIA, Kubernetes
- Développement et industrialisation : Python, TypeScript et/ou Go, GitLab CI/CD
- Cloud : AWS
Ce qui vous donnera l'énergie au quotidien
Relever le défi d'innover avec des technologies de pointe
Travailler pour le réseau de distribution le plus intelligent au monde
Avoir un parcours professionnel riche et épanouissant
Développer des solutions numériques innovantes pour accompagner la transition énergétique
Traiter, analyser et sécuriser les données
En détail
Au sein de l'équipe Observabilité de la DSI Enedis, vous contribuerez à construire l'observabilité des services internes d 'intelligence artificielle générative.
Ces services s'appuient notamment sur des modèles de langage ( LLM ) exécutés sur une infrastructure GPU interne et intégrés aux environnements de développement des équipes de la DSI. Une première instrumentation reposant sur OpenTelemetry a déjà été mise en place.
Votre objectif sera de poursuivre cette démarche afin de disposer d'une vision de bout en bout de la qualité de service et de l'utilisation des solutions d'IA generative pour répondre aux 2 questions suivantes :
- Le service fonctionne-t-il correctement ?
- Disponibilité, performance, latence, erreurs, fonctionnement des différents composants et santé de l’infrastructure GPU.
- Comment le service est-il utilisé ?
- Volumétrie, tendances d’adoption, sollicitations des différents modèles et indicateurs d’usage agrégés
Ce stage vous permettra de travailler sur un environnement mêlant observabilité, systèmes distribués, intelligence artificielle générative, infrastructures GPU et développement logiciel.
Vos missions 1. Étendre l'observabilité de bout en bout de la chaîne d'IA générative, depuis les environnements de développement jusqu'aux services d'IA, en incluant notamment les serveurs utilisant le Model Context Protocol (MCP) et les composants aujourd'hui non instrumentés.
2. Instrumenter et mesurer les performances des différents composants, notamment l'infrastructure GPU, en vous appuyant sur OpenTelemetry et les capacités d'Elastic Observability. La démonstration de référence OpenTelemetry (OTel Demo 3.0) pourra servir de banc d'essai pour concevoir et valider les instrumentations.
3. Construire des tableaux de bord et indicateurs exploitables permettant de suivre à la fois la santé technique du service et son utilisation : disponibilité, erreurs, latence, consommation des ressources GPU, volumétrie et tendances d'adoption.
Environnement technique
- Observabilité : OpenTelemetry (SDK et Collector), Elastic Observability, Kibana
- IA et infrastructures : vLLM, modèles de langage, serveurs GPU NVIDIA, Kubernetes
- Développement et industrialisation : Python, TypeScript et/ou Go, GitLab CI/CD
- Cloud : AWS
Relever le défi d'innover avec des technologies de pointe
Travailler pour le réseau de distribution le plus intelligent au monde
Avoir un parcours professionnel riche et épanouissant