Data Scientist Industriel
1. Contexte
Le 1817 est la digital factory du groupe Vicat, présent dans 12 pays. Entité autonome dans son fonctionnement et ses méthodes, elle réunit trois conditions rarement présentes ensemble : la capacité d’innover et d’itérer vite, un terrain d’application immédiat et exigeant, et la solidité d’un groupe industriel international.
Nos sujets partent du terrain industriel : conduite et optimisation de procédés, maîtrise de la qualité, performance énergétique, maintenance, sécurité, supply chain. Les solutions que nous produisons ne sont pas des démonstrateurs : elles sont mises en service sur des sites de production, utilisées quotidiennement par les exploitants, et suivies dans la durée.
Ces solutions ne s’arrêtent pas aux frontières du groupe Vicat. Les produits et services que nous développons ont tous vocation à être proposés à des acteurs externes, plusieurs le sont déjà. Cette double destination change la manière de concevoir : ce que nous construisons doit être suffisamment robuste, générique et documenté pour fonctionner ailleurs que sur le site où il a été imaginé.
Le portefeuille de cas d’usage est en croissance rapide afin de couvrir l’ensemble des fonctions, de la conduite d’installation aux fonctions support. Les sujets ne manquent pas ; l’enjeu est d’en transformer le plus grand nombre en solutions réellement utilisées.
L’équipe réunit des chefs de projet, des responsables de déploiement, des data scientists, des développeurs et des ingénieurs plateforme, qui travaillent ensemble sur l’ensemble du cycle de vie de nos solutions.
2. Missions principales
a) Concevoir, développer et valider les solutions algorithmiques exploitant les données industrielles : modèles d’apprentissage, algorithmes d’optimisation et d’aide à la décision, ou combinaison des deux — un modèle appris pouvant servir de modèle interne à une boucle d’optimisation. Ces solutions sont pensées dès l’origine pour être reproductibles au-delà de leur site ou de leur client d’origine.
b) Déployer ces solutions et en assurer le maintien en condition opérationnelle : suivi de performance en exploitation, diagnostic des écarts, recalibrage et évolution, en co-responsabilité avec l’ingénieur ML/DevOps.
c) Apporter au chefs de projet un appui sur la faisabilité technique : disponibilité et qualité de la donnée nécessaire, choix de l’approche algorithmique, limites de la solution, estimation de charge.
d) Capitaliser sur les développements et diffuser les pratiques au sein de l’équipe : briques algorithmiques réutilisables, revues de code, veille technologique, partage de connaissances.
3. Activités détaillées
Les éléments ci-dessous sont donnés à titre illustratif et non limitatif . Selon les projets, le poste mobilise tout ou partie de ces domaines ; il n’est pas attendu qu’un candidat les maîtrise tous .
3.1 De la donnée à la solution algorithmique
Préparation et qualification de la donnée
Extraction et consolidation de données issues des historiques de procédé, des systèmes de gestion, des laboratoires qualité et des capteurs de terrain
Qualification des données : détection de valeurs aberrantes, de gels et de dérives capteurs, traitement des données manquantes, resynchronisation temporelle
Construction de variables explicatives s’appuyant sur la connaissance du procédé
Constitution de jeux de données documentés et reproductibles
Domaines d’application, selon les sujets
Données de procédé et séries temporelles : capteurs logiciels (soft sensors), prédiction de qualité et de consommation, détection d’anomalies et de dérives, séries temporelles multivariées, prévision
Optimisation et aide à la décision : formulation de problèmes sous contraintes, fonctions de coût multi-objectifs, arbitrage entre contraintes dures et souples, optimisation temps réel (RTO) et commande prédictive (MPC), ordonnancement et planification
Vision par ordinateur : contrôle qualité matière et produit, surveillance d’équipements et d’installations, analyse d’images et de flux vidéo, applications sécurité
Données de gestion et tabulaires : maintenance, énergie, achats, logistique
Dans tous les cas
Choix argumenté de l’approche algorithmique, en tenant compte du niveau de complexité réellement nécessaire
Articulation entre apprentissage et optimisation lorsque le sujet s’y prête : construction d’un modèle de comportement à partir des données, puis exploitation de ce modèle au sein d’une boucle de décision ou de commande
Conception orientée réutilisation : paramétrage plutôt que valeurs figées dans le code, robustesse à un contexte de données différent de celui d’origine, procédure de recalibrage et d’adaptation documentée pour un nouveau site ou un nouveau client
Validation rigoureuse : protocoles d’évaluation adaptés au cas d’usage, quantification de l’incertitude, analyse des modes de défaillance de la solution
Confrontation systématique des résultats à la réalité physique du procédé et au jugement des exploitants
3.2 Mise en production et maintien en condition opérationnelle
Développement d’un code applicatif de qualité production : structuration, tests, documentation, versionnement
Mise en production des solutions algorithmiques en s’appuyant sur la plateforme, les chaînes d’intégration et de déploiement et les standards fournis par l’ingénieur ML/DevOps