STAGE Sciences des Données Connaissance & Classification (F/H)
Poste ouvert aux personnes en situation de handicap.1ère entreprise mondiale au RSCE 2024 pour sa Responsabilité Scientifique
Rejoignez l'équipe de recherche de Dassault Systèmes, acteur clé de l'innovation scientifique et de projets d'envergure internationale comme Living Heart, EPINOV ou MEDITWIN.
L'objectif du stage : Harmoniser les systèmes de classification existants (publications, brevets, domaines de recherche) pour créer une représentation unifiée et exploitable de son positionnement scientifique.
Pourquoi ce stage est unique ?
Impact stratégique : Votre travail permettra de structurer et unifier la connaissance scientifique de Dassault Systèmes, en créant une représentation cohérente de son positionnement mondial.
Technologies de pointe : Utilisez des modèles de langage (LLM), du NLP et du Machine Learning pour résoudre un défi complexe de mapping entre référentiels hétérogènes.
Livrables valorisants : Une note méthodologique (choix de modélisation, limites, recommandations) et un rapport de synthèse pour la direction, visibles en interne.
Pérennité : Votre pipeline sera intégré aux outils internes et documenté pour une réutilisation future.
Vos missions
Plus concrètement, vous aurez pour mission de :- Analyser en profondeur les logiques structurantes des différents référentiels utilisés pour décrire les activités scientifiques et technologiques de Dassault Systèmes, qu'il s'agisse des systèmes de classification propres aux brevets, de ceux utilisés pour indexer les publications scientifiques, ou des nomenclatures thématiques mobilisées par les grands programmes de recherche européens,
- Concevoir une méthodologie de correspondance permettant de relier ces référentiels hétérogènes entre eux, en s'appuyant sur des techniques de traitement du langage naturel et d'apprentissage automatique (similarité sémantique, classification supervisée ou non supervisée, usage de modèles de langage),
- Développer un pipeline capable d'automatiser cette mise en correspondance à partir des données consolidées par les data scientists de l'équipe, puis constituerez une base de données unifiée croisant les différents systèmes de classification, offrant une lecture cohérente et transverse des activités scientifiques et technologiques de Dassault Systèmes.
- Mettre en place un dispositif pérenne : intégration du pipeline dans les outils internes existants, documentation en vue d'une réutilisation future, et recommandations pour le maintien à jour de la base unifiée.
Votre profil
Vous êtes actuellement en Master 2 / Bac+5 (école d'ingénieur ou université) avec une spécialisation en science des données, en traitement automatique du langage ou en intelligence artificielle.
Vous maîtrisez :*
Python (obligatoire)
*
les bibliothèques de traitement de données et de NLP tels que pandas, scikit-learn, spa
Cy, transformers ou équivalents (indispensable)
*
Usage de LLM (BERT, Qwen, etc.) : prompting, sorties structurées
*
les notions de taxonomies, d'ontologies ou de représentations sémantiques (bonne aisance)
De bonnes qualités rédactionnelles en français et en anglais sont également requises pour la formalisation méthodologique.
Les profils curieux des enjeux de structuration et de valorisation de la donnée scientifique, combinant rigueur technique et sens de la synthèse, sont particulièrement encouragés à candidater.\n\n
Nous rejoindre c'est aussi
Intégrer une entreprise scientifique au cœur de l'innovation technologique, portée par une forte croissance depuis plus de 40 ans.
Un environnement collaboratif et innovant
Une collaboration internationale
Une diversité de technologies, produits et solutions
Un engagement fort en faveur de la diversité et de l'inclusion