AI Evaluation Engineer — Agentic Systems (H/F)
NEUILLY SUR SEINE
il y a 1 jour
Dans le cadre de notre croissance et afin de renforcer notre Squad AI Quality & Evaluation, nous recherchons un.e AI Evaluation Engineer — Agentic Systems . Intégré.e au sein de nos équipes, en télétravail avec une flexibilité sur la région parisienne, vous interviendrez sur l'un des métiers les plus stratégiques de l'IA : garantir, mesurer et fiabiliser le comportement des agents et systèmes multi-agents avant leur mise en production. Un domaine qui s'invente aujourd'hui, où vous mettrez en pratique vos acquis en QA et développerez de nouvelles compétences à la frontière de l'IA.
Missions
- Concevoir des stratégies d'évaluation pour agents et systèmes multi-agents : trajectoires, orchestration d'outils (tool use), raisonnement multi-étapes, gestion de mémoire et de contexte
- Évaluer au-delà du résultat final : détecter les échecs intermédiaires, la propagation d'erreurs et les dérives de comportement le long de la trajectoire
- Concevoir et éprouver des workflows agentiques : décomposition de tâches, enchaînement d'agents (planner / executor / critic), points de contrôle et garde-fous
- Construire des jeux de tests et scénarios de simulation d'utilisateurs : personas, cas limites, tests adversariaux
- Exploiter le prompt engineering comme levier d'évaluation : prompts de test, LLM-as-a-judge, rubriques d'évaluation
- Industrialiser l'évaluation dans les pipelines CI/CD : évaluation automatisée, détection de régressions, quality gates avant déploiement
- Définir les métriques qui comptent pour un agent : réussite de tâche, fidélité, robustesse, sécurité, coût, latence, consommation de tokens
- Combiner évaluation automatisée et évaluation humaine (human-in-the-loop), et arbitrer entre les deux
- Documenter et diffuser les bonnes pratiques d'évaluation agentique auprès des équipes
Profil
- Idéalement une première expérience en évaluation de systèmes IA — en poste, en freelance ou même sur un projet personnel sérieux : ce métier s'invente, nous valorisons ce que vous avez déjà exploré par vous-même
- Compréhension de ce qui rend l'évaluation d'un agent spécifique : non-déterminisme, comportement probabiliste, trajectoires multi-étapes, échecs intermédiaires, absence de vérité unique — on n'évalue pas une sortie, on score une trajectoire (chaque appel d'outil, chaque état intermédiaire devient une surface d'évaluation)
- Familiarité avec les approches de scoring : graders à base de règles (code-based), LLM-as-a-judge pour l'ouvert, évaluation humaine — et le bon sens de savoir quand combiner les trois
- Maîtrise réelle d'au moins un framework ou plateforme d'évaluation IA : DeepEval, Ragas, TruLens, Giskard, Maxim AI, Braintrust, Langfuse, Opik ou équivalent
- Capacité à construire un eval harness et des jeux de tests : cas experts (goldens), minage de traces de production, scénarios adversariaux
- Bonnes pratiques de prompt engineering appliquées au test et à l'évaluation : conception de rubriques, prompts de test, calibration du juge
- Maîtrise de Python et de l'automatisation de tests
- Sensibilité sécurité IA, robustesse et reproductibilité
- Une connaissance au moins générale du cadre réglementaire IA — EU AI Act (transparence, gestion des risques, littératie IA) et RGPD — et de son impact sur l'évaluation et la mise en production
- Idéalement certifié.e ISTQB CT-AI (v2.0) et CT-GenAI — à défaut l'une des deux, avec l'envie d'obtenir la seconde
- Socle solide en QA / test / qualité logicielle, ou en dev/data avec une vraie envie de basculer vers l'IA agentique
- Anglais professionnel courant
Soft skills
- Passionné.e par les technologies innovantes et le champ de l'IA agentique
- Rigoureux.se et doté.e d'un fort esprit critique : un tableau de bord tout vert ne vous suffit pas
- Désireux.se de vous investir dans des projets challengeants et de gagner rapidement en responsabilités
- Pédagogue, empathique et "Problem Solver" : vous rendez l'évaluation lisible et actionnable pour les équipes
- Doté.e d'un excellent relationnel, d'un sens prononcé du service et de la qualité
- Curieux.se et en veille active : un domaine qui évolue chaque semaine, et vous suivez
- Excellent niveau de français à l'oral et à l'écrit, l'anglais professionnel étant ici indispensable
Entreprise
DHM IT
Plateforme de publication
WHATJOBS
Offres pouvant vous intéresser
PARIS, 75
il y a 12 jours
PARIS, 75
il y a 3 jours
NANTES, 44
il y a 12 jours
Neuropsychologue (H/F)
2 900,00 € - 3 500,00 € / mois
LIMOGES, 87
il y a 17 jours