Chargement en cours

AI Evaluation Engineer — Agentic Systems (H/F)

NEUILLY SUR SEINE
il y a 1 jour

Dans le cadre de notre croissance et afin de renforcer notre Squad AI Quality & Evaluation, nous recherchons un.e AI Evaluation Engineer — Agentic Systems . Intégré.e au sein de nos équipes, en télétravail avec une flexibilité sur la région parisienne, vous interviendrez sur l'un des métiers les plus stratégiques de l'IA : garantir, mesurer et fiabiliser le comportement des agents et systèmes multi-agents avant leur mise en production. Un domaine qui s'invente aujourd'hui, où vous mettrez en pratique vos acquis en QA et développerez de nouvelles compétences à la frontière de l'IA.

Missions

  • Concevoir des stratégies d'évaluation pour agents et systèmes multi-agents : trajectoires, orchestration d'outils (tool use), raisonnement multi-étapes, gestion de mémoire et de contexte
  • Évaluer au-delà du résultat final : détecter les échecs intermédiaires, la propagation d'erreurs et les dérives de comportement le long de la trajectoire
  • Concevoir et éprouver des workflows agentiques : décomposition de tâches, enchaînement d'agents (planner / executor / critic), points de contrôle et garde-fous
  • Construire des jeux de tests et scénarios de simulation d'utilisateurs : personas, cas limites, tests adversariaux
  • Exploiter le prompt engineering comme levier d'évaluation : prompts de test, LLM-as-a-judge, rubriques d'évaluation
  • Industrialiser l'évaluation dans les pipelines CI/CD : évaluation automatisée, détection de régressions, quality gates avant déploiement
  • Définir les métriques qui comptent pour un agent : réussite de tâche, fidélité, robustesse, sécurité, coût, latence, consommation de tokens
  • Combiner évaluation automatisée et évaluation humaine (human-in-the-loop), et arbitrer entre les deux
  • Documenter et diffuser les bonnes pratiques d'évaluation agentique auprès des équipes

Profil

  • Idéalement une première expérience en évaluation de systèmes IA — en poste, en freelance ou même sur un projet personnel sérieux : ce métier s'invente, nous valorisons ce que vous avez déjà exploré par vous-même
  • Compréhension de ce qui rend l'évaluation d'un agent spécifique : non-déterminisme, comportement probabiliste, trajectoires multi-étapes, échecs intermédiaires, absence de vérité unique — on n'évalue pas une sortie, on score une trajectoire (chaque appel d'outil, chaque état intermédiaire devient une surface d'évaluation)
  • Familiarité avec les approches de scoring : graders à base de règles (code-based), LLM-as-a-judge pour l'ouvert, évaluation humaine — et le bon sens de savoir quand combiner les trois
  • Maîtrise réelle d'au moins un framework ou plateforme d'évaluation IA : DeepEval, Ragas, TruLens, Giskard, Maxim AI, Braintrust, Langfuse, Opik ou équivalent
  • Capacité à construire un eval harness et des jeux de tests : cas experts (goldens), minage de traces de production, scénarios adversariaux
  • Bonnes pratiques de prompt engineering appliquées au test et à l'évaluation : conception de rubriques, prompts de test, calibration du juge
  • Maîtrise de Python et de l'automatisation de tests
  • Sensibilité sécurité IA, robustesse et reproductibilité
  • Une connaissance au moins générale du cadre réglementaire IA — EU AI Act (transparence, gestion des risques, littératie IA) et RGPD — et de son impact sur l'évaluation et la mise en production
  • Idéalement certifié.e ISTQB CT-AI (v2.0) et CT-GenAI — à défaut l'une des deux, avec l'envie d'obtenir la seconde
  • Socle solide en QA / test / qualité logicielle, ou en dev/data avec une vraie envie de basculer vers l'IA agentique
  • Anglais professionnel courant

Soft skills

  • Passionné.e par les technologies innovantes et le champ de l'IA agentique
  • Rigoureux.se et doté.e d'un fort esprit critique : un tableau de bord tout vert ne vous suffit pas
  • Désireux.se de vous investir dans des projets challengeants et de gagner rapidement en responsabilités
  • Pédagogue, empathique et "Problem Solver" : vous rendez l'évaluation lisible et actionnable pour les équipes
  • Doté.e d'un excellent relationnel, d'un sens prononcé du service et de la qualité
  • Curieux.se et en veille active : un domaine qui évolue chaque semaine, et vous suivez
  • Excellent niveau de français à l'oral et à l'écrit, l'anglais professionnel étant ici indispensable
#J-18808-Ljbffr
Entreprise
DHM IT
Plateforme de publication
WHATJOBS
Offres pouvant vous intéresser
PARIS, 75
il y a 12 jours
PARIS, 75
il y a 3 jours
NANTES, 44
il y a 12 jours
Neuropsychologue (H/F)
2 900,00 € - 3 500,00 € / mois
LIMOGES, 87
il y a 17 jours
Soyez le premier à postuler aux nouvelles offres
Soyez le premier à postuler aux nouvelles offres
Créez gratuitement et simplement une alerte pour être averti de l’ajout de nouvelles offres correspondant à vos attentes.
* Champs obligatoires
Ex: boulanger, comptable ou infirmière
Alerte crée avec succès