AI Evaluation Engineer — Agentic Systems (H/F)

DHM IT

Neuilly-sur-Seine

Hybride

EUR 70 000 - 95 000

Plein temps

14 jours+
Générateur de candidature

Transformez ce poste en entretien — un CV et une lettre de motivation conçus selon ce que cet employeur recherche.

Passez les filtres ATS

Résumé du poste

DHM IT recherche un.e AI Evaluation Engineer — Agentic Systems pour rejoindre sa Squad AI Quality & Evaluation. Télétravail avec flexibilité sur la région parisienne afin de garantir, mesurer et fiabiliser le comportement des agents et systèmes multi‑agents avant leur mise en production.

Vous concevrez des stratégies d’évaluation, orchestrerez des workflows agentiques et développerez des jeux de tests et scénarios de simulation, avec une approche CI/CD et détection de régressions.

Qualifications

  • Expérience en évaluation de systèmes IA nécessaire.
  • Compréhension des trajectoires et échecs intermédiaires.
  • Connaissance du cadre EU AI Act et RGPD.
  • Anglais professionnel requis.

Responsabilités

  • Concevoir des stratégies d'évaluation pour agents et systèmes multi-agent.
  • Évaluer les échecs intermédiaires et la dérive de comportement.
  • Concevoir et tester des workflows agentiques.
  • Construire des jeux de tests et scénarios de simulation.
  • Industrialiser l'évaluation dans CI/CD et définir quality gates.
  • Définir des métriques clés et harmoniser human-in-the-loop.
  • Diffuser les bonnes pratiques d'évaluation agentique.

Connaissances

Python
Automatisation de tests
Évaluation IA
Prompt engineering
QA / test

Formation

ISTQB CT-AI (v2.0)
CT-GenAI

Outils

DeepEval
Ragas
TruLens
Giskard
Langfuse
Opik

Description du poste

Dans le cadre de notre croissance et afin de renforcer notre Squad AI Quality & Evaluation, nous recherchons un.e AI Evaluation Engineer — Agentic Systems. Intégré.e au sein de nos équipes, en télétravail avec une flexibilité sur la région parisienne, vous interviendrez sur l'un des métiers les plus stratégiques de l'IA : garantir, mesurer et fiabiliser le comportement des agents et systèmes multi-agents avant leur mise en production. Un domaine qui s'invente aujourd'hui, où vous mettrez en pratique vos acquis en QA et développerez de nouvelles compétences à la frontière de l'IA.

Missions
  • Concevoir des stratégies d'évaluation pour agents et systèmes multi-agents : trajectoires, orchestration d'outils (tool use), raisonnement multi-étapes, gestion de mémoire et de contexte
  • Évaluer au-delà du résultat final : détecter les échecs intermédiaires, la propagation d'erreurs et les dérives de comportement le long de la trajectoire
  • Concevoir et éprouver des workflows agentiques : décomposition de tâches, enchaînement d'agents (planner / executor / critic), points de contrôle et garde-fous
  • Construire des jeux de tests et scénarios de simulation d'utilisateurs : personas, cas limites, tests adversariaux
  • Exploiter le prompt engineering comme levier d'évaluation : prompts de test, LLM-as-a-judge, rubriques d'évaluation
  • Industrialiser l'évaluation dans les pipelines CI/CD : évaluation automatisée, détection de régressions, quality gates avant déploiement
  • Définir les métriques qui comptent pour un agent : réussite de tâche, fidélité, robustesse, sécurité, coût, latence, consommation de tokens
  • Combiner évaluation automatisée et évaluation humaine (human-in-the-loop), et arbitrer entre les deux
  • Documenter et diffuser les bonnes pratiques d'évaluation agentique auprès des équipes
Profil
  • Idéalement une première expérience en évaluation de systèmes IA — en poste, en freelance ou même sur un projet personnel sérieux : ce métier s'invente, nous valorisons ce que vous avez déjà exploré par vous-même
  • Compréhension de ce qui rend l'évaluation d'un agent spécifique : non-déterminisme, comportement probabiliste, trajectoires multi-étapes, échecs intermédiaires, absence de vérité unique — on n'évalue pas une sortie, on score une trajectoire (chaque appel d'outil, chaque état intermédiaire devient une surface d'évaluation)
  • Familiarité avec les approches de scoring : graders à base de règles (code-based), LLM-as-a-judge pour l'ouvert, évaluation humaine — et le bon sens de savoir quand combiner les trois
  • Maîtrise réelle d'au moins un framework ou plateforme d'évaluation IA : DeepEval, Ragas, TruLens, Giskard, Maxim AI, Braintrust, Langfuse, Opik ou équivalent
  • Capacité à construire un eval harness et des jeux de tests : cas experts (goldens), minage de traces de production, scénarios adversariaux
  • Bonnes pratiques de prompt engineering appliquées au test et à l'évaluation : conception de rubriques, prompts de test, calibration du juge
  • Maîtrise de Python et de l'automatisation de tests
  • Sensibilité sécurité IA, robustesse et reproductibilité
  • Une connaissance au moins générale du cadre réglementaire IA — EU AI Act (transparence, gestion des risques, littératie IA) et RGPD — et de son impact sur l'évaluation et la mise en production
  • Idéalement certifié.e ISTQB CT-AI (v2.0) et CT-GenAI — à défaut l'une des deux, avec l'envie d'obtenir la seconde
  • Socle solide en QA / test / qualité logicielle, ou en dev/data avec une vraie envie de basculer vers l'IA agentique
  • Anglais professionnel courant
Soft skills
  • Passionné.e par les technologies innovantes et le champ de l'IA agentique
  • Rigoureux.se et doté.e d'un fort esprit critique : un tableau de bord tout vert ne vous suffit pas
  • Désireux.se de vous investir dans des projets challengeants et de gagner rapidement en responsabilités
  • Pédagogue, empathique et "Problem Solver" : vous rendez l'évaluation lisible et actionnable pour les équipes
  • Doté.e d'un excellent relationnel, d'un sens prononcé du service et de la qualité
  • Curieux.se et en veille active : un domaine qui évolue chaque semaine, et vous suivez
  • Excellent niveau de français à l'oral et à l'écrit, l'anglais professionnel étant ici indispensable
Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez votre fichier ici.
Similar jobs

Postes similaires à comparer

AI Engineer (H/F/NB)
AI Engineer (H/F/NB)

Keyrus • Levallois-Perret

Sur place
EUR 90 000 - 125 000
Ingénieur Plateforme IA Agentique (H/F)
Ingénieur Plateforme IA Agentique (H/F)

DHM IT • Paris

Hybride
EUR 90 000 - 130 000
QA IA (Quality Assurance IA / AI Test Engineer)
QA IA (Quality Assurance IA / AI Test Engineer)

Skapa Agency • Paris

Sur place
EUR 50 000 - 70 000
Architecte IA Agentique (H/F)
Architecte IA Agentique (H/F)

DGTL Performance • Meudon

Hybride
EUR 90 000 - 120 000
Télétravail 2 jours/semaine
Localisation Meudon
AI Engineer / Agentic AI Engineer
AI Engineer / Agentic AI Engineer

Accenture • Paris

Hybride
EUR 45 000 - 65 000
Formations avancées
Accès à des technologies de pointe
Environnement international
AI Engineering / Agentic AI Engineering Manager
AI Engineering / Agentic AI Engineering Manager

Accenture France • Paris

Sur place
EUR 70 000 - 90 000
Accès à des formations avancées
Évolution de carrière vers le niveau Senior Manager
QA Engineer - F/H
QA Engineer - F/H

ChapsVision • Paris

Hybride
EUR 45 000 - 65 000
Carte SWILE prise en charge à 60%
Transport pris en charge à 50%
Forfait mobilité durable jusqu’à 400€ / an
+2
Ingénieur IA
Ingénieur IA

CEVA SANTE ANIMALE • Libourne

Sur place
EUR 65 000 - 95 000
AI Engineer
AI Engineer

Yotta - Expert en recrutement Data, AI & Product • Paris

Sur place
EUR 70 000 - 100 000
Senior AI Engineer
Senior AI Engineer

URBAN LINKER • Paris

Sur place
EUR 90 000 - 120 000