Stage : Ingénieur benchmarking des grands modèles de langage

Groupe PSA

Sochaux

On-site

EUR 10,000 - 13,000

Part time

4 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Le Groupe PSA propose un stage d’ingénieur benchmarking des grands modèles de langage à Sochaux. Vous intégrerez l’équipe IT soutenant les activités Qualité et Planification du Développement Produit et contribuerez à concevoir une solution de benchmarking reproductible pour évaluer les LLM sur des cas d’usage métier.

Le stage vise à transformer les besoins métier en tests mesurables, à documenter les cas, et à définir des cadres de notation couvrant précision, exhaustivité et qualité du

Qualifications

  • Candidat présentant un Master en informatique, IA, data science ou domaine connexe.
  • Connaissances de Python et notions de benchmarking.
  • Bonne capacité d'analyse et de communication avec les parties prenantes.

Responsibilities

  • Concevoir et mettre en œuvre une solution de benchmarking pour LLM.
  • Compiler des cas d'usage métier et tests reproductibles.
  • Organiser des entretiens et ateliers pour comprendre besoins et critères.
  • Établir modèle de notation et critères d'acceptation des résultats.
  • Documenter les scénarios, entrées de référence et résultats attendus.

Skills

Python
LLM knowledge
Data analysis
Requirement gathering
Technical writing

Education

Master en informatique / IA

Tools

Jupyter
API testing
Notebook environments

Job description

Stage : Ingénieur benchmarking des grands modèles de langage
Description du poste
Filière/Métier
Intitulé du poste

Stage : Ingénieur benchmarking des grands modèles de langage

Description de la mission

Vous intégrerez l'équipe l'IT qui accompagne les activités de Qualité et de Planification du Développement Produit chez Stellantis.

L'équipe intervient dans le développement logiciel, la gestion des connaissances d'ingénierie, la qualité, la planification des programmes & la productivité individuelle. La disponibilité croissante des grands modèles de langage nécessite une méthode objective &reproductible permettant d'évaluer leur adéquation aux cas d'usage métier réels.

L'objectif de ce stage est de concevoir &de mettre en œuvre une solution de benchmarking comparant des grands modèles de langage à partir de cas de test représentatifs recueillis auprès des équipes Qualité & Planification du Développement Produit.

Il consistera à créer une solution de benchmarking structurée & reproductible afin d'évaluer les grands modèles de langage sur des cas d'usage réels de Qualité & de Planification du Développement Produit.

  • Identifier les principales parties prenantes et équipes impliquées
  • Définir un modèle standard pour recueillir les cas d'usage métier et techniques.
  • Organiser des entretiens et ateliers afin de comprendre les besoins, processus actuels, résultats attendus et critères d'évaluation.
  • Recueillir et documenter des cas d'usage couvrant notamment le codage, la recherche de connaissances, l'analyse documentaire, la génération de contenu, la productivité, l'analyse de données et l'assistance technique.
  • Classer les cas d'usage par domaine thématique, complexité, type de réponse attendu, contexte requis & criticité métier.
  • Définir un ensemble représentatif et équilibré de scénarios de benchmark.
  • Transformer les cas d'usage sélectionnés en cas de test reproductibles exécutables sur différents LLM.
  • Préparer pour chaque cas de test les entrées de référence, les consignes d'évaluation, les résultats attendus &les critères d'acceptation.
  • Définir des modèles de notation thématiques couvrant la précision, l'exhaustivité, la pertinence, la qualité du raisonnement, le respect des consignes, le format de sortie, la fiabilité &la cohérence.
  • Définir les pondérations thématiques et une note globale du modèle, en distinguant l'évaluation automatique de l'évaluation humaine structurée.
  • Mettre en œuvre, lorsque cela est possible, un cadre automatisé pour soumettre les cas de test et recueillir les réponses des modèles.
  • Mesurer la latence, le délai avant le premier token, la vitesse de génération, le débit et le taux d'échec.
  • Mesurer la consommation de tokens en entrée et en sortie et calculer le coût de chaque cas de test et domaine thématique.
  • Effectuer des exécutions répétées afin d'évaluer la stabilité et la reproductibilité.
  • Comparer les modèles selon la qualité, les performances, la consommation de tokens, le coût et l'adéquation à chaque catégorie de cas d'usage.
  • Créer des rapports et tableaux de bord visuels, documenter la méthodologie et présenter des recommandations aux parties prenantes

Livrables :

  • Catalogue structuré des cas d'usage.
  • Taxonomie des cas d'usage couvrant les domaines thématiques identifiés.
  • Bibliothèque de cas de test de benchmark documentés &reproductibles.
  • Cadre de notation pour chaque domaine thématique ¬e globale pondérée.
  • Solution de benchmarking automatisée ou semi-automatisée.
  • Rapport comparatif des modèles couvrant la qualité, les performances, la consommation de tokens &le coût.
  • TDB ou visualisation structurée des résultats du benchmark.
  • Documentation utilisateur &maintenance
  • Recommandation finale identifiant les modèles les plus adaptes par catego de cas d'usage

Vous préparez un Master ou diplôme d'ingénieur en dernière année en informatique, IA, science des données, génie logiciel, génie industriel, analytique métier ou dans un domaine connexe.

Vous associez curiosité technique, méthode &sens de l'utilisateur. Vous êtes à l'aise pour recueillir des besoins, transformer des attentes métier en cas de test mesurables et communiquer avec des interlocuteurs techniques/non techniques. Vous faites preuve d'analyse, d'écoute active, rigueur, d'esprit de collaboration &d'attention aux détails.

Compétences requises :

  • Solides capacités d'analyse et de résolution de problèmes.
  • Compréhension de base des LLM et de l'IA générative.
  • Capacité à traduire les besoins métier en exigences techniques et cas de test.
  • Connaissance de Python ou d'un autre langage de script approprié.
  • Capacité à recueillir, traiter et comparer des données quantitatives.
  • Connaissance de base de l'analyse statistique et des indicateurs de performance.
  • Capacité à définir des critères d'évaluation et des méthodes de notation clairs.
  • Excellentes compétences rédactionnelles et de documentation technique.
  • Capacité à collaborer entre domaines métier et techniques.

Compétences souhaitées :

  • Expérience en tests logiciels, assurance qualité ou conception de benchmarks.
  • Connaissance des cadres d'évaluation des LLM.
  • Connaissance de la conception de prompts &de l'évaluation structurée des modèles.
  • Expérience des API et de l'exécution automatisée de tests.
  • Connaissance des outils d'analyse &de visualisation de données.
  • Connaissance des métriques de similarité sémantique &de qualité du texte.
  • Expérience des protocoles d'évaluation humaine &des consignes de notation.
  • Connaissance de base des services d'IA dans le cloud.
  • Compréhension de la comptabilisation des tokens &de la tarification à l'usage.
  • Expérience des entretiens avec les parties prenantes &du recueil des besoins.

Chez Stellantis, nous évaluons les candidats selon leurs qualifications, leurs mérites et les besoins du métier. Nous accueillons les candidatures des personnes de tout genre, âge, ethnie, nationalité, religion, orientation sexuelle, et handicap. La diversité de nos équipes nous permet de mieux appréhender l'évolution des besoins de nos clients et de notre environnement futur.

Durée du contrat

6 mois

Localisation du poste

Europe, France, Franche-Comté, Doubs (25)

Ville

Sochaux

Critères candidat
Niveau de diplôme préparé

Anglais (B2 - Intermédiaire (2,5 - 3,4 Bright))

Informations générales
Entité de rattachement

Nous rejoindre, c'est intégrer une entreprise d'envergure mondiale. Mû par la recherche permanente de l'innovation et de l'excellence, pionnier et leader des technologies propres et de la mobilité durable, le Groupe entend rester à la pointe des grandes tendances qui font bouger le monde.

Entité de rattachement

Nous rejoindre, c'est intégrer une entreprise d'envergure mondiale. Mû par la recherche permanente de l'innovation et de l'excellence, pionnier et leader des technologies propres et de la mobilité durable, le Groupe entend rester à la pointe des grandes tendances qui font bouger le monde.
Fort de son efficience, de son agilité et de son esprit d'équipe, le Groupe fait preuve d'exigence et d'audace pour définir la mobilité de demain.
Pour réussir ces transformations, l'entreprise a besoin de tous les talents.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Stage : Ingénieur benchmarking des grands modèles de langage
Stage : Ingénieur benchmarking des grands modèles de langage

Stellantis • Sochaux

On-site
EUR 8,900 - 13,000
Stage rémunéré
Stage : Développement d'outils d'amélioration de la performance du métier de validation
Stage : Développement d'outils d'amélioration de la performance du métier de validation

Groupe PSA • Belchamp

On-site
EUR 8,900 - 13,000
Stage : Chef de Projet PMO & Transformation Digitale
Stage : Chef de Projet PMO & Transformation Digitale

Groupe PSA • Poissy

On-site
EUR 6,700 - 10,000
Stage : Développement d'outils d'amélioration de la performance du métier de validation
Stage : Développement d'outils d'amélioration de la performance du métier de validation

Groupe PSA • Sochaux

On-site
EUR 8,900 - 13,000
Stage : Spécialiste CRO,CX& intelligence Digitale
Stage : Spécialiste CRO,CX& intelligence Digitale

Groupe PSA • Poissy

On-site
EUR 13,000 - 17,000
Stage : Mise en place des outils de cadrage R&D/CAPEX
Stage : Mise en place des outils de cadrage R&D/CAPEX

Groupe PSA • Poissy

On-site
EUR 8,900 - 13,000
Stage : AI & Supply Chain Analytics Intern
Stage : AI & Supply Chain Analytics Intern

Groupe PSA • Poissy

On-site
EUR 8,900 - 13,000
Stage : Intelligence artificielle, automatisation et développement de \"use cases\"
Stage : Intelligence artificielle, automatisation et développement de \"use cases\"

Groupe PSA • Sochaux

On-site
EUR 12,000 - 17,000
Stage : Ingénieur Gestion de la Connaissance & Intelligence Artificielle
Stage : Ingénieur Gestion de la Connaissance & Intelligence Artificielle

Groupe PSA • Belchamp

On-site
EUR 12,000 - 19,000
Stage: Communication et Adoption de l'Intelligence Artificielle
Stage: Communication et Adoption de l'Intelligence Artificielle

Groupe PSA • Sochaux

On-site
EUR 12,000 - 17,000