Stage : Ingénieur benchmarking des grands modèles de langage

Stellantis

Sochaux

On-site

EUR 8,900 - 13,000

Full time

26 hours ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Benefits offered by this job

Stage rémunéré

Job summary

Stellantis propose un stage au sein de l'équipe IT accompagnant les activités Qualité et Planification du Développement Produit. Le stagiaire concevra et mettra en œuvre une solution de benchmarking des grands modèles de langage, basée sur des cas d'usage collectés auprès des équipes Qualité et Planification du Développement Produit.

Vous identifierez les parties prenantes, définirez un modèle de collecte d’usages et organiserez des ateliers pour comprendre les besoins.

Qualifications

  • Étudiant en dernière année d’informatique, IA, science des données, génie logiciel, ou domaine connexe.
  • Capacité à recueillir les besoins métiers et les transformer en cas de test mesurables.
  • Connaissance de Python ou d’un langage de script; notions IA/générative souhaitables.
  • Bonne capacité rédactionnelle et documentation technique.
  • Capacité à travailler en équipe pluridisciplinaire et à communiquer avec des interlocuteurs techniques et non techniques.

Responsibilities

  • Concevoir et mettre en œuvre une solution de benchmarking des grands modèles de langage (LLM).
  • Transformer les cas d’usage métier en tests reproductibles et exécutables sur différents LLM.
  • Préparer entrées de référence, consignes d’évaluation et critères d’acceptation pour chaque cas.
  • Définir un cadre de notation thématique et une approche de pondération globale.
  • Mettre en place, lorsque possible, un cadre automatisé de soumission et de collecte des réponses.

Skills

Analyse & résolution de problèmes
IA générative & LLM basics
Traduire besoins métier en exigences
Python ou script
Rédaction et documentation technique

Education

Master ou diplôme d'ingénieur en dernière année

Tools

Python
Outils d’analyse & visualisation
API et tests automatisés

Job description

Vous intégrerez l'équipe l'IT qui accompagne les activités de Qualité et de Planification du Développement Produit chez Stellantis.

L'équipe intervient dans le développement logiciel, la gestion des connaissances d'ingénierie, la qualité, la planification des programmes & la productivité individuelle. La disponibilité croissante des grands modèles de langage nécessite une méthode objective &reproductible permettant d'évaluer leur adéquation aux cas d'usage métier réels.

L'objectif de ce stage est de concevoir &de mettre en œuvre une solution de benchmarking comparant des grands modèles de langage à partir de cas de test représentatifs recueillis auprès des équipes Qualité & Planification du Développement Produit.

Il consistera à créer une solution de benchmarking structurée & reproductible afin d'évaluer les grands modèles de langage sur des cas d'usage réels de Qualité & de Planification du Développement Produit.

  • Identifier les principales parties prenantes et équipes impliquées
  • Définir un modèle standard pour recueillir les cas d'usage métier et techniques.
  • Organiser des entretiens et ateliers afin de comprendre les besoins, processus actuels, résultats attendus et critères d'évaluation.
  • Recueillir et documenter des cas d'usage couvrant notamment le codage, la recherche de connaissances, l'analyse documentaire, la génération de contenu, la productivité, l'analyse de données et l'assistance technique.
  • Classer les cas d'usage par domaine thématique, complexité, type de réponse attendu, contexte requis & criticité métier.
  • Définir un ensemble représentatif et équilibré de scénarios de benchmark.
  • Transformer les cas d'usage sélectionnés en cas de test reproductibles exécutables sur différents LLM.
  • Préparer pour chaque cas de test les entrées de référence, les consignes d'évaluation, les résultats attendus &les critères d'acceptation.
  • Définir des modèles de notation thématiques couvrant la précision, l'exhaustivité, la pertinence, la qualité du raisonnement, le respect des consignes, le format de sortie, la fiabilité &la cohérence.
  • Définir les pondérations thématiques et une note globale du modèle, en distinguant l'évaluation automatique de l'évaluation humaine structurée.
  • Mettre en œuvre, lorsque cela est possible, un cadre automatisé pour soumettre les cas de test et recueillir les réponses des modèles.
  • Mesurer la latence, le délai avant le premier token, la vitesse de génération, le débit et le taux d'échec.
  • Mesurer la consommation de tokens en entrée et en sortie et calculer le coût de chaque cas de test et domaine thématique.
  • Effectuer des exécutions répétées afin d'évaluer la stabilité et la reproductibilité.
  • Comparer les modèles selon la qualité, les performances, la consommation de tokens, le coût et l'adéquation à chaque catégorie de cas d'usage.
  • Créer des rapports et tableaux de bord visuels, documenter la méthodologie et présenter des recommandations aux parties prenantes
Livrables
  • Catalogue structuré des cas d'usage.
  • Taxonomie des cas d'usage couvrant les domaines thématiques identifiés.
  • Bibliothèque de cas de test de benchmark documentés &reproductibles.
  • Cadre de notation pour chaque domaine thématique ¬e globale pondérée.
  • Solution de benchmarking automatisée ou semi-automatisée.
  • Rapport comparatif des modèles couvrant la qualité, les performances, la consommation de tokens &le coût.
  • TDB ou visualisation structurée des résultats du benchmark.
  • Documentation utilisateur &maintenance
  • Recommandation finale identifiant les modèles les plus adaptes par catego de cas d'usage

Vous préparez un Master ou diplôme d'ingénieur en dernière année en informatique, IA, science des données, génie logiciel, génie industriel, analytique métier ou dans un domaine connexe.

Vous associez curiosité technique, méthode &sens de l'utilisateur. Vous êtes à l'aise pour recueillir des besoins, transformer des attentes métier en cas de test mesurables et communiquer avec des interlocuteurs techniques/non techniques. Vous faites preuve d'analyse, d'écoute active, rigueur, d'esprit de collaboration &d'attention aux détails.

Compétences Requises
  • Solides capacités d'analyse et de résolution de problèmes.
  • Compréhension de base des LLM et de l'IA générative.
  • Capacité à traduire les besoins métier en exigences techniques et cas de test.
  • Connaissance de Python ou d'un autre langage de script approprié.
  • Capacité à recueillir, traiter et comparer des données quantitatives.
  • Connaissance de base de l'analyse statistique et des indicateurs de performance.
  • Capacité à définir des critères d'évaluation et des méthodes de notation clairs.
  • Excellentes compétences rédactionnelles et de documentation technique.
  • Capacité à collaborer entre domaines métier et techniques.
Compétences Souhaitées
  • Expérience en tests logiciels, assurance qualité ou conception de benchmarks.
  • Connaissance des cadres d'évaluation des LLM.
  • Connaissance de la conception de prompts &de l'évaluation structurée des modèles.
  • Expérience des API et de l'exécution automatisée de tests.
  • Connaissance des outils d'analyse &de visualisation de données.
  • Connaissance des métriques de similarity sémantique &de qualité du texte.
  • Expérience des protocoles d'évaluation humaine &des consignes de notation.
  • Connaissance base des services d'IA dans le cloud.
  • Compréhension de la comptabilisation des tokens &de la tarification à l'usage.
  • Expérience des entretiens avec les parties prenantes &du recueil des besoins.

Chez Stellantis, nous évaluons les candidats selon leurs qualifications, leurs mérites et les besoins du métier. Nous accueillons les candidatures des personnes de tout genre, âge, ethnie, nationalité, religion, orientation sexuelle, et handicap. La diversité de nos équipes nous permettra de mieux appréhender l'évolution des besoins de nos clients et de notre environnement futur.

Durée du contrat

6 mois

At Stellantis, we assess candidates based on qualifications, merit and business needs. We welcome applications from people of all gender identities, age, ethnicity, nationality, religion, sexual orientation and disability. Diverse teams will allow us to better meet the evolving needs of our customers and care for our future.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Stage : Ingénieur benchmarking des grands modèles de langage
Stage : Ingénieur benchmarking des grands modèles de langage

Groupe PSA • Sochaux

On-site
EUR 10,000 - 13,000
Stage : Développement d'outils d'analyse de la qualité des données Électriques & Électroniques
Stage : Développement d'outils d'analyse de la qualité des données Électriques & Électroniques

Groupe PSA • Poissy

On-site
EUR 10,000 - 15,000
Stage : Data & Intelligence Artificielle
Stage : Data & Intelligence Artificielle

Stellantis • Poissy

On-site
EUR 20,000 - 27,000
Stage : Chef de Projet PMO & Transformation Digitale
Stage : Chef de Projet PMO & Transformation Digitale

Groupe PSA • Poissy

On-site
EUR 6,700 - 10,000
Stage : IA & CAO 3D : analyse intelligente des produits et procédés
Stage : IA & CAO 3D : analyse intelligente des produits et procédés

Groupe PSA • Poissy

On-site
EUR 10,000 - 13,000
Amélioration de l’anglais
Stage : Développement d'outils d'IA en logistique interne
Stage : Développement d'outils d'IA en logistique interne

Groupe PSA • Poissy

On-site
EUR 10,000 - 15,000
Stage : Adaptation de modèles de fondation pour la simulation numérique automobile
Stage : Adaptation de modèles de fondation pour la simulation numérique automobile

Groupe PSA • Vélizy-Villacoublay

On-site
EUR 7,800 - 12,000
Stage : Ingénieur cout automobile
Stage : Ingénieur cout automobile

Groupe PSA • Poissy

Hybrid
EUR 13,000 - 17,000
Stage Développemt d'un outil de visualisation et analyse pour l'utilisation des systèmes d'automatisatio
Stage Développemt d'un outil de visualisation et analyse pour l'utilisation des systèmes d'automatisatio

Groupe PSA • Nanterre

On-site
EUR 6,700 - 11,000
Stage : Gouvernance des Données pour l'Industrialisation des Solutions d'IA
Stage : Gouvernance des Données pour l'Industrialisation des Solutions d'IA

Groupe PSA • Poissy

On-site
EUR 10,000 - 17,000