Une candidature sur mesure pour ce poste — un CV personnalisé et une lettre de motivation qui correspondent directement à l’offre.
IMT Atlantique, Brest, propose un poste dans l'équipe BRAIN du Lab-STICC pour étudier la diversité des représentations et des données dans les modèles de fondation. Le candidat contribuera à la production scientifique et à la diffusion des résultats, avec un encadrement par des doctorants et une collaboration étroite avec le secteur industriel et les partenaires internationaux.
Le poste demande un Doctorat récent en IA, une forte maîtrise de Python/PyTorch et une expérience des architectures
Grande école d’ingénieur généraliste de l’IMT-Institut Mines-Télécom, premier groupe d’écoles d’ingénieurs de France, IMT Atlantique a pour ambition d’accompagner les transitions, de former des ingénieurs responsables et mettre l'excellence scientifique et technique au service de l'enseignement, de la recherche et de l'innovation.
Le poste est basé à Brest, au sein de l'équipe BRAIN (BRoader Artificial INtelligence) du Lab-STICC (UMR CNRS 6285). L'équipe travaille sur les fondements de l'apprentissage automatique (représentations, apprentissage frugal, modèles de fondation, traitement du signal) et sur leurs applications, en particulier en santé. Elle a récemment développé REVE, un modèle de fondation pour l'électroencéphalographie pré-entraîné sur plus de 25 000 sujets (NeurIPS 2025), et s’intéresse aux modèles de langage à diffusion discrète et sur l'interprétabilité mécaniste.
Le projet ENDIVE étudie ce que la diversité peut apporter à l'apprentissage automatique lorsque le budget porte sur le nombre d'exemples annotés plutôt que sur la puissance de calcul. Dans ce régime, ce qu'apporte un nouvel exemple ne dépend plus seulement de sa qualité propre, mais de ce qui le distingue de ceux déjà vus. Le point d'entrée technique du projet est l'échantillonnage à garanties de diversité, et en particulier les processus ponctuels déterminantaux (DPP), dont la matrice de noyau encode à la fois la pertinence des points et leur similarité.
Le projet explore cette question sur deux plans complémentaires : la diversité des données, soit le choix des exemples que l'on annote, conserve ou présente au modèle ; et la diversité des représentations, soit le choix des descripteurs, des contextes et des modèles que l'on exploite ou
combine. Les premiers résultats portent sur le décodage diversifié des modèles de langue à diffusion discrète et sur la localisation de l'information dans les représentations des transformers.
Le poste proposé porte sur le second plan, abordé par les outils de l'interprétabilité mécaniste. Page du
projet : https://bastienpasdeloup.github.io/endive/
Les missions principales du poste sont les suivantes :
2. Étudier le lien entre la diversité des données d'entraînement et la diversité des mécanismes internes que les modèles acquièrent.
3. Contribuer à la production et à la diffusion scientifiques du projet.
Entraîner et analyser des autoencodeurs parcimonieux sur les activations de modèles de fondation, afin d'en extraire des descripteurs interprétables.
Construire des noyaux de similarité entre ces descripteurs et évaluer, au moyen de processus ponctuels déterminantaux, si un sous-ensemble divers en fournit une couverture plus compacte que la seule importance individuelle.
Mesurer l'effet de ces critères sur des tâches aval en régime peu annoté, et comparer les profondeurs du réseau auxquelles les représentations sont lues.
2. Diversité des données et diversité des mécanismes :
Comparer les descripteurs retrouvés par des autoencodeurs parcimonieux entraînés sur des modèles nourris de régimes de données différents, et quantifier leur recouvrement.
Évaluer la stabilité de ces descripteurs d'un entraînement à l'autre, afin de distinguer les mécanismes reproductibles des artefacts d'optimisation.
Mettre ces mesures en relation avec les procédures de curation étudiées dans le projet, en particulier pour les modèles de langage à diffusion discrète.
3. Production scientifique et vie du projet :
Rédiger et soumettre les résultats obtenus dans des conférences et revues internationales.
Publie le code et les protocoles expérimentaux nécessaires à la reproductibilité des résultats.
Rémunération indicative: 35 800€ brut annuel, selon le profil et l’expérience (charges salariales réduites en secteur public).
Pour tous renseignements *:
Date limite de candidature: 10/10/2026
Début du contrat : 01/01/2027
Entretien : au fil de l’eau