An application made for this job — a tailored resume and cover letter that speak straight to the posting.
InternHunt recherche un stagiaire en Recherche pour travailler sur le deep learning et l'interprétation des modèles au laboratoire IBISC, Université Paris-Saclay, Evry. Vous aiderez à concevoir des métriques fidèles et à évaluer des représentations latentes dans des contextes biomédicaux et de data biology.
Le poste exige des bases théoriques solides en ML, des compétences en Python et PyTorch, et un goût prononcé pour la recherche scientifique.
Évry, France
Conception et développement de métriques de fidélité pour les réseaux de neurones interprétables
Mots-clés : Deep learning, interprétation, évaluation, concept learning.
L’équipe que vous allez rejoindre :
Le stage aura lieu au sein du laboratoire IBISC (Informatique, Bioinformatique, Systèmes Complexes) de l’université Paris-Saclay (Univ. Evry). Vous rejoindrez l’équipe AROBAS dont les thématiques de recherche portent sur l’apprentissage statistique, la bioinformatique et l’algorithmique. Dans cette équipe vous serez encadré par un noyau de chercheurs spécialisés en deep learning. Depuis 10 ans nous développons nos recherches autour de nouvelles méthodes de deep learning ainsi que des applications aux données biomédicales et qui sont désormais reconnues au plus haut niveau international. Nos sujets de recherche sont à la fois fondamentaux et aussi applicatifs grâce a nos nombreuses collaborations industrielles.
Contexte général
L'interprétabilité des modèles d'apprentissage profond est devenue un axe de recherche central pour fiabiliser la décision algorithmique. Au-delà des méthodes d'explication post-hoc, l'interprétabilité dite intrinsèque vise à concevoir des architectures dont certaines couches latentes représentent explicitement des entités intelligibles par construction.
Une approche récente repose sur la notion de méta-variables (meta-features), où chaque neurone latent est contraint pour représenter le comportement d'un sous-ensemble spécifique de variables d'entrée. Pour garantir la fiabilité de ces représentations, il est crucial d'évaluer fidèlement la correspondance entre le neurone et son groupe de variables associé, sans que des corrélations parasites ne viennent fausser la représentation.
Les métriques traditionnelles du domaine (issues du concept learning) montrent d'importantes limites dans ce cadre. Pour y répondre, de premières métriques dédiées, fondées notamment sur des simulations de perturbations ciblées et sur la préservation de structures géométriques, ont été introduites au laboratoire.
Objectifs du stage
Le stage s'inscrit au cœur des fondements méthodologiques du machine learning. L'enjeu principal sera de consolider le cadre d'évaluation des représentations latentes interprétables en levant les verrous actuels des métriques existantes :
Analyse critique et correction des biais : Identifier et quantifier les biais inhérents aux métriques actuelles (sensibilité au chevauchement entre sous-ensembles de variables, effets d'échelle et dépendances résiduelles). Proposer des formulations corrigées et robustes.
Conception et extension de nouvelles métriques : Élargir le panel d'outils statistiques pour mesurer plus fidèlement le confinement de l'information et le démêlement des variables au sein de l'espace latent.
Validation expérimentale : Comparer rigoureusement les métriques proposées face aux approches de l'état de l'art sur des jeux de données synthétiques modulables (contrôle précis de l'enchevêtrement et des dimensions), complétés par une validation finale sur des données réelles de grande dimension (transcriptomique unicellulaire).
Profil recherché
Étudiant en Master 2 Recherche ou dernière année d'école d'ingénieur en informatique, machine learning ou mathématiques appliquées.
Solides bases théoriques en apprentissage automatique et compétences pratiques en Python / PyTorch.
Goût prononcé pour la recherche scientifique.