Ricevi una risposta da questo datore di lavoro — un curriculum e una lettera di presentazione personalizzati, che corrispondono esattamente a ciò che sta cercando.
Inria Grenoble Alpes recherche un stagiaire pour la reconnaissance d’entités nommées dans la parole, avec travail sur des approches en pipeline et bout en bout. Vous préparerez des corpus audio-multilingues et participerez à l’implémentation et l’évaluation de systèmes NER adaptés au domaine.
Le stage privilégie un profil Python/PyTorch, avec envie de recherche appliquée et collaboration interdisciplinaire; télétravail partiel possible après accord.
Niveau de diplôme exigé : Bac + 4 ou équivalent
Autre diplôme apprécié : M2 en IA, mathématiques, mathématiques appliquées, informatique ou équivalent, avec une forte motivation pour la recherche appliquée
Fonction : Stagiaire des fonctions support
Le ou la stagiaire sera accueilli(e) au sein de la Mission Défense & Sécurité, créée en 2020 afin
de fédérer et de développer les différentes actions d’Inria répondant aux besoins numériques
des forces armées et du ministère de l’Intérieur. Le stage se déroulera au sein du pôle de
recherche Parole & Audio, sous la direction de Clara Ponchard et Pauline Soutrenon.
Le stage porte sur la reconnaissance d’entités nommées dans la parole. La reconnaissance
d’entités nommées (Named Entity Recognition, NER) consiste à identifier et à catégoriser
automatiquement, dans un contenu linguistique, les mentions correspondant à des entités
d’intérêt, telles que des personnes, des lieux, des organisations ou toute autre catégorie
définie par un guide d’annotation.
L’objectif du projet est de développer des méthodes permettant d’extraire automatiquement
ces entités à partir d’enregistrements audio. Deux approches complémentaires seront
étudiées : une approche en pipeline, reposant sur une transcription intermédiaire du signal,
et une approche de bout en bout, visant à extraire les entités directement à partir du signal
audio.
Dans l’approche en pipeline, un système de reconnaissance automatique de la parole
(Automatic Speech Recognition, ASR) transcrit dans un premier temps le signal audio, puis un
modèle de NER identifie et type les entités présentes dans la transcription. Cette architecture
permet de s’appuyer sur des systèmes ASR et NER déjà performants et d’utiliser des modèles
de NER à typage ouvert, tels que GLiNER, permettant d’intégrer de nouvelles catégories
d’entités sans nécessiter un ré-entraînement complet du système.
Cette approche présente néanmoins une limite importante : sa dépendance à la qualité de la transcription
automatique. Les erreurs produites par le système ASR peuvent se propager à l’étape de
reconnaissance des entités. De plus, les sorties ASR diffèrent des données textuelles sur
lesquelles les modèles de NER sont généralement entraînés, notamment par une ponctuation
absente ou imprécise et par la présence de phénomènes propres à la parole spontanée. Une
partie des travaux visera donc à étudier l’impact de ces différences et à améliorer la
robustesse des modèles de NER aux sorties de systèmes ASR.
En parallèle, une approche de bout en bout sera explorée afin d’identifier les entités
nommées directement à partir du signal audio, sans dépendre d’une transcription
intermédiaire explicitement produite en amont. Cette approche pourra s’appuyer sur des
modèles de parole pré-entraînés sur de grandes quantités de données multilingues, tels que
XLSR-53 ou Whisper, et sur des architectures permettant d’assurer conjointement la
transcription, la détection et le typage des entités. Des approches récentes telles que
WhisperNER constituent notamment une piste intéressante pour permettre l’intégration de
nouvelles catégories d’entités tout en exploitant directement les représentations issues du
signal de parole.
L’approche de bout en bout pourrait permettre de limiter la propagation
des erreurs inhérente aux architectures en pipeline et d’exploiter des informations présentes
dans le signal acoustique mais absentes de la transcription. Elle soulève cependant d’autres
difficultés, notamment la disponibilité plus limitée de données associant directement signal
audio et annotations en entités nommées.
Le stage comportera plusieurs objectifs :
– Réaliser un état de l’art des approches existantes pour l’extraction d’entités nommées
à partir de la parole, en étudiant à la fois les architectures en pipeline et les approches
de bout en bout ;
– Prendre en main et préparer des corpus associant signal audio, transcriptions et
annotations en entités nommées, notamment dans un contexte multilingue ;
– Mettre en œuvre une première approche en pipeline combinant un système de
reconnaissance automatique de la parole (ASR) et un modèle de reconnaissance
d’entités nommées (NER) ;
– Adapter un modèle de NER à typage ouvert, tel que GLiNER, aux catégories d’entités
définies dans le cadre du projet ;
– Améliorer la robustesse du système de NER aux sorties ASR, notamment par fine-
tuning sur des transcriptions automatiques ou artificiellement bruitées ;
– Explorer et mettre en œuvre une approche de bout en bout permettant d’extraire les
entités nommées directement à partir du signal audio, en s’appuyant sur des modèles
de parole pré-entraînés et des architectures récentes ;
– Comparer les approches en pipeline et de bout en bout en termes de performances,
de robustesse aux différentes conditions de parole et de capacité de généralisation à
différentes langues et catégories d’entités.
Le stage comprendra une composante expérimentale importante, incluant la préparation et
la manipulation de données audio, l’entraînement et le fine-tuning de modèles, ainsi que
l’évaluation et l’an
Solide maîtrise de Python ;
· Pratique de bibliothèques et frameworks d’apprentissage automatique et profond
tels que PyTorch, PyTorch Lightning, Keras, Scikit-learn et Transformers (Hugging
Face), ou d’outils équivalents ;
· Bonne connaissance des méthodes d’apprentissage automatique et d’apprentissage
profond ;
· Intérêt pour le traitement de la parole et la manipulation de différents types
données (audio, texte, signaux) ;
· Intérêt pour les projets interdisciplinaires à l’interface entre informatique et sciences
humaines et sociales ;
· Bonne maîtrise de l’anglais.
Des connaissances en reconnaissance automatique de la parole (ASR), en traitement
automatique des langues (NLP) et/ou en reconnaissance d’entités nommées (NER)
constitueront un plus.
Le stage pourra se dérouler au centre Inria de Paris, rue Barrault, dans le 13ᵉ arrondissement, ou à l’antenne Inria MINATEC de Grenoble, au sein d’un groupe de recherche spécialisé dans le traitement de la parole et de l’audio, composé de chercheurs et d’ingénieurs de recherche.
Sécurité défense :Ce poste est susceptible d’être affecté dans une zone à régime restrictif (ZRR), telle que définie dans le décret n°2011-1425 relatif à la protection du potentiel scientifique et technique de la nation (PPST). L’autorisation d’accès à une zone est délivrée par le chef d’établissement, après avis ministériel favorable, tel que défini dans l’arrêté du 03 juillet 2022, relatif à la PPST. Un avis ministériel défavorable pour un poste affecté dans une ZRR aurait pour conséquence l’annulation du recrutement.
Politique de recrutement :Dans le cadre de sa politique diversité, tous les postes Inria sont accessibles aux personnes en situation de handicap.
Inria, l'institut national de recherche dans les sciences et technologies du numérique, est en appui de l’État pour les stratégies nationales de recherche et d’innovation du numérique en tant qu'Agence de programmes. Inria mène plus de 300 projets de recherche et d’innovation avec ses 3500 scientifiques, ingénieurs et personnels d’appui, en partenariat avec les universités et l’écosystème numérique (entreprises, entrepreneurs, acteurs publics). Ensemble, nous explorons des domaines clés comme l'intelligence artificielle, la cybersécurité, l’informatique quantique, le Cloud, la transformation numérique de la santé, les jumeaux numériques ou encore les technologies numériques pour la défense. Nous construisons des solutions concrètes telles que des logiciels, des startups technologiques, des partenariats avec les entreprises du tissu national et des formations de pointe. Notre objectif : l’impact scientifique, technologique et industriel au service de la souveraineté numérique de la France.