A complete application in a minute — tailored resume and cover letter, ready to send.
Stage à Inria Grenoble/Paris portant sur la reconnaissance d’entités nommées dans la parole. Le candidat développera des méthodes en pipeline ASR-NER et explorera des approches bout-en-bout à partir du signal audio, en s’appuyant sur des modèles pré-entraînés multilingues et GLiNER pour des entités ouvertes.
Le stage comporte une forte composante expérimentale : manipulation de données audio, entraînement et fine-tuning de modèles, évaluation et comparaison des architectures, dans un contexte
Other valued qualifications : M2 en IA, mathématiques, mathématiques appliquées, informatique ou équivalent, avec une forte motivation pour la recherche appliquée
Le ou la stagiaire sera accueilli(e) au sein de la Mission Défense & Sécurité, créée en 2020 afin de fédérer et de développer les différentes actions d’Inria répondant aux besoins numériques des forces armées et du ministère de l’Intérieur. Le stage se déroulera au sein du pôle de recherche Parole & Audio, sous la direction de Clara Ponchard et Pauline Soutrenon. Le stage porte sur la reconnaissance d’entités nommées dans la parole. La reconnaissance d’entités nommées (Named Entity Recognition, NER) consiste à identifier et à catégoriser automatiquement, dans un contenu linguistique, les mentions correspondant à des entités d’intérêt, telles que des personnes, des lieux, des organisations ou toute autre catégorie définie par un guide d’annotation.
L’objectif du projet est de développer des méthodes permettant d’extraire automatiquement ces entités à partir d’enregistrements audio. Deux approches complémentaires seront étudiées : une approche en pipeline, reposant sur une transcription intermédiaire du signal, et une approche de bout en bout, visant à extraire les entités directement à partir du signal audio.
Dans l’approche en pipeline, un système de reconnaissance automatique de la parole (Automatic Speech Recognition, ASR) transcrit dans un premier temps le signal audio, puis un modèle de NER identifie et type les entités présentes dans la transcription. Cette architecture permet de s’appuyer sur des systèmes ASR et NER déjà performants et d’utiliser des modèles de NER à typage ouvert, tels que GLiNER, permettant d’intégrer de nouvelles catégories d’entités sans nécessiter un ré-entraînement complet du système.
Cette approche présente néanmoins une limite importante : sa dépendance à la qualité de la transcription automatique. Les erreurs produites par le système ASR peuvent se propager à l’étape de reconnaissance des entités. De plus, les sorties ASR diffèrent des données textuelles sur lesquelles les modèles de NER sont généralement entraînés, notamment par une ponctuation absente ou imprécise et par la présence de phénomènes propres à la parole spontanée. Une partie des travaux visera donc à étudier l’impact de ces différences et à améliorer la robustesse des modèles de NER aux sorties de systèmes ASR.
En parallèle, une approche de bout en bout sera explorée afin d’identifier les entités nommées directement à partir du signal audio, sans dépendre d’une transcription intermédiaire explicitement produite en amont. Cette approche pourra s’appuyer sur des modèles de parole pré-entraînés sur de grandes quantités de données multilingues, tels que XLSR-53 ou Whisper, et sur des architectures permettant d’assurer conjointement la transcription, la détection et le typage des entités. Des approches récentes telles que WhisperNER constituent notamment une piste intéressante pour permettre l’intégration de nouvelles catégories d’entités tout en exploitant directement les représentations issues du signal de parole.
L’approche de bout en bout pourrait permettre de limiter la propagation des erreurs inhérente aux architectures en pipeline et d’exploiter des informations présentes dans le signal acoustique mais absentes de la transcription. Elle soulève cependant d’autres difficultés, notamment la disponibilité plus limitée de données associant directement signal audio et annotations en entités nommées.
Le stage comportera plusieurs objectifs :
Le stage comprendra une composante expérimentale importante, incluant la préparation et la manipulation de données audio, l’entraînement et le fine-tuning de modèles, ainsi que l’évaluation et l’an
Solide maîtrise de Python ;
Des connaissances en reconnaissance automatique de la parole (ASR), en traitement automatique des langues (NLP) et/ou en reconnaissance d’entités nommées (NER) constitueront un plus.
Le stage pourra se dérouler au centre Inria de Paris, rue Barrault, dans le 13ᵉ arrondissement, ou à l’antenne Inria MINATEC de Grenoble, au sein d’un groupe de recherche spécialisé dans le traitement de la parole et de l’audio, composé de chercheurs et d’ingénieurs de recherche.