Stage : Reconnaissance d’entités nommées dans la parole

Inria

France

Hybrid

EUR 10,000 - 15,000

Full time

12 hours ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Benefits offered by this job

Télétravail après 2 mois
Restauration subventionnée
Transports publics remboursés
Congés déterminés
Équipements professionnels
Prestations sociales

Job summary

Stage à Inria Grenoble/Paris portant sur la reconnaissance d’entités nommées dans la parole. Le candidat développera des méthodes en pipeline ASR-NER et explorera des approches bout-en-bout à partir du signal audio, en s’appuyant sur des modèles pré-entraînés multilingues et GLiNER pour des entités ouvertes.

Le stage comporte une forte composante expérimentale : manipulation de données audio, entraînement et fine-tuning de modèles, évaluation et comparaison des architectures, dans un contexte

Qualifications

  • Solide maîtrise de Python.
  • Pratique de bibliothèques et frameworks d’apprentissage automatique et profond comme PyTorch, PyTorch Lightning, Keras, Scikit-learn et Transformers.
  • Bonne connaissance des méthodes d’apprentissage automatique et d’apprentissage profond.
  • Intérêt pour le traitement de la parole et la manipulation de différents types de données.
  • Intérêt pour les projets interdisciplinaires à l’interface entre informatique et sciences humaines et sociales.
  • Bonne maîtrise de l’anglais.

Responsibilities

  • Réaliser un état de l’art des approches existantes pour l’extraction d’entités nommées dans la parole.
  • Préparer des corpus associant signal audio, transcriptions et annotations en entités nommées.
  • Mettre en œuvre une première approche en pipeline ASR-NER.
  • Adapter un modèle de NER à typage ouvert (GLiNER) aux catégories du projet.
  • Améliorer la robustesse du NER aux sorties ASR via fine-tuning.
  • Explorer une approche de bout en bout directe à partir du signal audio.
  • Comparer les approches en pipeline et bout en bout sur performances et robustesse.

Skills

Python
PyTorch
ML/DL concepts
Anglais

Education

M2 en IA
mathématiques
mathématiques appliquées
informatique

Tools

PyTorch
PyTorch Lightning
Keras
Scikit-learn
Transformers

Job description

Stage : Reconnaissance d’entités nommées dans la parole

Other valued qualifications : M2 en IA, mathématiques, mathématiques appliquées, informatique ou équivalent, avec une forte motivation pour la recherche appliquée

Le ou la stagiaire sera accueilli(e) au sein de la Mission Défense & Sécurité, créée en 2020 afin de fédérer et de développer les différentes actions d’Inria répondant aux besoins numériques des forces armées et du ministère de l’Intérieur. Le stage se déroulera au sein du pôle de recherche Parole & Audio, sous la direction de Clara Ponchard et Pauline Soutrenon. Le stage porte sur la reconnaissance d’entités nommées dans la parole. La reconnaissance d’entités nommées (Named Entity Recognition, NER) consiste à identifier et à catégoriser automatiquement, dans un contenu linguistique, les mentions correspondant à des entités d’intérêt, telles que des personnes, des lieux, des organisations ou toute autre catégorie définie par un guide d’annotation.

L’objectif du projet est de développer des méthodes permettant d’extraire automatiquement ces entités à partir d’enregistrements audio. Deux approches complémentaires seront étudiées : une approche en pipeline, reposant sur une transcription intermédiaire du signal, et une approche de bout en bout, visant à extraire les entités directement à partir du signal audio.

Dans l’approche en pipeline, un système de reconnaissance automatique de la parole (Automatic Speech Recognition, ASR) transcrit dans un premier temps le signal audio, puis un modèle de NER identifie et type les entités présentes dans la transcription. Cette architecture permet de s’appuyer sur des systèmes ASR et NER déjà performants et d’utiliser des modèles de NER à typage ouvert, tels que GLiNER, permettant d’intégrer de nouvelles catégories d’entités sans nécessiter un ré-entraînement complet du système.

Cette approche présente néanmoins une limite importante : sa dépendance à la qualité de la transcription automatique. Les erreurs produites par le système ASR peuvent se propager à l’étape de reconnaissance des entités. De plus, les sorties ASR diffèrent des données textuelles sur lesquelles les modèles de NER sont généralement entraînés, notamment par une ponctuation absente ou imprécise et par la présence de phénomènes propres à la parole spontanée. Une partie des travaux visera donc à étudier l’impact de ces différences et à améliorer la robustesse des modèles de NER aux sorties de systèmes ASR.

En parallèle, une approche de bout en bout sera explorée afin d’identifier les entités nommées directement à partir du signal audio, sans dépendre d’une transcription intermédiaire explicitement produite en amont. Cette approche pourra s’appuyer sur des modèles de parole pré-entraînés sur de grandes quantités de données multilingues, tels que XLSR-53 ou Whisper, et sur des architectures permettant d’assurer conjointement la transcription, la détection et le typage des entités. Des approches récentes telles que WhisperNER constituent notamment une piste intéressante pour permettre l’intégration de nouvelles catégories d’entités tout en exploitant directement les représentations issues du signal de parole.

L’approche de bout en bout pourrait permettre de limiter la propagation des erreurs inhérente aux architectures en pipeline et d’exploiter des informations présentes dans le signal acoustique mais absentes de la transcription. Elle soulève cependant d’autres difficultés, notamment la disponibilité plus limitée de données associant directement signal audio et annotations en entités nommées.

Le stage comportera plusieurs objectifs :

  • Réaliser un état de l’art des approches existantes pour l’extraction d’entités nommées à partir de la parole, en étudiant à la fois les architectures en pipeline et les approches de bout en bout ;
  • Prendre en main et préparer des corpus associant signal audio, transcriptions et annotations en entités nommées, notamment dans un contexte multilingue ;
  • Mettre en œuvre une première approche en pipeline combinant un système de reconnaissance automatique de la parole (ASR) et un modèle de reconnaissance d’entités nommées (NER) ;
  • Adapter un modèle de NER à typage ouvert, tel que GLiNER, aux catégories d’entités définies dans le cadre du projet ;
  • Améliorer la robustesse du système de NER aux sorties ASR, notamment par fine-tuning sur des transcriptions automatiques ou artificiellement bruitées ;
  • Explorer et mettre en œuvre une approche de bout en bout permettant d’extraire les entités nommées directement à partir du signal audio, en s’appuyant sur des modèles de parole pré-entraînés et des architectures récentes ;
  • Comparer les approches en pipeline et de bout en bout en termes de performances, de robustesse aux différentes conditions de parole et de capacité de généralisation à différentes langues et catégories d’entités.

Le stage comprendra une composante expérimentale importante, incluant la préparation et la manipulation de données audio, l’entraînement et le fine-tuning de modèles, ainsi que l’évaluation et l’an

Solide maîtrise de Python ;

  • Pratique de bibliothèques et frameworks d’apprentissage automatique et profond tels que PyTorch, PyTorch Lightning, Keras, Scikit-learn et Transformers (Hugging Face), ou d’outils équivalents ;
  • Bonne connaissance des méthodes d’apprentissage automatique et d’apprentissage profond ;
  • Intérêt pour le traitement de la parole et la manipulation de différents types de données (audio, texte, signaux) ;
  • Intérêt pour les projets interdisciplinaires à l’interface entre informatique et sciences humaines et sociales ;
  • Bonne maîtrise de l’anglais.

Des connaissances en reconnaissance automatique de la parole (ASR), en traitement automatique des langues (NLP) et/ou en reconnaissance d’entités nommées (NER) constitueront un plus.

  • Restauration subventionnée
  • Transports publics remboursés partiellement
  • Congés déterminés en fonction de la durée du stage
  • Possibilité de télétravail après 2 mois d'ancienneté (jusqu’à deux jours par semaine)
  • Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
  • Prestations sociales, culturelles et sportives (Association de gestion des œuvres sociales d’Inria)
  • Town/city :Centre Inria de l'Université Grenoble Alpes ou Siège (Grenoble ou Paris )

Le stage pourra se dérouler au centre Inria de Paris, rue Barrault, dans le 13ᵉ arrondissement, ou à l’antenne Inria MINATEC de Grenoble, au sein d’un groupe de recherche spécialisé dans le traitement de la parole et de l’audio, composé de chercheurs et d’ingénieurs de recherche.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Stage : Reconnaissance d’entités nommées dans la parole
Stage : Reconnaissance d’entités nommées dans la parole

Inria • Grenoble, Paris

Remote
EUR 13,000 - 20,000
Restauration subventionnée
Transports publics remboursés
Télétravail après 2 mois
+2
Stage : Extension d’un système d’identification automatique de la langue au code-switching et à la détection d’accent
Stage : Extension d’un système d’identification automatique de la langue au code-switching et à la détection d’accent

Inria • Paris

Hybrid
EUR 7,800 - 12,000
Restauration subventionnée
Transports publics remboursés
Congés stage
+3
Ingénieur scientifique contractuel / Production, traitement et analyse des données / Langue, parole et audio / Bac + 5 ou équivalent
Ingénieur scientifique contractuel / Production, traitement et analyse des données / Langue, parole et audio / Bac + 5 ou équivalent

Inria • Paris

On-site
EUR 52,000 - 72,000
Restauration subventionnée
Transports publics remboursés
Congés annuels 7 semaines + RTT
+3
Pré-thèse F/H : Nouveaux Algorithmes pour le Diagnostic Acoustique de Salle Automatisé
Pré-thèse F/H : Nouveaux Algorithmes pour le Diagnostic Acoustique de Salle Automatisé

Inria • Strasbourg

On-site
EUR 17,000 - 23,000
Restauration subventionnée
Transports publics remboursés
Congés: 7 semaines + RTT
+2
Stage - Paysages d’heuristiques pour les recherches arborescentes (F/H)
Stage - Paysages d’heuristiques pour les recherches arborescentes (F/H)

Inria • Villeneuve-d'Ascq

On-site
EUR 5,500 - 8,300
Restauration subventionnée
Transports publics remboursés partiels
Équipements professionnels à dispo
Stage - Système de suivi d'objets respectueux de la vie privée H/F
Stage - Système de suivi d'objets respectueux de la vie privée H/F

Inria • Lyon

On-site
EUR 6,700 - 10,000
Subventions de restauration
Transports publics remboursés
Télétravail 90 jours/an
+3
Tunneling boîte grise pour l'optimisation combinatoire multi-objectifs
Tunneling boîte grise pour l'optimisation combinatoire multi-objectifs

Inria • France

Hybrid
EUR 7,600 - 11,000
Restauration subventionnée
Transports publics remboursés
Équipements professionnels
+1
Stage de Master en IA pour la microscopie biologique
Stage de Master en IA pour la microscopie biologique

Inria • Saclay

Remote
EUR 10,000 - 13,000
Restauration subventionnée
Transports publics remboursés 75%
Congés annuels et RTT
Stage NER Parole et IA: Pipeline et Fin‑en‑Fin
Stage NER Parole et IA: Pipeline et Fin‑en‑Fin

Inria • France

Hybrid
EUR 10,000 - 15,000
Télétravail après 2 mois
Restauration subventionnée
Transports publics remboursés
+3
Stage NER Parole : Pipeline et End-to-End
Stage NER Parole : Pipeline et End-to-End

Inria • Grenoble, Paris

Remote
EUR 13,000 - 20,000
Restauration subventionnée
Transports publics remboursés
Télétravail après 2 mois
+2