Job Search and Career Advice Platform

Activez les alertes d’offres d’emploi par e-mail !

Doctorat détection automatique multimodale des disfluences typiques du bégaiement (H/F)

CNRS

Vandœuvre-lès-Nancy

Sur place

EUR 60 000 - 80 000

Plein temps

Hier
Soyez parmi les premiers à postuler

Générez un CV personnalisé en quelques minutes

Décrochez un entretien et gagnez plus. En savoir plus

Résumé du poste

Une institution de recherche propose un doctorat en détection automatique des disfluences liées au bégaiement. Le candidat doit posséder un master en informatique, de fortes compétences en apprentissage automatique et une bonne maîtrise de Python. Ce doctorat se déroulera sur 36 mois à Vandœuvre-lès-Nancy, avec un salaire de 2200,00 € par mois. Les missions incluent le développement d'approches multimodales et l'évaluation de performances. Un intérêt pour les troubles de la parole sera un plus.

Qualifications

  • Master en informatique requis.
  • Solides compétences en apprentissage automatique et profond.
  • Maîtrise de Python et des frameworks de ML.
  • Intérêt pour le traitement du signal et le NLP.
  • Autonomie et rigueur indispensables.

Responsabilités

  • Conception d'une approche multimodale pour la détection de disfluences.
  • Implémentation de l'encodage audio, vidéo et texte.
  • Développement d'un classifieur et évaluation des performances.

Connaissances

Apprentissage automatique
Python
Gestion du signal audio/vidéo
Communication
Analyse

Formation

Master en informatique

Outils

PyTorch
TensorFlow
Description du poste
Doctorat détection automatique multimodale des disfluences typiques du bégaiement (H/F)

Cette offre est disponible dans les langues suivantes :
Date Limite Candidature : mardi 6 janvier 2026 23:59:00 heure de Paris

Assurez-vous que votre profil candidat soit correctement renseigné avant de postuler

Informations générales

Intitulé de l'offre : Doctorat détection automatique multimodale des disfluences typiques du bégaiement (H/F)
Référence : UMR5267-IVADID-002
Nombre de Postes : 1
Lieu de travail : VANDOEUVRE LES NANCY CEDEX
Date de publication : mardi 16 décembre 2025
Type de contrat : CDD Doctorant
Durée du contrat : 36 mois
Date de début de la thèse : 7 janvier 2026
Quotité de travail : Complet
Rémunération : La rémunération est d'un minimum de 2200,00 € mensuel
Section(s) CN : 06 - Sciences de l'information : fondements de l'informatique, calculs, algorithmes, représentations, exploitations

Description du sujet de thèse
  1. Introduction
    Le bégaiement, trouble de la fluence affectant des millions de personnes, se caractérise par des disfluences spécifiques (blocages, prolongations, répétitions) liées à un dysfonctionnement du contrôle moteur de la parole. Leur détection automatique, bien que déjà explorée via des modèles audios, reste limitée par une faible robustesse, une difficulté à identifier certaines disfluences comme les blocages silencieux, et une dépendance à des données rares. Cette thèse propose une approche multimodale (audio, vidéo, texte) pour améliorer la précision et la robustesse de la détection, en s’appuyant sur un corpus audiovisuel de locuteurs francophones bègues. L'analyse reposera sur des techniques d'encodage spécifiques à chaque modalité, suivies d'une fusion stratégique de leurs représentations pour une classification finale.
  2. Missions
    L’objectif de cette thèse est de concevoir, développer et évaluer une approche multimodale d’apprentissage profond pour la détection automatique des disfluences typiques du bégaiement en français, en combinant les modalités audio, vidéo et textuelle. Le travail s’appuiera sur un corpus audiovisuel annoté de locuteurs francophones bègues, avec une attention particulière portée aux disfluences difficiles à détecter par l’audio seul, comme les blocages silencieux, et à la robustesse face à la variabilité individuelle.
    • Encodage audio : Implémenter et adapter Stutternet pour extraire des caractéristiques acoustiques pertinentes à la détection de disfluences, en capturant les dépendances temporelles.
    • Encodage vidéo : Développer et entraîner des modèles de vision pour analyser les séquences vidéos à la recherche d’indices visuels du bégaiement (tensions faciales, clignements, mouvements atypiques). L’extraction de landmarks faciaux sera également explorée comme source complémentaire ou alternative de caractéristiques.
    • Encodage texte : Générer des transcriptions automatiques et les encoder à l’aide de modèles de langage pré-entraînés afin d’extraire le contexte linguistique et de repérer des schémas textuels caractéristiques des disfluences.
    • Fusion multimodale : Mettre en œuvre et comparer plusieurs stratégies de fusion des représentations issues des trois modalités, telles que la concaténation, les mécanismes d’attention adaptatifs ou d’autres approches exploitant la complémentarité des données.
    • Classification et évaluation : Développer un classifieur opérant sur la représentation fusionnée pour prédire la présence ou l’absence de bégaiement dans une fenêtre temporelle donnée. L’évaluation s’appuiera sur des métriques standards (précision, rappel, F1-score, AUC), avec une comparaison aux annotations manuelles expertes. Des analyses qualitatives seront également menées pour interpréter les erreurs du modèle et affiner l’approche.
    Au-delà de la détection, la thèse vise à apporter une contribution méthodologique au domaine de la fusion multimodale appliquée à la parole pathologique, avec un potentiel impact en contexte clinique.
  3. Compétences attendues
    Le candidat devra avoir un master en informatique, de solides compétences en apprentissage automatique et profond, une bonne maîtrise de Python et des frameworks comme PyTorch ou TensorFlow, ainsi qu’un intérêt pour le traitement du signal (audio/vidéo) et, idéalement, pour le NLP. Autonomie, rigueur, esprit critique et capacités d’analyse sont indispensables, tout comme de bonnes compétences en communication pour évoluer dans un environnement pluridisciplinaire. Un intérêt pour la phonétique, la linguistique et les troubles de la parole, en particulier le bégaiement, sera un plus.
Contexte de travail

Le doctorant sera impliqué dans un projet de recherche pluridisciplinaire associant deux laboratoires complémentaires : le LORIA, spécialisé en informatique, avec une expertise en traitement de la parole et en apprentissage profond, et PRAXILING, laboratoire en sciences du langage reconnu pour ses travaux en phonétique et sur le bégaiement. La recherche s’appuiera sur un corpus audiovisuel existant et annoté de locuteurs francophones présentant des troubles de la fluence. La thèse sera encadrée conjointement par des chercheurs en informatique et en sciences du langage, assurant une co-supervision interdisciplinaire. Elle se déroulera principalement au LORIA, à Nancy, avec des séjours réguliers au laboratoire Praxiling, à Montpellier, pour avoir des échanges scientifiques et enrichir l’approche de la problématique par une double expertise.

Contraintes et risques

Déplacements (pris en charge) à prévoir entre les deux laboratoires porteurs du projet.

Obtenez votre examen gratuit et confidentiel de votre CV.
ou faites glisser et déposez un fichier PDF, DOC, DOCX, ODT ou PAGES jusqu’à 5 Mo.