Stage Data / ML Engineer — NLP

codoc

Paris

Sur place

EUR 13 000 - 20 000

Plein temps

Il y a 5 jours
Soyez parmi les premiers à postuler
Générateur de candidature

Obtenez une réponse de cet employeur — un CV et une lettre de motivation adaptés exactement à ce qu’on recherche pour ce poste.

Passez les filtres ATS

Résumé du poste

codoc conçoit et exploite une plateforme d’entrepôt de données de santé, avec dé-pseudonymisation des documents cliniques et conformité RGPD. Le stage s’inscrit dans l’équipe R&D / NLP et vise à déployer, surveiller et améliorer une chaîne d’inférence, puis ajouter une couche d’apprentissage supervisé et une boucle de correction.

Le candidat idéal est en Master 1/2, maîtrise Python et les pratiques de développement, et possède des bases en NLP, ML et détection d’entités.

Qualifications

  • Master 1 ou Master 2 en data science, informatique ou génie logiciel est requis.
  • Bonne maîtrise de Python et des bonnes pratiques de développement (git, tests, structuration de projet).
  • Expérience souhaitée en NLP, ML et détection d’entités.

Responsabilités

  • Passer la chaîne en production: empaqueter l’inférence et l’intégrer au pipeline d’ingestion.
  • Mesurer et suivre la production: dashboards et alertes pour les défauts.
  • Ajouter une couche apprises et mécanisme de correction ciblée.

Connaissances

Python
Git
Tests
Docker
CI
SQL
PostgreSQL
Oracle
NLP
Machine learning
Rigueur
Confidentialité

Formation

Master 1 ou Master 2 en data science, informatique ou génie logiciel

Outils

Docker
CI/CD
Git
pytest

Description du poste

codoc conçoit et opère la plateforme d’entrepôt de données de santé (EDS) de plusieurs hôpitaux français. Tous les documents cliniques qui entrent dans l’entrepôt (comptes rendus d’hospitalisation, de consultation, courriers) sont pseudonymisés avant d’être accessibles aux utilisateurs. Le RGPD et le référentiel EDS de la CNIL l’imposent.

Notre algorithme de détection des identifiants s’appuie sur des expressions régulières et l’appariement avec les données d’identité disponibles en base. Il traite l’ensemble du flux documentaire, y compris les formats variés (texte brut, HTML balisé) que produisent les éditeurs cliniques.

Cependant, certains cas complexes restent des opportunités d’amélioration : les identités mentionnées dans le texte libre, les variantes d’orthographe, ou les structures HTML particulières (fragments tabulaires isolés, espacements encodés) qui demandent une approche affiner. Nous disposons d’un corpus annoté de référence et d’un protocole d’évaluation établi.

Le stage porte sur les prochaines étapes : affiner la détection sur ces cas limits, déployer l’algorithme optimisé en production sur le flux réel, mettre en place un suivi continu de sa performance, et construire une capacité à identifier et corriger rapidement les défauts spécifiques qui remontent du terrain.

Tes missions :

Tu rejoindras l’équipe R&D / NLP, avec un encadrement rapproché, sur trois axes.

1. Passer la chaîne en production
  • Packager la chaîne d’inférence et la brancher sur le pipeline d’ingestion : débit, reprise sur erreur, exécution sur l’infrastructure hospitalière
2. Mesurer ce qui se passe en production

Le corpus de référence donne une photo à un instant donné. Le flux réel, lui, bouge : nouveaux établissements, nouveaux formats de documents, qualité d’OCR qui varie.

  • Instrumenter le flux : détection par type d’entité, par type de document et par établissement
  • Monter les tableaux de bord et les alertes pour qualifier un défaut rapidement
3. Ajouter une couche apprise et un mécanisme de correction ciblée
  • Constituer un jeu d’entraînement à partir de ces appariements, en supervision faible
  • Entraîner un modèle de reconnaissance d’entités qui attrape ce que les règles ratent, en tenant compte de ce qu’on peut réellement faire tourner sur l’infrastructure existante
Ce que tu livreras
  • Une chaîne d’inférence déployable et documentée, avec ses tests
  • De quoi suivre la performance en production : métriques, tableau de bord, alertes
  • Un prototype de la boucle de correction, testé sur des défauts réels rejoués
Expérience souhaitée :

Master 1 ou Master 2 en data science, informatique ou génie logiciel — les profils à dominante développement avec de vraies bases en ML sont les bienvenus, ce stage est davantage un stage d’ingénierie que de modélisationTrès bonne maîtrise de Python et des bonnes pratiques de développement : git, tests, structuration de projet, environnementsSQL : manipulation de volumes importants sur base relationnelle (PostgreSQL, Oracle)Maîtrise des expressions régulières au-delà de l’usage occasionnelBases solides en machine learning : évaluation de modèles, métriques de classification, compréhension du sur-apprentissage et de la dériveNotions de NLP : reconnaissance d’entités nommées, embeddings, transformers - et compréhension de ce qui distingue une approche par règles d’une approche appriseFort intérêt pour le domaine de la santéFortement apprécié :Une première mise en production d’un modèle, même modeste : API, conteneurisation, CI, exécution planifiéePratique de Docker, d’un outil de CI, d’un outil de suivi d’expériences ou de versionnement de modèlesSensibilité aux approches de supervision faible ou distante, d’apprentissage actif ou semi-superviséSensibilité au monitoring et à l’observabilitéSavoir-être :Rigueur et sens de la confidentialité : tu manipuleras des données de santé réellesAutonomie et esprit critiqueGoût du travail bien fait sur des sujets peu spectaculaires mais critiques.

Obtenez votre examen gratuit et confidentiel de votre CV.

ou faites glisser et déposez votre fichier ici.

Similar jobs

Postes similaires à comparer

Ingénieur Data & ML – Santé, NLP et Déploiement
Ingénieur Data & ML – Santé, NLP et Déploiement

codoc • Paris

Sur place
EUR 13 000 - 20 000
STAGE - Ingénieur.e Recherche – IA appliquée au médical (F/H)
STAGE - Ingénieur.e Recherche – IA appliquée au médical (F/H)

Dassault Systèmes • Vélizy-Villacoublay

Sur place
EUR 10 000 - 13 000
Environnement collaboratif
Collaboration internationale
Diversité des technologies
Software Engineer - Stage de fin d'études
Software Engineer - Stage de fin d'études

RainPath • Paris

Hybride
EUR 12 000 - 16 000
Stage - Data Engineer - Services Publics - Nantes H/F
Stage - Data Engineer - Services Publics - Nantes H/F

Sopra-Steria • Nantes

Sur place
EUR 13 000 - 17 000
Stage - Stage Fin d’études / Ingénieur innovation en informatique, sciences des données - Paris, France (H/F)
Stage - Stage Fin d’études / Ingénieur innovation en informatique, sciences des données - Paris, France (H/F)

Astek • Paris

Sur place
EUR 12 000 - 17 000
Accélérateur d’expérience
Projets stimulants
Accompagnement personnalisé
+2
STAGE - Ingénieur.e Recherche - Modélisation et prédiction des parcours patients (F/H)
STAGE - Ingénieur.e Recherche - Modélisation et prédiction des parcours patients (F/H)

Dassault Systèmes • Vélizy-Villacoublay

Sur place
EUR 10 000 - 13 000
Environnement collaboratif
Collaboration internationale
Diversité technologiques
+1
DATA SCIENTIST – NLP & IA EN SANTÉ
DATA SCIENTIST – NLP & IA EN SANTÉ

Hôpital Foch • Suresnes

Sur place
EUR 65 000 - 90 000
Stage - Ingénieur Développement d'Une Plateforme Logicielle pour l'IA Appliquée aux Cnd H/F
Stage - Ingénieur Développement d'Une Plateforme Logicielle pour l'IA Appliquée aux Cnd H/F

Framatome • Chalon-sur-Saône

Sur place
EUR 10 000 - 17 000
STAGE - Ingénieur.e Recherche - inférence causale et jumeaux numériques (F/H)
STAGE - Ingénieur.e Recherche - inférence causale et jumeaux numériques (F/H)

Dassault Systèmes • Valbonne

Sur place
EUR 10 000 - 15 000
Stage - Data Engineer - Services Publics - Nantes
Stage - Data Engineer - Services Publics - Nantes

Sopra Steria USA • Nantes

Sur place
EUR 11 000 - 16 000
Télétravail partiel
Mutuelle
CSE
+2