Une candidature complète en une minute — CV personnalisé et lettre de motivation, prêts à envoyer.
Unicancer recherche un Data Ingénieur Confirmé pour concevoir et piloter l’architecture data, assurer l’ingestion et le stockage des données de santé multi-établissements avec des flux sécurisés.
Vous contribuerez à la qualité, la conformité et à l’évolution de la data stack, tout en animant la montée en compétence des Data Engineers et en participant à des projets d’innovation IA et NLP.
Acteur majeur dans la construction de pipelines de données évolutifs pour traiter des données structurées et non structurées (données de santé de vie réelle).
Développer, maintenir et améliorer les solutions et infrastructures datas nécessaires à la collecte, la centralisation, le stockage et l’accès aux données de santé collectées auprès des établissements de soins contributeurs et mises à disposition des équipes scientifiques.
Piloter l’élaboration du plan de traitement et de l’architecture data en phase de conception
Participer à la conception de plateformes pour le traitement de volumes importants, en garantissant leur sécurité
Être force de proposition sur l’évolution de la data stack du Pôle GD (EDS fédérés, appariement SNDS)
Concevoir et maintenir les flux d’intégration (collecte, ingestion, stockage) multi-établissements
Mettre en place des pipelines sécurisés en amont des bases « gelées »
Piloter le gel des bases à échéance des jalons projets (vérification, figeage, qualification)
Améliorer et automatiser les flux d’intégration existantsQualité & conformité
Concevoir un process et un pipeline de contrôle qualité (confrontation auto/manuel)
Garantir et documenter la conformité réglementaire (RGPD/CNIL) et rédiger la documentation associée (SMQ, ISO 9001)
Participer aux projets d’innovation IA internes (LLM open weights, mise en production)
Assister les prestataires externes sur les solutions NLP/NER (données non structurées)
Proposer des indicateurs de suivi de l’activité DI et construire un dashboard
Assurer la montée en compétence de l’équipe Data Ingénieurs
Reporting auprès du manager hiérarchique et des managers fonctionnels, en lien avec les pilotes de projets
Participer aux réunions avec les équipes projets et le Pôle GD
Langages : SQL, Python (packages appréciés: solar, pandas, exploitation confs YAML), apprécié: SAS, PHP
Technos stockage / échange de données : BdD Relationnelle classique (apprécié: expérience sur Oracle), SFTP, apprécié: db analytique (ex: ClickHouse), NoSQL (ex: MongoDb pour documentaire), «Elasticsearch»
Outils: VCS (ex: git), outils de gestion de database (ex: Oracle SQL dev, Datagrip, MySQL Workbench, etc), Suite Office (dans l’ordre d’importance: Excel, PP, Word), apprécié : expérience sur l’utilisation d’outils d’ETL, de transformation de données (ex : dbt) et de création de « semantic layer »
Connaissances formats: JSON, CSV, YAML, XLSX (Excel), apprécié: SAS7BDAT (SAS), DICOM (fichier imagerie)
Intégration continue : connaissances en CI/CD
Transverses : Méthodologie Agile
Interopérabilité données de santé : connaissance format OMOP, FHIR HL7, OSIRIS serait un plus
Fonctionnelles : secteur de la santé, Entrepôts de Données de Santé, RGPD / CNIL, curiosité très prononcée pour la cancérologie
4 à 5 ans d’expérience minimum en tant que Data Ingénieur, avec une première expérience réussie en tant que Data Ingénieur dans le secteur de la santé.
Bonne compréhension du cycle de vie de la donnée, connaissances en architecture data (archi, data lineage, etc) et data modeling, de la data gouvernance et de la data privacy.
Capacité à travailler de manière agile dans un environnement collaboratif.