N’envoyez pas un CV générique — générez un CV et une lettre de motivation adaptés à ce poste précis.
Edumapper, éditeur d’un référentiel de formations en France, recherche un data engineer en début de carrière pour porter la chaîne de data du prototype à la production. Vous développerez et maintiendrez des pipelines en Python et orchestrations Dagster/ Airflow, en vous appuyant sur DuckDB et les briques d’IA générative.
Localisation: Paris 8e, CDI, 4 jours au bureau et 1 jour en télétravail optionnel. Rémunération entre 43k et 52k€ brut annuels, selon profil et expérience.
Mission : construire et faire évoluer les pipelines et les agents IA qui alimentent le catalogue de formations d’Edumapper, en garantissant la fiabilité de la donnée produite.
Edumapper modélise l’offre d’études supérieures française et ses débouchés professionnels. Notre référentiel de formations est le cœur du produit : plus il est complet, structuré et à jour, mieux nous aidons les lycéens à faire les bons choix d’orientation. Or cette information est aujourd’hui éclatée entre des milliers de sites d’établissements, dans autant de formats différents, et se renouvelle en permanence. C’est précisément l’objet de ce poste : la collecter, la structurer et la maintenir à jour.
En collaboration directe avec Romain Boyer, notre Head of Data, les co-fondateurs et le reste de l’équipe, tu prends la responsabilité de la chaîne de données, de la collecte jusqu’à la mise à disposition :
Agents d’enrichissement du catalogue. Maintenir et faire évoluer notre workflow d’agents IA qui complète automatiquement la base de formations à partir de sources hétérogènes (sites d’établissements, Parcoursup, référentiels publics…) : élargir la couverture, absorber les évolutions des sources, améliorer la précision de l’extraction.
Collecte et mise à disposition des données. Récupérer, traiter et exposer des données de natures très variées : ingestion, normalisation, modélisation et mise à disposition auprès des équipes produit, tech et science.
Qualité du référentiel. Garantir la fiabilité de la base Edumapper : contrôles automatisés, déduplication et résolution d’entités, monitoring des pipelines. En lien étroit avec les équipes tech et science pour définir et diffuser les bonnes pratiques de modélisation.
Analytics. Mettre en place les analytics d’Edumapper, principalement construits sur le comportement de nos utilisateurs : instrumentation, modélisation des événements, restitution pour piloter le produit et l’activité.
Notre stack : Python, SQL, Dagster, DuckDB et les briques d’IA générative (LLM, agents, RAG) qui vont avec.
Tu portes tes sujets du prototype à la production, en revue avec Romain notre Head of Data, sur un périmètre directement visible dans le produit.
Edumapper est un environnement idéal pour les passionnés de traitement et de transformation de la donnée, rigoureux et autonomes, appréciant les petites équipes et désireux de participer à la conception d’un produit à fort impact social. Nous recherchons un(e) data engineer en début de carrière, très à l’aise en Python, qui a envie de faire de l’ingénierie de la donnée pour de vrai : modéliser proprement, construire des pipelines robustes, et mettre en production. Nous n’attendons pas un profil senior, mais des bases techniques solides, de la rigueur, et l’envie de monter en compétences sur l’ensemble du métier (de l’IA générative à l’analytics, en passant par la modélisation et la qualité de la donnée).
Très bon niveau en Python : c’est le socle du poste.
Bonnes bases en SQL et goût pour l’intégration de données hétérogènes dans des référentiels proprement modélisés.
Expérience de construction de flux de traitement de données (ETL / ELT) ; la prise en main d’un orchestrateur (Dagster, Airflow, dbt…) est un vrai plus.
Un fort intérêt pour les technologies d’IA générative (LLM, agents, RAG) et le web scraping, idéalement une première expérience sur ces sujets.
Une sensibilité aux enjeux de qualité et de test de la donnée ; la connaissance de DuckDB ou d’outils d’analytics produit sera appréciée.
Diplômé(e) d’une grande école d’ingénieurs ou d'un Master en informatique, data science, mathématiques appliquées, statistique ou domaine connexe.
0 à 2 ans d’expérience, stages et alternances compris : un premier poste ou une alternance sur des sujets data est un excellent point de départ.
Des projets personnels, académiques ou associatifs autour de la donnée, du scraping ou des LLM sont un excellent signal : n’hésite pas à nous les partager.
Rigueur et exigence sur la qualité de ce que tu produis.
Curiosité et désir fort d’apprendre de nouveaux outils et technologies.
Bonne communication, capacité à collaborer avec des interlocuteurs techniques et non techniques.
Autonomie face à un sujet ouvert : savoir avancer, poser les bonnes questions, itérer.
Un intérêt pour le monde de l’éducation et de l’orientation est un plus.
Contrat : CDI
Localisation : Paris 8e
Remote : 4 jours au bureau, 1 jour en télétravail optionnel. Chez Edumapper, on est convaincus que les meilleures idées naissent ensemble, autour d’un café, d’un tableau blanc gribouillé, d’une discussion spontanée. Le full remote n’est pas une option à court terme.
Macbook à disposition
Démarrage : dès que possible
Rémunération : 43 à 52k