Il s'agit d'assister le client en tant qu'ingénieur DATA sur le service de cloud datawarehouse sous Azure.
Nous recherchons un Data Engineer ayant déjà fait du DevOps, capable de travailler à la fois sur les traitements de données (Databricks, architecture médaillon bronze / silver / gold) et sur l'infrastructure cloud associée (Azure, Terraform, Jenkins), dans un contexte d'entreprise avec des standards Git et CI/CD.Du conseil, des études d'opportunité et dossiers d'innovation seront demandés.
Missions principales (Data & supervision)
- Concevoir, développer et enchaîner des notebooks Databricks en PySpark pour alimenter les zones bronze, silver et gold.
- Maîtriser et exploiter les formats parquet, delta et csv, en comprenant leurs impacts sur la performance, la robustesse et les coûts.
- Optimiser les notebooks et jobs existants (performance, qualité de données, coûts d'exécution).
- Mettre en place et faire vivre la supervision des flux : monitoring des pipelines Azure Data Factory, suivi de la qualité des données, création d'alertes et de tableaux de bord de suivi.
- Contribuer à la fiabilisation globale de la plateforme data (détection d'anomalies, reprise sur incident, bonnes pratiques de développement).
- Collaborer avec les équipes métier et techniques pour comprendre les besoins, prioriser les évolutions et industrialiser les traitements.
Missions annexes (DevOps & infra)
- Mettre à jour et faire évoluer les repos d'infrastructure (Terraform, Jenkins) en suivant les templates et bonnes pratiques du git d'entreprise.
- Maintenir, paramétrer et exécuter les pipelines Jenkins liés aux déploiements et aux traitements data, en garantissant leur fiabilité et leur traçabilité.
- Participer activement à la vie des repos GitHub : revue de code (PR/MR), gestion des branches, compréhension des workflows Git avancés, automatisation et diffusion des bonnes pratiques.
Technologies & environnement technique
- Cloud & data platform : Azure, Databricks, Azure Data Factory, Azure Storage Account, Azure Key Vault, Power BI.
- Infra & CI/CD : Terraform, Jenkins, GitHub (PR/MR, workflows), intégration runtime via VM.
- Langages & frameworks : Python, PySpark (DataFrame API, Spark SQL), SQL.
- Formats & data : parquet, delta, csv…
- Librairies Python courantes :
- pyspark (transformations, jointures, agrégations, optimisations).
- delta-spark et librairies Delta Lake pour la gestion des tables (ACID, time travel, optimisation).
- Packages Azure (azure-identity, azure-keyvault-secrets, azure-storage-blob, etc.) pour l'intégration avec les services cloud.