Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ

Wrocław

On-site

PLN 180,000 - 260,000

Full time

3 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Karta Multisport
Prywatna opieka medyczna

Job summary

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ poszukuje doświadczonego Spark/Data Lakehouse Developera do zespołu Data Platform. Będziesz projektować i rozwijać rozwiązania do rekoncyliacji i synchronizacji danych w ODS oparte na MongoDB oraz budować warstwy danych w architekturze Data Lakehouse – Raw po Gold.

Zakres obejmuje projektowanie procesów Spark SQL/PySpark, monitorowanie, optymalizację i CI/CD dla migracji oraz współpracę w Scrum/Kanban z Data Engineerami i DevOps.

Qualifications

  • Co najmniej 4 lata doświadczenia z Apache Spark w środowisku produkcyjnym.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrames i Structured Streaming.
  • Doświadczenie z MongoDB i Spark Connector oraz modelowania danych.
  • Praktyczna znajomość Iceberg i architektury Data Lakehouse (upsert/merge).
  • Doświadczenie w CI/CD z Jenkins i automatyzacja testów oraz deploymentów Spark.
  • Bardzo dobra znajomość Python i Spark SQL.
  • Znajomość Prometheus i Grafana w monitoringu i observability.
  • Praca w Scrum/Kanban; znajomość Jira i Confluence.

Responsibilities

  • Projektowanie i implementacja procesów Spark SQL/PySpark do walidacji danych (MongoDB/ODS).
  • Implementacja reguł jakości danych, wykrywanie duplikatów i anomalii.
  • Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down).
  • Projektowanie warstwy danych Raw → Bronze → Silver → Gold z użyciem Delta Lake/Iceberg/Hudi oraz CI/CD dla schematów i migracji.
  • Monitoring i observability procesów Spark/batch/stream (Prometheus, Grafana, OpenTelemetry, Dynatrace).
  • Automatyzacja deploymentów Spark na Docker/Kubernetes (Spark Operator).
  • Diagnozowanie problemów z danymi i wydajnością oraz dokumentacja techniczna.

Skills

Spark
PySpark
Spark SQL
Data Modeling
CI/CD
Python
Observability
Scrum/Kanban
Jira/Confluence

Tools

MongoDB
MongoDB Connector
Delta Lake
Iceberg
Hudi
Prometheus
Grafana
OpenTelemetry
Dynatrace
Docker
Kubernetes
Spark Operator
Jenkins

Job description

Nasze wymagania:
  • 4+ lata doświadczenia w pracy z Apache Spark w środowisku produkcyjnym.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrames i Structured Streaming.
  • Doświadczenie z MongoDB i Spark Connector oraz znajomość modelowania i indeksowania danych.
  • Praktyczna znajomość Apache Iceberg i architektury Data Lakehouse (upsert/merge, optymalizacja zapisów).
  • Doświadczenie w CI/CD z Jenkins, w tym automatyzacji testów i deploymentów aplikacji Spark.
  • Bardzo dobra znajomość Python oraz Spark SQL.
  • Znajomość Prometheus i Grafana w obszarze monitoringu i observability.
  • Doświadczenie w pracy w Scrum/Kanban oraz znajomość Jira i Confluence.
O projekcie:

Dla naszego Klienta z sektora finansowego poszukujemy doświadczonego Spark / Data Lakehouse Developera, który dołączy do zespołu Data Platform. Osoba na tym stanowisku będzie odpowiedzialna za projektowanie i rozwój rozwiązań do rekoncyliacji i synchronizacji danych w warstwie ODS (Operational Data Store), opartych na MongoDB, a także za budowę i utrzymanie warstw danych w architekturze Data Lakehouse – od surowych danych po warstwy Curated, Silver i Gold.

Zakres obowiązków:
  • Projektowanie i implementacja procesów Spark SQL/PySpark do walidacji i porównywania danych (MongoDB/ODS).
  • Implementacja reguł jakości danych, detekcji duplikatów, anomalii i braków oraz raportowania/alertowania.
  • Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down, schema‑aware reads).
  • Projektowanie warstwy danych Raw → Bronze → Silver → Gold z wykorzystaniem Delta Lake/Iceberg/Hudi oraz CI/CD dla schematów i migracji.
  • Monitoring i observability procesów Spark/batch/stream (Prometheus, Grafana, OpenTelemetry, Dynatrace) oraz definiowanie SLA/SLO.
  • Automatyzacja deploymentów Spark na Docker/Kubernetes (Spark Operator).
  • Diagnozowanie problemów z danymi, wydajnością i opóźnieniami procesów.
  • Tworzenie dokumentacji technicznej, runbooków i diagramów przepływu danych.
  • Współpraca w Scrum/Kanban z Data Engineerami, BA, testerami i DevOps; prowadzenie warsztatów i code review.
Oferujemy:
  • Karta Multisport
  • Prywatna opieka medyczna
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

Upvanta sp. z o.o. • Wrocław

On-site
PLN 180,000 - 260,000
Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocławki

Hybrid
PLN 180,000 - 260,000
Spark Data Lakehouse Developer
Spark Data Lakehouse Developer

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocław

Hybrid
PLN 180,000 - 280,000
Spark / Data Lakehouse Developer (m/k/n)
Spark / Data Lakehouse Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 11,000 - 14,000
Remote Spark Data Lakehouse Engineer (Long-Term)
Remote Spark Data Lakehouse Engineer (Long-Term)

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Senior Spark & Data Lakehouse Engineer
Senior Spark & Data Lakehouse Engineer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

On-site
PLN 180,000 - 260,000
Karta Multisport
Prywatna opieka medyczna
Data Engineer
Data Engineer

Link Group • Warszawa

On-site
PLN 180,000 - 240,000
Data Engineer
Data Engineer

ASTEK Polska • Kraków

Hybrid
PLN 180,000 - 260,000
Senior Data Engineer: Spark, MongoDB & Lakehouse (Hybrid)
Senior Data Engineer: Spark, MongoDB & Lakehouse (Hybrid)

Clurgo Ltd. • Wrocławki

Hybrid
PLN 180,000 - 260,000