Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd.

Wrocław

Hybrid

PLN 180,000 - 280,000

Full time

16 hours ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Clurgo Ltd. w ramach zespołu Data Platform poszukuje specjalisty ds. danych, który zaprojektuje i wdroży rozwiązania do rekonsyliacji danych w ODS opartym o MongoDB oraz zbuduje warstwy danych w architekturze Data Lakehouse.

Rola łączy Spark, PySpark i Spark SQL z optymalizacją przetwarzania, CI/CD oraz monitorowaniem procesów batch i streamingowych. Wymaga min. 4 lat pracy w środowiskach produkcyjnych i komunikatywnej znajomości angielskiego.

Qualifications

  • Minimum 4 years of production experience with Apache Spark.
  • Experience with PySpark, Spark SQL, DataFrames and Structured Streaming.
  • Experience reading/writing data to MongoDB via MongoDB Spark Connector.
  • Hands-on with Data Lakehouse architectures (Iceberg, Delta Lake, Hudi).
  • Knowledge of Jenkins and automation of tests and Spark deployment processes.
  • Monitoring/observability tools: Prometheus, Grafana, OpenTelemetry, Dynatrace.
  • English knowledge at least B2 and experience working in Agile (Scrum/Kanban).

Responsibilities

  • Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
  • Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
  • Optymalizacja odczytów z MongoDB
  • Budowa architektury medalionowej z Iceberg/Delta Lake/Hudi
  • Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
  • Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
  • Konfiguracja metryk (Prometheus + Grafana), logów i śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
  • Definiowanie SLA/SLO oraz alertów
  • Diagnoza problemów z rekordami i opóźnieniami danych
  • Praca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i DevOps

Skills

Apache Spark
PySpark
Spark-SQL
DataFrames
Structured Streaming
Angielski B2
Agile (Scrum/Kanban)
CI/CD
MonogoDB Spark Connector
Prometheus Grafana
Dynatrace/OpenTelemetry
Jenkins
Docker
Kubernetes

Tools

MongoDB
Iceberg
Delta Lake
Hudi
Spark Operator

Job description

Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.

Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.

Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator

Model hybrydowy: 1 raz w tygodniu z biura we Wrocławiu

Szukamy Ciebie, jeśli:

Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark

Masz doświadczenie z PySpark, Spark-SQL, DataFrames oraz Structured Streaming

Posiadasz doświadczenie w odczycie i zapisie danych z/ do MongoDB przy użyciu MongoDB Spark Connector

Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)

Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark

Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)

Swobodnie komunikujesz się w języku angielskim (min. B2 ) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)

Mile widziane:
  • Praktyczna znajomość Dynatrace i OpenTelemetry
  • Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes
Zadania:
  • Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
  • Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
  • Optymalizacja odczytów z MongoDB
  • Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
  • Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
  • Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
  • Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
  • Definiowanie SLA/SLO oraz alertów
  • Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
  • Praca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i zespołem DevOps
Czego możesz się spodziewać:
  • współpracy w oparciu o kontrakt B2B
  • pracy hybrydowej: raz w tygodniu z biura we Wrocławiu
  • profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocławki

Hybrid
PLN 180,000 - 260,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

On-site
PLN 180,000 - 260,000
Karta Multisport
Prywatna opieka medyczna
Spark Data Lakehouse Developer
Spark Data Lakehouse Developer

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

Upvanta sp. z o.o. • Wrocław

On-site
PLN 180,000 - 260,000
Spark / Data Lakehouse Developer (m/k/n)
Spark / Data Lakehouse Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 11,000 - 14,000
Data Engineer
Data Engineer

ASTEK Polska • Kraków

Hybrid
PLN 180,000 - 260,000
Senior Data Engineer
Senior Data Engineer

HeadHR • Wrocław

On-site
PLN 179,088 - 199,752
Data Engineer
Data Engineer

Link Group • Warszawa

On-site
PLN 180,000 - 240,000
Java Developer / Data Engineer
Java Developer / Data Engineer

Relout • Wrocław

Hybrid
PLN 180,000 - 240,000
Data Engineer
Data Engineer

HeadHR • Poland

On-site
PLN 180,000 - 260,000