Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd.

Wrocławki

Hybrid

PLN 180,000 - 260,000

Full time

2 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Clurgo Ltd. poszukuje do zespołu Data Platform specjalistę z co najmniej 4 latami doświadczenia w Apache Spark i praktycznym wykorzystaniem PySpark, Spark-SQL oraz Structured Streaming. Będziesz projektować i wdrażać rozwiązania do konsolidacji danych w ODS (MongoDB) oraz architekturze Data Lakehouse, łącząc Spark z MongoDB i dbając o CI/CD oraz monitoring.

Wymagana znajomość Iceberg/Delta Lake/Hudi, Jenkins, Prometheus i Grafana, a także angielski na poziomie min. B2.

Qualifications

  • Minimum 4 lata doświadczenia z Apache Spark w środowiskach produkcyjnych.
  • Doświadczenie z PySpark, Spark-SQL, DataFrames i Structured Streaming.
  • Odczyt i zapis danych z MongoDB przy użyciu MongoDB Spark Connector.
  • Doświadczenie z Data Lakehouse i tabelami Iceberg, Delta Lake lub Hudi.
  • Znajomość Jenkins i automatyzacja testów oraz CI/CD dla Spark.
  • Znajomość Prometheus i Grafana do monitoringu.
  • Biegła komunikacja po angielsku (min. B2) i praca w Scrum/Kanban.

Responsibilities

  • Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi.
  • Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector.
  • Optymalizacja odczytów z MongoDB.
  • Budowa architektury Data Lakehouse z Iceberg/Delta Lake/Hudi.
  • Implementacja CI/CD dla schematów tabel, migracji i wersjonowania.
  • Konfiguracja metryk i logów (Prometheus + Grafana, OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream.
  • Definiowanie SLA/SLO oraz alertów.
  • Diagnoza problemów z rekordami i opóźnieniami danych.
  • Współpraca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i DevOps.

Skills

Apache Spark
PySpark
Spark-SQL
DataFrames
Structured Streaming
MongoDB
MongoDB Spark Connector
Data Lakehouse
Iceberg
Delta Lake
Hudi
Jenkins
Prometheus
Grafana
OpenTelemetry
Dynatrace
Kubernetes
Docker
Spark Operator
English B2

Tools

MongoDB Spark Connector

Job description

Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.

Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.

Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator

Model hybrydowy: 1 raz w tygodniu z biura we Wrocławiu

Szukamy Ciebie, jeśli:

Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark

Masz doświadczenie z PySpark, Spark-SQL, DataFrames oraz Structured Streaming

Posiadasz doświadczenie w odczycie i zapisie danych z/ do MongoDB przy użyciu MongoDB Spark Connector

Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)

Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark

Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)

Swobodnie komunikujesz się w języku angielskim (min. B2 ) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)

Mile widziane:
  • Praktyczna znajomość Dynatrace i OpenTelemetry
  • Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes
Zadania:
  • Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
  • Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
  • Optymalizacja odczytów z MongoDB
  • Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
  • Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
  • Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
  • Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
  • Definiowanie SLA/SLO oraz alertów
  • Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
  • Praca w Scrum/Kanban z Data Engineerami, Business Analystami, testerami i zespołem DevOps
Czego możesz się spodziewać:
  • współpracy w oparciu o kontrakt B2B
  • pracy hybrydowej: raz w tygodniu z biura we Wrocławiu
  • profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocław

Hybrid
PLN 180,000 - 280,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

On-site
PLN 180,000 - 260,000
Karta Multisport
Prywatna opieka medyczna
Spark Data Lakehouse Developer
Spark Data Lakehouse Developer

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

Upvanta sp. z o.o. • Wrocław

On-site
PLN 180,000 - 260,000
Spark / Data Lakehouse Developer (m/k/n)
Spark / Data Lakehouse Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 11,000 - 14,000
Data Engineer
Data Engineer

ASTEK Polska • Kraków

Hybrid
PLN 180,000 - 260,000
Senior Data Engineer
Senior Data Engineer

HeadHR • Wrocław

On-site
PLN 179,088 - 199,752
Data Engineer
Data Engineer

Link Group • Warszawa

On-site
PLN 180,000 - 240,000
Java Developer / Data Engineer
Java Developer / Data Engineer

Relout • Wrocław

Hybrid
PLN 180,000 - 240,000
Data Engineer
Data Engineer

HeadHR • Poland

On-site
PLN 180,000 - 260,000