Senior Data Engineer / Spark Developer

Upvanta

Wrocław

Hybrid

PLN 180,000 - 280,000

Full time

2 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Upvanta poszukuje doświadczonego Spark/Data Lakehouse Developera do projektowania i rozwoju rozwiązań do przetwarzania danych w środowisku Big Data. Współtworzy nowoczesną architekturę Data Lakehouse opartą o Spark, MongoDB i Iceberg, dbając o jakość i wydajność procesów danych.

Wymagane minimum 4 lata doświadczenia w Spark, biegła znajomość PySpark, Spark SQL i DataFrame API, a także umiejętność integracji Spark z MongoDB. Praca w biurze we Wrocławiu 1–2 dni w tygodniu w modelu hybrydowym.

Qualifications

  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.

Responsibilities

  • Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
  • Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
  • Tworzenie i rozwijanie reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
  • Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
  • Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
  • Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
  • Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
  • Implementacja monitoringu, metryk i alertowania dla procesów danych.
  • Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
  • Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
  • Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
  • Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
  • Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

Skills

Apache Spark
PySpark
Spark SQL
DataFrame API
Structured Streaming
MongoDB Spark Connector
Python
Jenkins
Prometheus
Grafana
Scrum/Kanban
Jira
Confluence

Tools

Kubernetes
Docker
Spark Operator
OpenTelemetry
Dynatrace

Job description

O projekcie:

O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Wymagania:
  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
  • Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
  • Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
  • Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
  • Dobra znajomość języka Python.
  • Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
  • Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
  • Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
  • Praktyczna znajomość Jira i Confluence.
  • Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
Mile widziane
  • Doświadczenie z Delta Lake lub Apache Hudi.
  • Znajomość Kubernetes, Docker oraz Spark Operator.
  • Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
  • Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
  • Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).
Codzienne zadania:
  • Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
  • Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
  • Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
  • Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
  • Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
  • Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
  • Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
  • Implementacja monitoringu, metryk i alertowania dla procesów danych.
  • Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
  • Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
  • Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
  • Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
  • Udział w code review oraz mentoring mniej doświadczonych członków zespołu.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Data Engineer / Spark Developer
Senior Data Engineer / Spark Developer

Upvanta sp. z o.o. • Wrocław

Hybrid
PLN 180,000 - 270,000
Senior Data Engineer / Spark Developer (m/k/n)
Senior Data Engineer / Spark Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 203,000 - 240,000
Praca hybrydowa—Wrocław
Budżet B2B 1100–1300 zł/MD
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

On-site
PLN 180,000 - 260,000
Karta Multisport
Prywatna opieka medyczna
Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocław

Hybrid
PLN 180,000 - 280,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

Upvanta sp. z o.o. • Wrocław

On-site
PLN 180,000 - 260,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

ALGOTEQUE Innovation Hub • Wrocław

Hybrid
PLN 180,000 - 260,000
Spark Data Lakehouse Developer
Spark Data Lakehouse Developer

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Spark / Data Lakehouse Developer (m/k/n)
Spark / Data Lakehouse Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 11,000 - 14,000
Data Engineer
Data Engineer

Link Group • Warszawa

On-site
PLN 180,000 - 240,000
Senior Spark & Data Lakehouse Engineer
Senior Spark & Data Lakehouse Engineer

Upvanta • Wrocław

Hybrid
PLN 180,000 - 280,000