Senior Data Engineer / Spark Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ

Wrocław

Hybrid

PLN 203,000 - 240,000

Full time

2 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Benefits offered by this job

Praca hybrydowa—Wrocław
Budżet B2B 1100–1300 zł/MD

Job summary

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ poszukuje doświadczonego Spark/Data Lakehouse Developera do projektowania i rozwoju rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Będziesz współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość i wydajność procesów danych.

Zakres obowiązków obejmuje rekoncyliację danych w Spark, porównania danych między ODS a systemami źródłowymi,

Qualifications

  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
  • Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
  • Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
  • Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
  • Dobra znajomość języka Python.
  • Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
  • Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
  • Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
  • Praktyczna znajomość Jira i Confluence.
  • Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Responsibilities

  • Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
  • Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
  • Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
  • Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
  • Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
  • Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
  • Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
  • Implementacja monitoringu, metryk i alertowania dla procesów danych.
  • Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
  • Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
  • Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
  • Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
  • Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

Skills

Python
Agile
Data Lake

Tools

Apache Spark
MongoDB Spark Connector
Apache Iceberg
Jira
Confluence
Jenkins
Prometheus
Grafana
Kubernetes
Docker
Spark Operator
Delta Lake
Apache Hudi

Job description

Nasze wymagania
  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
  • Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
  • Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
  • Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
  • Dobra znajomość języka Python.
  • Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
  • Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
  • Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
  • Praktyczna znajomość Jira i Confluence.
  • Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
Mile widziane
  • Doświadczenie z Delta Lake lub Apache Hudi.
  • Znajomość Kubernetes, Docker oraz Spark Operator.
  • Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
  • Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
  • Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).
O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Zakres obowiązków
  • Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
  • Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
  • Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
  • Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
  • Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
  • Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
  • Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
  • Implementacja monitoringu, metryk i alertowania dla procesów danych.
  • Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
  • Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
  • Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
  • Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
  • Udział w code review oraz mentoring mniej doświadczonych członków zespołu.
Oferujemy

budżet: B2B, 1100-1300 zł/MD

Praca hybrydowa - Wrocław

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Data Engineer / Spark Developer
Senior Data Engineer / Spark Developer

Upvanta sp. z o.o. • Wrocław

Hybrid
PLN 180,000 - 270,000
Senior Data Engineer / Spark Developer
Senior Data Engineer / Spark Developer

Upvanta • Wrocław

Hybrid
PLN 180,000 - 280,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

On-site
PLN 180,000 - 260,000
Karta Multisport
Prywatna opieka medyczna
Senior Data Engineer - Spark / Data Lakehouse
Senior Data Engineer - Spark / Data Lakehouse

Clurgo Ltd. • Wrocław

Hybrid
PLN 180,000 - 280,000
Spark / Data Lakehouse Developer (m/k/n)
Spark / Data Lakehouse Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ • Wrocław

Hybrid
PLN 11,000 - 14,000
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

Upvanta sp. z o.o. • Wrocław

On-site
PLN 180,000 - 260,000
Spark Data Lakehouse Developer
Spark Data Lakehouse Developer

ITLT • Wrocław

Hybrid
PLN 165,000 - 220,000
Karta Multisport
Prywatna opieka medyczna
Spark / Data Lakehouse Developer
Spark / Data Lakehouse Developer

ALGOTEQUE Innovation Hub • Wrocław

Hybrid
PLN 180,000 - 260,000
Senior Spark & Data Lakehouse Engineer
Senior Spark & Data Lakehouse Engineer

Upvanta • Wrocław

Hybrid
PLN 180,000 - 280,000
Data Engineer
Data Engineer

ASTEK Polska • Kraków

Hybrid
PLN 180,000 - 260,000