Big Data Engineer

Inter Cars S.A.

Województwo mazowieckie

Hybrid

PLN 180,000 - 280,000

Full time

8 days ago
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Zniżka pracownicza na części samochodó
Szkolenia wewnętrzne i zewnętrzne

Job summary

Inter Cars S.A. zaprasza do zespołu budującego Operational Analytics Platform (OAP) — platformę danych działającą w przeszło 20 krajach Europy.

Pracujemy w modelu hybrydowym: źródła i Kafka on-premise, przetwarzanie i analitykę w Azure. Szukamy specjalisty od projektowania i rozwoju pipeline'ów danych w Azure Databricks (PySpark, Structured Streaming, Delta Lake), integracji z Oracle/SQL Server i PostgreSQL, a także dbania o jakość, idempotencję i observability.

Qualifications

  • Doświadczenie w Azure Databricks, zarządzanie jobami i klastrami.
  • Znajomość Apache Spark i PySpark, w tym Spark Structured Streaming.
  • Umiejętność diagnozowania i optymalizacji wydajności Spark oraz layoutu tabel Delta (partycjonowanie, ewolucja schematu).
  • Znajomość Apache Kafka i Debezium, replikacja CDC.
  • Doświadczenie z Oracle/SQL Server/PostgreSQL.
  • Projektowanie procesów idempotentnych i odpornych na duplikaty.
  • Znajomość architektury Lakehouse i Unity Catalog.
  • Doświadczenie z GitLab CI/CD i Databricks Asset Bundles.
  • Znajomość Azure Entra ID i Key Vault na poziomie bezpiecznego budowania.

Responsibilities

  • Projektowanie i rozwój pipeline'ów batchowych i strumieniowych w Azure Databricks.
  • Konsumowanie strumieni CDC (Debezium/Kafka) i materializacja w warstwach Lakehouse.
  • Integracja danych z relacyjnych baz danych (Oracle, SQL Server, PostgreSQL), API i systemów plikowych.
  • Projektowanie struktur danych w architekturze Medallion (bronze / silver / gold) w Unity Catalog.
  • Optymalizacja wydajności i kosztów przetwarzania (partycjonowanie, layout tabel, dobór klastrów).
  • Monitoring pipeline'ów, alertowanie, diagnozowanie problemów z wydajnością, dostępnością i jakością danych.
  • Opis danych w katalogu OpenMetadata: własność, klasyfikacja, kontrakty danych, produkty danych.
  • Utrzymanie kodu w GitLab z CI/CD, testy, code review.
  • Współpraca z właścicielami systemów źródłowych, zespołami BI, Data Science i odbiorcami biznesowymi.
  • Udział w kształtowaniu standardów technicznych platformy.

Skills

SQL
Python
Spark
Azure Databricks
Delta Lake
Kafka
Debezium
Unity Catalog
OpenMetadata
GitLab CI/CD

Tools

PySpark
Structured Streaming
Delta Lake
Unity Catalog
Debezium
Kafka
Oracle
SQL Server
PostgreSQL

Job description

Dołącz do zespołu budującego Operational Analytics Platform (OAP) – platformę danych Inter Cars działającą w przeszło 20 krajach Europy. Platforma składa się z trzech elementów: replikacji danych w czasie zbliżonym do rzeczywistego (Debezium → Kafka → Spark Structured Streaming), środowiska analitycznego Azure Databricks (Lakehouse, Unity Catalog) oraz katalogu danych OpenMetadata obejmującego całą grupę. Szukamy osoby, która będzie projektować i rozwijać pipeline'y danych na tej platformie – od strumieni CDC z systemów źródłowych, przez warstwy Lakehouse, po dane produktowe udostępniane zespołom biznesowym, BI i Data Science. Pracujemy w modelu hybrydowym: systemy źródłowe i Kafka on-premise, przetwarzanie i analityka w Azure.

Czym będziesz się zajmował:
  • Projektowanie i rozwój pipeline'ów batchowych i strumieniowych w Azure Databricks (PySpark, Structured Streaming, Delta Lake),
  • Konsumowanie strumieni CDC (Debezium/Kafka) i ich materializacja w warstwach Lakehouse z zachowaniem poprawności (deduplikacja, kolejność zdarzeń, ponowne przetwarzanie),
  • Integracja danych z relacyjnych baz danych (Oracle, SQL Server, PostgreSQL), API i systemów plikowych,
  • Projektowanie struktur danych w architekturze Medallion (bronze / silver / gold) w Unity Catalog,
  • Optymalizacja wydajności i kosztów przetwarzania (partycjonowanie, layout tabel, dobór klastrów),
  • Monitoring pipeline'ów, alertowanie, diagnozowanie problemów z wydajnością, dostępnością i jakością danych,
  • Opisywanie danych w katalogu OpenMetadata: własność, klasyfikacja, kontrakty danych, produkty danych,
  • Utrzymanie kodu w GitLab z CI/CD (Databricks Asset Bundles), testy, code review,
  • Współpraca z właścicielami systemów źródłowych, zespołami BI, Data Science i odbiorcami biznesowymi,
  • Udział w kształtowaniu standardów technicznych platformy.
Oczekujemy:
  • Praktyczne doświadczenie w Azure Databricks: joby, klastry, Delta Lake, Unity Catalog,
  • Bardzo dobra znajomość Apache Spark i PySpark, w tym Spark Structured Streaming,
  • Umiejętność diagnozowania i optymalizacji wydajności procesów Spark oraz layoutu tabel Delta (partycjonowanie, compaction, ewolucja schematu).
  • Znajomość podstaw Apache Kafka: topics, partitions, consumer groups, offsets, Schema Registry, formaty Avro/JSON,
  • Rozumienie mechanizmów Change Data Capture i replikacji zmian z relacyjnych baz danych,
  • Umiejętność projektowania procesów idempotentnych, odpornych na duplikaty, zmianę kolejności i ponowne przetwarzanie zdarzeń.
  • Bardzo dobra znajomość SQL i Pythona w kontekście przetwarzania danych,
  • Doświadczenie w pracy z SQL Server i/lub Oracle,
  • Znajomość architektury Lakehouse i wzorca Medallion,
  • Rozumienie zagadnień jakości, kompletności i śledzenia pochodzenia danych (lineage).
  • Git, CI/CD (GitLab CI, Azure DevOps lub podobne), testy jednostkowe i integracyjne procesów danych,
  • Rozumienie modelu tożsamości i sekretów w Azure (Entra ID, Key Vault) w stopniu pozwalającym bezpiecznie budować rozwiązania.
Czego oczekujemy poza technologią:
  • Samodzielność w analizie złożonych problemów w rozproszonych systemach danych,
  • Świadomość wpływu decyzji architektonicznych na wydajność, koszt, bezpieczeństwo i utrzymanie,
  • Projektowanie rozwiązań z myślą o ich obserwowalności i późniejszym utrzymaniu,
  • Jasna komunikacja i dokumentowanie decyzji technicznych - zarówno dla zespołów technicznych, jak i biznesu.
  • Stabilne warunki zatrudnienia i przyjazna atmosfera pracy.
  • Pracę hybrydową z naszego biura, znajdującego się w Galerii Młociny.
  • Możliwość rozwoju zawodowego w strukturach wewnętrznych.
  • Możliwość skorzystania z benefitów pozapłacowych na preferencyjnych warunkach.
  • Możliwość współpracy z zespołem ekspertów.
  • Zniżkę pracowniczą na części samochodowe grupy Inter Cars.
  • Szkolenia wewnętrzne i zewnętrzne rozwijające
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Data Analyst
Data Analyst

Inter Cars S.A. • Województwo mazowieckie

Hybrid
PLN 90,000 - 150,000
Zniżka pracownicza na części samochod
Szkolenia wewnętrzne i zewnętrzne
Pracę hybrydową w biurze Galerii Młoc‑
Senior Data Engineer (f/m/x)
Senior Data Engineer (f/m/x)

AtlantisJobs • Polska

Remote
PLN 180,000 - 280,000
Data Engineer (m/k)
Data Engineer (m/k)

Polenergia • Warszawa

Hybrid
PLN 180,000 - 300,000
LuxMed prywatna opieka medyczna
Karta Multisport
Dofinansowanie kulturalne/wyjścia doTe
+2
Lead Data Architect
Lead Data Architect

NTFY - Nice To Fit You • Warszawa

On-site
PLN 180,000 - 280,000
Smaczne posiłki i kawa :(
Opieka medyczna i ubezpieczenie na zy‑
Dofinansowanie Multisport
+3
Associate Azure Data Support Specialist (w/m/d)
Associate Azure Data Support Specialist (w/m/d)

Summ-IT • Poznań

On-site
PLN 120,000 - 180,000
Praca z biura w centrum Poznania
Remote work model
Elastyczne godziny pracy
+1
Azure Data Engineer with Databricks (AI&Data)
Azure Data Engineer with Databricks (AI&Data)

Accenture Technology • Warszawa, Wrocław

On-site
PLN 180,000 - 280,000
Permanent employment
Coaching path
Training package
+3
Data Operations Specialist
Data Operations Specialist

summ-it s.a. • Poznań

On-site
PLN 180,000 - 260,000
Praca zdalna
Biuro w centrum Poznania
Rozwój w międzynarodowej firmie
+1
Kierownik/czka Inżynierii i Zarządzania Danymi
Kierownik/czka Inżynierii i Zarządzania Danymi

Grupa NEUCA • Województwo kujawsko-pomorskie

On-site
PLN 250,000 - 320,000
Associate Data Operations Specialist
Associate Data Operations Specialist

summ-it s.a. • Poznań

Hybrid
PLN 180,000 - 230,000
Biuro w centrum Poznania
Elastyczne godziny pracy
Opieka medyczna
+2
Azure Data Engineer
Azure Data Engineer

Infotree Global Solutions Inc. • Polska

On-site
PLN 180,000 - 270,000