Spark Data Engineer for Scalable Pipelines (Databricks)

HireHi

United States

Remote

USD 110,000 - 160,000

Full time

10 days ago
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

HireHi ищет инженера по данным для проектирования и реализации масштабируемых пайплайнов на Apache Spark (Databricks приветствуется). Вы будете писать эффективный PySpark код и разворачивать сложные SQL-запросы для извлечения и проверки данных.

Требуется 3+ года опыта в Data Software Engineering, знания pytest и Git. Рассматриваются кандидаты с англ. не ниже B2, готовность работать в команде и понимать процессы CI/CD.

Qualifications

  • 3+ года опыта в разработке Data Software
  • Опыт работы со Spark, предпочтительно в Databricks
  • Умение работать с PySpark и SQL
  • Опыт юнит-тестирования с pytest
  • Знание принципов ETL и инженерии данных
  • Опыт работы с системами контроля версий Git
  • Уровень английского не ниже B2
  • Желателен опыт работы в облачной среде (Azure/AWS/GCP) и знание CI/CD

Responsibilities

  • Проектирование, разработка и сопровождение масштабируемых пайплайнов данных на Spark
  • Написание эффективного PySpark-кода для трансформаций и обработки
  • Разработка и выполнение сложных SQL-запросов для получения данных
  • Руководство тестируемостью кода с pytest
  • Сотрудничество с дата-учеными, аналитиками и инженерами
  • Мониторинг и устранение неполадок в рабочих процессах
  • Документирование технических дизайнов и лучших практик

Skills

Коммуникационные навыки
Командная работа
Проблемное мышление
Адаптивность

Tools

Apache Spark
Databricks
PySpark
SQL
pytest
Git
Delta Lake
MLflow

Job description

HireHi ищет инженера по данным для проектирования и реализации масштабируемых пайплайнов на Apache Spark (Databricks приветствуется). Вы будете писать эффективный PySpark код и разворачивать сложные SQL-запросы для извлечения и проверки данных.

Требуется 3+ года опыта в Data Software Engineering, знания pytest и Git. Рассматриваются кандидаты с англ. не ниже B2, готовность работать в команде и понимать процессы CI/CD.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

data engineer for scalable data pipelines
data engineer for scalable data pipelines

HireHi • United States

Remote
USD 110,000 - 160,000
Data Testing Engineer - ETL, Databricks & CI/CD
Data Testing Engineer - ETL, Databricks & CI/CD

HireHi • United States

Remote
USD 70,000 - 110,000
Корпоративное обучение и возмещение за
Полный пакет льгот
Оплачиваемые больничные дни
Data Engineer: Databricks & AWS Pipeline Expert
Data Engineer: Databricks & AWS Pipeline Expert

HireHi • United States

Remote
USD 110,000 - 160,000
Data Engineer: SAP Data Platforms & Cloud Pipelines
Data Engineer: SAP Data Platforms & Cloud Pipelines

HireHi • United States

Remote
USD 110,000 - 150,000
Senior Data Engineer - Modern Data Platforms (Databricks & Azure)
Senior Data Engineer - Modern Data Platforms (Databricks & Azure)

HireHi • United States

Remote
USD 90,000 - 150,000
Long-term contract (12+ months)
B2B engagement
Data Engineer: Scalable Pipelines, Databricks & Cloud
Data Engineer: Scalable Pipelines, Databricks & Cloud

HireHi • United States

Remote
USD 90,000 - 130,000
Data Engineer: Pipelines & BI for Finance Data
Data Engineer: Pipelines & BI for Finance Data

HireHi • United States

Remote
USD 90,000 - 130,000
Remote Data Engineer — Real-Time Pipelines & AI Enablement
Remote Data Engineer — Real-Time Pipelines & AI Enablement

HireHi • United States

Remote
USD 180,000 - 260,000
Remote work
Senior Data Engineer: Databricks & PySpark Pipelines
Senior Data Engineer: Databricks & PySpark Pipelines

EPAM Systems Inc • United States

Remote
USD 140,000 - 180,000
Senior Data Software Engineer/ Databricks, Apache Spark, PySpark
Senior Data Software Engineer/ Databricks, Apache Spark, PySpark

EPAM Systems Inc • United States

Remote
USD 140,000 - 180,000