Estamos em busca de Engenheiros de Dados Pleno/Sênior para atuar no desenvolvimento, manutenção e otimização de pipelines de dados na plataforma Databricks. A pessoa selecionada trabalhará em conjunto com times de Analytics, Engenharia e Produto para garantir a qualidade, escalabilidade e governança dos dados que sustentam decisões estratégicas da empresa.
Responsabilidades:
- Desenvolver e manter pipelines de dados (batch e streaming) utilizando Databricks e Apache Spark.
- Projetar e implementar arquiteturas de dados seguindo o padrão Medallion (Bronze, Silver, Gold).
- Otimizar a performance de jobs Spark e consultas SQL em larga escala.
- Implementar e manter processos de ETL/ELT orquestrados (Databricks Workflows, Airflow etc.).
- Garantir a qualidade, consitência e governança dos dados (Unity Catalog, testes de dados).
- Colaborar com times de Analytics Engineering, Data Science e Engenharia de Software.
- Documentar processos, arquiteturas e decisões técnicas.
- Participar de revisões de código e contribuir para boas práticas de engenharia de dados.
- Experiência comprovada com Databricks (Notebooks, Jobs, Clusters, Delta Lake)
- Sólido conhecimento em Apache Spark (PySpark e/ou Scala)
- Experiência com SQL avançado para modelagem e otimização de queries
- Conhecimento em Python para desenvolvimento de pipelines de dados
- Experiência com arquitetura Medallion (Bronze/Silver/Gold) ou similar
- Vivência com ferramentas de orquestração (Airflow, Databricks Workflows, Azure Data Factory ou similar)
- Familiaridade com versionamento de código (Git) e práticas de CI/CD
- Conhecimento em modelagem de dados (dimensional, normalização)
- Experiência com um provedor de cloud (AWS, Azure ou GCP)
- Inglês técnico para leitura de documentação
- 3+ anos de experiência em engenharia de dados
Requisitos desejáveis:
- Certificações Databricks (Data Engineer Associate/Professional)
- Experiência com Delta Live Tables (DLT)
- Conhecimento em Unity Catalog para governança e segurança de dados
- Experiência com streaming de dados (Kafka, Structured Streaming)
- Vivência com ferramentas de transformação analítica (dbt)
- Conhecimento em Infraestrutura como Código (Terraform)
- Experiência com testes de qualidade de dados (Great Expectations, dbt tests)
- Vivência em ambientes de Machine Learning (MLflow) é um diferencial
- Experiência prévia em squads ágeis (Scrum/Kanban)
- Conhecimento em ferramentas de observabilidade e monitoramento de pipelines
- Conhecimento em D365
Engenheiro(a) de Dados Databricks (Híbrido - Recife) • Recife, Brasil