Engenheiro(a) de Dados Sr - Migração e Modernização DW - Databricks
Infosys Brasil está em busca de profissionais com o perfil de Engenheiro(a) de Dados Sr - Migração e Modernização DW - Databricks para juntar-se ao nosso time.
Qualificações requeridas:
Buscamos um(a) Engenheiro(a) de Dados para o programa de migração do DW legado para o Enterprise Lakehouse Databricks, com a missão de reconstruir os pipelines hoje implementados em DataStage e Azure Synapse — sem lift-and-shift. A partir da engenharia reversa dos jobs atuais. Será responsável por reimplementar os pipelines nativamente em PySpark e Spark SQL sobre a arquitetura medalhão (bronze/silver/gold), executando as waves de reconstrução por domínio com reconciliação e paridade contra o DW legado até o cutover.
Requsitos Mandatórios:
- PySpark e Python avançados: desenvolvimento de pipelines batch em escala, com testes e boas práticas de engenharia.
- SQL avançado e modelagem de dados: transformações complexas, tuning de performance e modelagem relacional/dimensional em contexto de DW.
- Databricks e Delta Lake: jobs, workflows e arquitetura medalhão (bronze, silver, gold) em produção; Delta Live Tables / Lakeflow e Asset Bundles.
- Migração / reconstrução de pipelines ETL: tradução de regras de negócio de ferramentas legadas para Spark (sem lift-and-shift), com ingestão CDC/batch de bancos relacionais.
- Ecossistema AWS: S3, Glue, EMR, Athena, Lambda, DMS e Step Functions.
- Azure Synapse: experiência com o ambiente legado (SQL pools e pipelines) para apoiar a engenharia reversa.
- Qualidade e reconciliação de dados: testes automatizados, DQ gates e comparação legado × novo para aceite de paridade.
- Git e CI/CD aplicados a pipelines de dados.
- Certificações Databricks (Data Analyst Associate, Data Engineer Associate).
Requisitos Desejáveis:
- Conhecimento de DataStage (leitura de jobs para engenharia reversa) — diferencial importante.
- Experiência prévia em programas de migração de DW para lakehouse — diferencial importante.
- Unity Catalog (permissões, lineage) e contratos de dados.
- Experiência no mercado financeiro ou de crédito.
Principais atividades e responsabilidades:
- Reconstruir os pipelines do DW legado em Databricks (PySpark / Spark SQL), a partir das especificações geradas pela engenharia reversa.
- Implementar as camadas bronze, silver e gold seguindo o template medalhão, os padrões de ingestão (CDC/batch) e o padrão de reconstrução definidos pelo projeto.
- Executar as waves de reconstrução por domínio, em coexistência com o DW legado até o cutover.
- Implementar regras de negócio e transformações com testes automatizados nos pipelines.
- Realizar a reconciliação e a validação de paridade dos dados entre o DW legado e o Lakehouse.
- Otimizar performance e custo dos pipelines (particionamento, OPTIMIZE/Z-ORDER, dimensionamento de jobs).
- Contribuir com a documentação técnica das regras migradas e apoiar a priorização das waves.
Informações adicionais:
Tipo de trabalho:
CLT, Horários flexíveis.
Pacote de benefícios:
- Vale Transporte
- Vale Refeição
- Auxílio Creche
- Seguro de Vida
- Auxílio Funerário
- Convênio Médico
- Odontológico
Carreira:
Atuação Global em clientes e/ou projetos nacionais e internacionais, possibilidade de movimentação de carreira internacional.