Descrição da vaga
Buscamos uma Pessoa Engenheira de Dados Júnior para atuar dedicada em um banco digital de grande porte, em plena expansão, contribuindo na construção e na evolução de pipelines de dados que sustentam produtos, análises e modelos de negócio do banco.
Você fará parte de um time de plataforma de dados em ambiente AWS, participando do ciclo completo dos dados — da ingestão e transformação em PySpark à disponibilização em camadas de Data Lake / Lakehouse — com acompanhamento de pessoas engenheiras sêniores, exposição a arquitetura moderna de dados em escala e uso de IA aplicada ao dia a dia de engenharia. É uma posição de crescimento, com espaço para aprender, assumir responsabilidades gradativamente e evoluir tecnicamente.
Responsabilidades e atribuições
- Desenvolver e manter pipelines de dados em Python / PySpark, seguindo padrões definidos pelo time.
- Escrever e ajustar consultas SQL para extração, transformação e validação de dados.
- Apoiar a ingestão de dados de diferentes fontes (bancos relacionais, APIs, eventos) para o Data Lake em AWS (S3, Glue, Athena, EMR).
- Participar da construção e manutenção de DAGs de orquestração no Airflow, sob orientação técnica.
- Aplicar boas práticas de modelagem em arquitetura medalhão (bronze, prata, ouro) e formatos colunares (Parquet / Delta).
- Implementar validações e checagens de qualidade de dados, documentando regras e resultados.
- Utilizar Git e a esteira de CI/CD para versionamento, revisão (code review) e deploy dos pipelines.
- Apoiar o monitoramento dos pipelines em produção, identificando falhas e ajudando na correção.
- Participar de cerimônias ágeis, refinamento de demandas e estimativas junto ao time.
- Utilizar ferramentas de IA aplicadas ao desenvolvimento (GitHub Copilot, Claude Code ou similares) para acelerar codificação, testes e documentação, com senso crítico sobre o resultado gerado.
Requisitos e qualificações
- Experiência prática em Python aplicado a dados, ainda que em projetos de menor porte, estágio ou acadêmicos.
- Conhecimento de SQL: joins, agregações, CTEs e funções de janela.
- Noções de Apache Spark / PySpark (DataFrames, transformações e ações).
- Familiaridade com conceitos de Data Lake, Data Warehouse e Lakehouse.
- Familiaridade com Git e fluxo de branches / pull requests.
- Noções de serviços de dados em nuvem, preferencialmente AWS (S3, Glue, Athena ou EMR).
- Vivência ou interesse em metodologias ágeis (Scrum/Kanban).
- Formação em andamento ou concluída em Ciência da Computação, Engenharia, Sistemas de Informação, Estatística, Análise e Desenvolvimento de Sistemas ou áreas correlatas.
Diferenciais
- Experiência ou estágio no setor financeiro, bancário ou fintech.
- Contato com Airflow ou outra ferramenta de orquestração.
- Noções de Kafka ou outras plataformas de streaming de dados.
- Contato com Docker, Kubernetes ou Terraform.
- Conhecimento de Trino / Presto ou Databricks.
- Noções de qualidade de dados, testes de pipeline e observabilidade.
- Certificações em AWS ou Databricks (Cloud Practitioner, Data Engineer Associate ou similares).
- Uso de ferramentas de IA no fluxo de desenvolvimento.
- Inglês para leitura de documentação técnica.
Informações adicionais
- Vale Alimentação e/ou Vale Refeição;
- Convênio Sesi e Sesc, oferecendo acesso a serviços de saúde, bem-estar e lazer;
- Parceria com Instituições de Ensino, com descontos exclusivos em cursos e programas educacionais;
- Auxílio para Certificações;
- Possibilidade de crescimento na empresa e de participação em projetos estratégicos;
- Oportunidade de trabalhar em uma empresa do mercado em plena expansão.