Somos uma startup de tecnologia em fase de crescimento, com uma plataforma digital de alto volume e uma operação orientada por dados.
Estamos buscando uma pessoa Engenheiro(a) de Dados Sênior para atuar na construção e evolução da nossa plataforma de dados, trabalhando desde a ingestão em larga escala até a camada semântica no Snowflake.
Essa pessoa terá papel importante na evolução da arquitetura de dados, garantindo confiabilidade, segurança, governança e eficiência de custos, além de atuar como referência técnica para o time de Dados.
É uma posição para quem gosta de desafios de escala, arquitetura, engenharia e ambientes em que decisões técnicas têm impacto direto no negócio.
- Pipelines em escala: projetar, implementar e sustentar processos de ingestão e transformação de dados em larga escala, batch e near-real-time, sobre AWS e Snowflake - Spark/EMR, Snowpipe, S3 e frameworks internos orientados a metadados.
- Arquitetura e modelagem: evoluir a arquitetura de dados em camadas (raw/trusted/refined), a modelagem analítica e a camada semântica corporativa, assegurando a consistência das métricas canônicas do negócio.
- Orquestração: operar e evoluir a orquestração em Airflow (ECS Fargate), definindo padrões de DAG, idempotência, estratégias de reprocessamento, SLAs e alertas.
- Qualidade e observabilidade de dados: implantar testes e contratos de dados, monitoramento de freshness e lineage, além de runbooks e resposta a incidentes de pipeline.
- Eficiência de custo: responder pela eficiência econômica da plataforma - consumo de créditos Snowflake, dimensionamento de warehouses, clustering/particionamento e políticas de ciclo de vida no storage.
- Segurança e governança: aplicar controles de acesso (RBAC), classificação e mascaramento de dados sensíveis, políticas de retenção e expurgo, em aderência à LGPD e às políticas internas de segurança da informação.
- Habilitação de consumo: disponibilizar datasets e features confiáveis para Ciência de Dados, BI, Risco e produtos de IA, incluindo acesso analítico por agentes, em parceria com Analytics, Produto e Engenharia.
- Padrões e documentação: registrar decisões de arquitetura (ADR/RFC), manter a documentação técnica no padrão corporativo e disseminar boas práticas junto ao time.
O que esperamos de você
Formação Acadêmica
- Graduação em Ciência da Computação, Sistemas de Informação, Engenharia, Estatística, Física, Economia ou áreas correlatas - ou experiência profissional equivalente comprovada.
Experiência
- Mínimo de 5 anos em Engenharia de Dados, sendo ao menos 2 anos em ambiente de alto volume e criticidade.
Competências Técnicas
- SQL avançado e Python aplicado a dados: PySpark, pandas e boto3.
- Apache Spark em produção: EMR, EKS ou equivalente, com domínio de tuning, particionamento e controle de custo.
- Snowflake: modelagem, performance tuning e gestão de consumo. Experiência sólida em BigQuery ou Redshift é considerada equivalente, desde que haja disposição para migração de stack.
- Databricks: conhecimento da plataforma - workspaces, clusters e jobs, Spark gerenciado, Delta Lake e Unity Catalog - e da sua integração com o ecossistema analítico.
- Apache Airflow em produção, preferencialmente em ambiente containerizado.
- Bancos de dados relacionais e NoSQL: PostgreSQL/Aurora e MongoDB.
- Qualidade e observabilidade de dados como prática consolidada - monitoramento, logging e alertas.
Será um diferencial
- dbt ou ferramenta equivalente de transformação versionada e testada.
- Streaming e CDC: Kafka, Kinesis, Debezium ou AWS DMS.
- Catálogo de dados, lineage, data contracts e camada semântica.
- Sustentação de IA/ML em produção: feature/dataset serving, MLflow, SageMaker.
- LGPD e tratamento de dados sensíveis em plataformas de larga escala.
- Neo4j ou outros bancos de grafo.
- Arquiteturas orientadas a domínio (Data Mesh), com avaliação pragmática de aplicabilidade.
- Vivência em produto digital de alto volume, redes sociais, marketplaces ou fintechs.
Como esperamos que você trabalhe
Pensamento Analítico e Sistêmico
Compreende a arquitetura de dados de ponta a ponta, enxerga as relações entre sistemas e fluxos e antecipa o impacto de decisões técnicas no negócio. Decompõe problemas complexos, identifica gargalos e atua preventivamente sobre escalabilidade e performance.
Autonomia e Senso de Dono
Opera com independência, prioriza atividades e gerencia múltiplas demandas sem direcionamento constante. Assume responsabilidade pela estabilidade e confiabilidade do ambiente de dados.
Comunicação Clara e Colaborativa
Traduz conceitos técnicos complexos para Produto, Negócio, Risco e Tecnologia. Argumenta tecnicamente com base em dados, sem rigidez, e atua como referência técnica acessível dentro do time.
Rigor Técnico e Atenção a Detalhes
Mantém alto padrão de qualidade em scripts, pipelines e documentação; revisa código e processos garantindo integridade, segurança e consistência das informações.
Acompanha a evolução de ferramentas e arquiteturas de dados (lakehouse, streaming, data contracts, IA aplicada a dados) e avalia a adoção por custo-benefício e aplicabilidade real ao contexto da companhia.
Resiliência e Gestão de Pressão
Mantém foco e clareza em situações críticas, como falhas de pipeline ou incidentes em produção; equilibra qualidade e velocidade e documenta aprendizados para evitar reincidência.
Trabalho Colaborativo em Ambientes Multidisciplinares
Constrói relações de confiança com engenharia, ciência de dados, BI e negócio, contribuindo para um ambiente colaborativo e orientado à solução.
Se você gosta de desafios de escala, tecnologia e de construir soluções que fazem diferença no negócio, vem fazer parte do nosso time.
Estamos construindo muita coisa por aqui, e queremos construir com você.