1. Contexto e Missão do Cargo
Estamos em processo de expansão da nossa estrutura de engenharia de dados e procuramos um profissional de perfil técnico, com foco em engenharia de dados avançada e sólidas fundações de DevOps e conhecimento de MLOps. Esta pessoa será responsável por desenhar, otimizar e manter a infraestrutura e os pipelines que sustentam os projetos de data locais, projetos de data science e as operações analíticas da empresa, servindo como uma ponte crítica entre o desenvolvimento de modelos e a produção em larga escala.
2. Principais Responsabilidades e Atividades
- Engenharia de Pipelines Complexos: Desenvolver, monitorizar e automatizar pipelines robustos de ingestão de dados (Batch e Streaming), lidando com cenários complexos como a integração avançada de APIs de fornecedores externos e web scraping de APIs aplicacionais.
- Arquitetura e Convenções de Data Warehouse: Desenhar e organizar o armazenamento de dados no Google BigQuery utilizando boas práticas de modelação. Garantir a correta transição e segregação lógica de ambientes, desde a receção de dados em bruto (Data Swamp / Data Lake) até às camadas otimizadas de disponibilização (Publish Layers).
- Automação e Infraestrutura (CI/CD): garantir o ciclo de vida do código e que as implementações sejam automatizadas.
- Cultura de Engenharia de Software: Contribuir para soluções altamente escaláveis, seguras e devidamente documentadas. Promover e estruturar repositórios modernos em ambiente Monorepo, facilitando a colaboração e a independência das equipas de Data Science.
3. Perfil Técnico e Requisitos do Candidato
Requisitos Mandatórios (Hard Skills)
- Experiência consolidada em Engenharia de Dados ou Engenharia de Software focada em sistemas de dados de larga escala.
- Experiência prática no ecossistema cloud GCP (Google Cloud Platform), com foco especializado em BigQuery.
- Proficiência comprovada no desenho de pipelines automatizados de CI/CD utilizando preferencialmente GitHub Actions (ou ferramentas equivalentes de mercado).
- Sólido entendimento de arquiteturas de dados modernas (Lakehouse, Data Lake) e suas respectivas convenções de camadas de dados.
- Proficiência em Inglês: Nível mínimo de conversação e escrita intermédio-avançado/fluente ( exemplo: B2 ou C1), para comunicação em ambientes técnicos e internacionais.
Requisitos Valorizados (Diferenciais)
- Experiência prática direta em conceitos e ferramentas de MLOps (gestão do ciclo de vida de modelos, serving de APIs de modelos, feature stores).
- Experiência no deployment de soluções em clusters orquestrados (Kubernetes), dependendo da necessidade arquitetural.
- Experiência com Observabilidade Usando Logging como Datadog ou Grafana
- Conhecimentos da metodologia SCRUM e de ferramentas como Jira.
4. Resumo da Stack Tecnológica Solicitada Categoria
Tecnologias / Conceitos Chave
Cloud & Storage
Google Cloud Platform (GCP), Google BigQuery
Infraestrutura & DevOps
Docker, Máquinas Virtuais (VMs)
CI/CD & Repositórios
GitHub Actions
SCRUM
Jira
Arquitetura de Dados
Data Swamp, Data Lake, Publish Layers, Convenções de DW
Idiomas
Inglês (B2 ou C1)