Atuar na evolução da confiabilidade, automação e eficiência operacional dos ambientes de desenvolvimento e produção, apoiando as squads nos temas relacionados a dados, DevOps, Cloud, Kubernetes e entrega contínua.
O objetivo da posição é garantir ambientes confiáveis e sustentáveis, reduzindo trabalho operacional e dependências manuais por meio de automação, observabilidade, prevenção de incidentes e práticas de Platform Engineering, promovendo maior autonomia das squads.
Mais do que resolver problemas quando eles acontecem, esperamos que essa pessoa identifique padrões, elimine causas recorrentes e construa mecanismos para que problemas conhecidos deixem de exigir intervenção humana.
Responsabilidades e atribuições:
- Apoiar as squads de desenvolvimento nos temas relacionados a ambientes DevOps, Cloud, Kubernetes, banco de dados, integração e entrega contínua;
- Identificar atividades operacionais repetitivas e desenvolver soluções de automação, self-service ou eliminação de processos manuais, reduzindo o toil do time e das squads;
- Identificar problemas recorrentes em ambientes DevOps, integração contínua e banco de dados, atuando não apenas na resolução, mas principalmente na eliminação de suas causas;
- Desenvolver e evoluir ferramentas, scripts, pipelines e automações que aumentem a eficiência operacional e reduzam a necessidade de intervenção manual;
- Evoluir mecanismos de observabilidade, monitoramento e alertas, buscando identificar problemas antecipadamente e fornecer contexto suficiente para diagnóstico;
- Atuar em incidentes e situações de alta complexidade, realizando troubleshooting e apoiando as squads na resolução de problemas;
- Contribuir para a sustentabilidade dos ambientes por meio da definição e disseminação de boas práticas de DevOps e SRE;
- Criar e evoluir mecanismos de self-service, permitindo que as squads realizem operações recorrentes com maior autonomia e menor dependência do time;
- Participar da definição e evolução de padrões e processos que aumentem a confiabilidade, escalabilidade e eficiência dos ambientes;
- Criar e atualizar a documentação técnica e os padrões operacionais do time no TDN;
- Participar ativamente das cerimônias e fóruns técnicos, contribuindo com propostas de melhoria e compartilhando conhecimento;
- Avaliar novas tecnologias e abordagens que possam gerar ganhos concretos de confiabilidade, produtividade, automação ou redução de custos;
- Acompanhar indicadores operacionais e utilizar dados para identificar gargalos, riscos e oportunidades de melhoria.
Requisitos e qualificações:
- Mentalidade de automação e melhoria contínua;
- Capacidade de identificar trabalho repetitivo e propor formas de eliminá-lo;
- Interesse em resolver problemas de forma estrutural, e não apenas pontual;
- Capacidade de trabalhar com métricas para identificar problemas e oportunidades;
- Boa capacidade de troubleshooting e investigação de causa raiz;
- Interesse em construir ferramentas e soluções que aumentem a autonomia das squads;
- Curiosidade para experimentar novas tecnologias e transformar experimentos em soluções aplicáveis.
Requisitos desejáveis:
- Experiência com práticas de SRE;
- Práticas de Platform Engineering ou Developer Experience;
- Experiência na construção de ferramentas de self-service para times de desenvolvimento.
- Experiência com IaC
- Experiência com CI/CD e GitOps / ferramentas de automação e scripting;
- Experiência com Kubernetes em ambientes de produção;
- Experiência com Cloud (GCP, AWS ou Azure);
- Experiência com IA aplicada a operações, troubleshooting ou automação.