Buscamos um profissional Sênior de infraestrutura e confiabilidade, com estrada real em ambientes produtivos críticos.
Nossos ambientes são híbridos: cargas em cloud pública, cargas em datacenter com virtualização e cargas dentro da infraestrutura privada dos nossos clientes. Isso exige alguém que domine a base (rede, virtualização e Linux) e que automatize tudo o que sustenta essa base.
Atuando conosco, você será responsável por provisionar infraestrutura de forma automatizada, operar nossos clusters Kubernetes em produção e garantir a resiliência e a observabilidade das aplicações em todos esses ambientes.
Avaliamos profundidade técnica e capacidade de diagnóstico. Não avaliamos exposição, palestras ou presença em redes sociais.
RESPONSABILIDADES E ATRIBUIÇÕES
- Automatizar o provisionamento e a configuração da infraestrutura com Terraform e Ansible;
- Operar e evoluir clusters Kubernetes em produção, incluindo networking, storage, RBAC e estratégias de atualização;
- Construir e manter imagens e containers Docker enxutos e reprodutíveis;
- Sustentar a conectividade entre nossos ambientes e os dos clientes: roteamento, VPN, DNS, TLS, firewall e proxy reverso;
- Administrar e dimensionar a camada de virtualização e os sistemas Linux que suportam a plataforma;
- Manter e evoluir a arquitetura com foco em resiliência e alta disponibilidade;
- Evoluir a esteira de CI/CD e a entrega via GitOps (ArgoCD);
- Promover observabilidade e monitoramento com Prometheus, Grafana e Zabbix, reduzindo ruído de alerta;
- Conduzir a análise de incidentes até a causa raiz e transformá-la em correção estrutural documentada;
- Sustentar a operação de aplicações Java e de bancos de dados PostgreSQL em produção;
- Promover a gestão de segurança nos servidores e serviços do ecossistema.
REQUISITOS E QUALIFICAÇÕES
- Experiência sólida como SRE, DevOps ou Infraestrutura em ambientes produtivos críticos, com atuação direta em incidentes de impacto real;
- Domínio de redes: TCP/IP, roteamento, DNS, NAT, TLS/SSL, VPN, firewall e proxy reverso com NGINX;
- Experiência em administração de virtualização em produção, preferencialmente Proxmox (VMware, KVM ou equivalente também são considerados);
- Operação avançada de Linux e automação com Shell/Bash;
- Automação de provisionamento com Terraform e Ansible em uso real e mantidos ao longo do tempo;
- Gerenciamento de clusters Kubernetes em produção, com capacidade de investigar e resolver falhas de workload, tráfego e nó;
- Construção, atualização e gerenciamento de imagens e containers Docker;
- Experiência em processos de CI/CD e em entrega via GitOps (ArgoCD ou equivalente);
- Experiência com ferramentas de monitoramento e observabilidade (Prometheus, Grafana, Zabbix);
- Controle de versão com Git como prática diária;
- Autonomia para assumir um problema mal definido, investigar até o fim e entregar a solução;
- Comunicação clara e documentação técnica de qualidade, principalmente durante incidentes.
VOCÊ VAI SE DESTACAR SE TIVER
- Experiência em ambientes com exigência regulatória (saúde, financeiro ou setor público) e familiaridade com LGPD;
- Vivência em troubleshooting de sistemas distribuídos e falhas intermitentes;
- Experiência com middleware e servidores de aplicação Java, filas e API Gateways;
- Prática em hardening, gestão de segredos e de vulnerabilidades;
- PostgreSQL em nível de tuning, replicação e recuperação;
- Certificações que sustentem a prática (CKA/CKS, RHCE, LPIC, rede ou cloud);
- Capacidade de escrever a própria ferramenta quando não existe pronta (Python, Go ou equivalente);
- Uso de IA no dia a dia técnico, para construir ferramentas e automações e acelerar a resolução de problemas.
ESTA VAGA NÃO É PARA VOCÊ SE
- Sua experiência com Kubernetes se resume a aplicar manifestos escritos por outra pessoa;
- Você trata rede como caixa-preta e escala para terceiros o que não está na aplicação;
- Você provisiona por console gráfico e não versiona infraestrutura.