Somos a Brasilseg, uma empresa BB Seguros, holding que concentra os negócios de seguridade do Banco do Brasil. Atuamos nos ramos de Vida, Habitacional, Rural e Massificados (Residencial, Empresarial, Condomínio e Máquinas e Equipamentos), sendo a seguradora líder nacional nos ramos em que atua. Mais de 2.100 colaboradores, distribuídos entre São Paulo (Sede), Franca (Central de Relacionamento e Negócios) e outros estados (time Comercial) formam um time especialista em cuidar que trabalha todos os dias para trazer soluções simples, ágeis e convenientes, cuidando de pessoas e protegendo o que é valioso para elas, em todos os momentos de suas vidas.
Requisitos e qualificações
- Formação superior completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação ou áreas correlatas.
- Conhecimento em Implementação de observabilidade avançada (métricas, log e tracing)
- Conhecimento em Desenvolvimento de automações utilizando Python ou Java
- Conhecimento em Operação e sustentação em núvem pública (AWS)-
- Conhecimento em Engenharia de dados
O que estará sobre seus cuidados
1-Diagnóstico, Sustentação e Resiliência
- Atuar como segundo nível de suporte (N2) no diagnóstico e na resolução de incidentes complexos de produção.
- Analisar criticamente a infraesturtura e o comportamento das aplicações para identificar fragilidades arquiteturais e pontos únicos de falha (SPOFs)
- Liderar e participar ativamente de análises de causa raiz (RCA - Post-mortems) de incidentes críticos, propondo e implementando melhorias definitivas.
- Garantir a alta disponibilidade, escalabilidade e resiliência dos sistemas mapeados.
- Aplicar práticas consolidadas de SRE e engenharia de resiliência nos ambientes operacionais.
2. Observabilidade de Sistemas Fim a Fim
- Projetar e implementar estratégias de observabilidade integrando os três pilares fundamentais: métricas, logs e tracing distribuído.
- Garantir a rastreabilidade ponta a ponta de fluxos de requisições que cruzam diferentes microsserviços, plataformas de dados e APIs.
- Desenvolver e manter dashboards consolidados e sistemas de alertas inteligentes para rápida detecção de anomalias, degradação de performance e latência.
- Definir, monitorar e garantir o cumprimento de acordos e indicadores de níveis de serviço, tais como SLAs, SLOs e SLIs das aplicações críticas para o negócio.
3. Engenharia de Soluções e Automação de Monitoramento
- Desenvolver e customizar ferramentas internas, scripts e novos exportadores de telemetria utilizando linguagens como Python e/ou Java.
- Automatizar processos de infraestrutura, deploys e configurações de monitoramento via esteiras de CI/CD (GitHub Actions)
- Integrar sistemas de mensageria e processamentos de eventos (como SQS) a ecossistemas de alertas operacionais e auto-recuperação (self-healing)
- Trabalhar e evoluir ferramentas de mercado e de código aberto como Datadog, Grafana, Prometheus e AWS CloudWatch.
4. Catalogação, Governança e Melhores Práticas
- Estruturar e manter a catalogação de aplicações e serviços, garantindo a governança sobre a propriedade (ownership), dependências e topologia de sistemas.
- Documentar arquiteturas de monitoramento, guias de incidentes (runbooks), métricas de performance e tolopogia de redes/aplicações.
- Disseminar a cultura de SRE, mentalidade de automação e práticas de observabilidade nativa com os times de engenharia de software e desenvolvimento.
- Apoiar a definição e evolução dos padrões corporativos de arquitetura resiliente e monitoramento.
Criar um alerta de emprego para esta pesquisa
Especialista Engenheiro de Software I • São Paulo, São Paulo, Brasil