Engenheiro De Confiabilidade Pleno - Sre

Netvagas

São Paulo

Presencial

BRL 180 000 - 240 000

Tempo integral

Há 3 dias
Torna-te num dos primeiros candidatos
Gerador de candidaturas

Destaca-te para esta função — gera um currículo e uma carta de apresentação personalizados em cerca de um minuto.

Ultrapassa os filtros ATS

Resumo da oferta

A Netvagas busca um SRE pleno para ser guardião da estabilidade, previsibilidade e performance do ecossistema Reclame AQUI. Você colaborará com a squad no dimensionamento de tarefas e criará rotinas de monitoramento proativo.

Foco em observabilidade (Prometheus/Grafana), definição de SLOs/SLAs, IaC com Terraform na GCP e automação com Python ou Golang. Kubernetes, CI/CD (Argo CD) e gestão de custos em nuvem também entram no radar.

Qualificações

  • Experiência consistente como SRE, DevOps ou Engenheiro de Infraestrutura.
  • ],
  • job_responsibilities_description

Responsabilidades

  • Previsibilidade e Planejamento: Apoiar o time no dimensionamento e refinamento técnico de tarefas de SRE nas cerimônias da sprint, garantindo entregas consistentes e previsíveis.
  • Excelência em Observabilidade (Predictive Ops): Implementar rotinas preditivas para reduzir falhas simples, evoluindo o monitoramento com Golden Signals (Latência, Erro, Tráfego e Saturação).
  • Gestão de Confiabilidade: Acompanhar SLOs/SLAs, Error Budgets e equilibrar velocidade de deploy com estabilidade.
  • Engenharia de Plataforma (IDP): Colaborar na evolução do FAÍSCA (Backstage), desenvolvendo templates e automatizando provisioning de recursos.
  • Operação e Resiliência em Kubernetes: Realizar troubleshoot e tuning de workloads no K8s, resolvendo gargalos como DiskPressure.
  • Cultura Blameless e Segurança Psicológica: Participar de post-mortems para aprendizado técnico e melhoria de processos.
  • Infraestrutura como Código (IaC): Escrever e manter Terraform na GCP, com padronização e reprodutibilidade.
  • Eficiência Financeira (FinOps): Acompanhar faturamento e otimizar custos na nuvem, com foco na escalabilidade inteligente.

Conhecimentos

Kubernetes
Observability
Terraform
GCP
Python
Golang
CI/CD
Argo CD
Bitbucket

Ferramentas

Backstage/FAÍSCA
Prometheus
Grafana

Descrição da oferta de emprego

No Reclame AQUI, não somos apenas um site de reclamações; somos a maior plataforma de confiança do país e estamos em plena expansão global. Nossa infraestrutura é o palco onde milhões de vozes encontram solução e onde as empresas constroem suas reputações. Como SRE Pleno, você entra em um momento estratégico: nosso desafio é escalar com previsibilidade e transformar nossa monitoração em uma aliada da experiência real do usuário.

Buscamos um(a) profissional que entenda que soft skills são tão importantes quanto hard skills e que demonstre capacidade de manter um alto nível de entrega continuamente, não apenas em projetos pontuais. Procuramos alguém com atitude colaborativa e mentalidade de dono para ajudar a blindar nossa plataforma, garantindo que a confiança nunca fique offline. Aqui, você terá autonomia para errar, aprender rápido e ser protagonista na evolução da nossa cultura de confiabilidade.

Missão do Cargo

Sua missão é ser o guardião da estabilidade, previsibilidade e performance do ecossistema Reclame AQUI. Esperamos que você colabore ativamente com a squad no dimensionamento de tarefas, trazendo previsibilidade para o fluxo de trabalho. Daqui a um ano, esperamos que você tenha consolidado um ambiente onde o monitoramento proativo seja o padrão, onde falhas simples sejam mitigadas por rotinas preditivas criadas por você, e onde a nossa plataforma de desenvolvimento (FAÍSCA) seja uma ferramenta de aceleração diária para todos os times de produto.

Principais Responsabilidades

Previsibilidade e Planejamento: Apoiar o time no dimensionamento e refinamento técnico de tarefas de SRE nas cerimônias da sprint, garantindo entregas consistentes e previsíveis.

Excelência em Observabilidade (Predictive Ops): Implementar rotinas preditivas para reduzir e evitar falhas simples, evoluindo nosso monitoramento para os Golden Signals (Latência, Erro, Tráfego e Saturação) com o objetivo de antecipar impactos na jornada do consumidor.

Gestão de Confiabilidade: Apoiar ativamente a definição e o cumprimento de SLOs e SLAs das squads, acompanhando os Error Budgets para equilibrar a velocidade de deploy com a estabilidade do sistema.

Engenharia de Plataforma (IDP): Colaborar na evolução do FAÍSCA (nosso portal baseado em Backstage), desenvolvendo templates e automatizando o provisionamento de recursos (como buckets, bancos e microsserviços) para eliminar a fricção operacional dos desenvolvedores.

Operação e Resiliência em Kubernetes: Realizar o troubleshoot e o ajuste fino de workloads no K8s, tratando problemas de recursos de forma ágil (como CPU, memória, storage) e atuando diretamente na contenção de gargalos como DiskPressure.

Cultura Blameless e Segurança Psicológica: Participar ativamente de rituais de post-mortem, focando no aprendizado técnico, na correção de processos e no fortalecimento da segurança psicológica do time para reportar erros e aprender com eles.

Infraestrutura como Código (IaC): Desenvolver, modularizar, versionar e manter códigos em Terraform, garantindo que nossa infraestrutura na GCP seja segura, padronizada e reprodutível.

Eficiência Financeira (FinOps): Auxiliar no controle de custos e desperdício de nuvem, apoiando o monitoramento do faturamento na GCP e a eficiência das ferramentas de escalabilidade inteligente (como Spotinst Ocean).

Automação e Redução de Toil: Mapear tarefas operacionais repetitivas no dia a dia da infraestrutura e desenvolver scripts (Python ou Golang) para eliminá-las, liberando o time para atuações mais estratégicas.

O que Buscamos (Pré-Requisitos)

Experiência Prática Consistente: Bagagem anterior atuando como SRE, DevOps ou Engenheiro(a) de Infraestrutura, demonstrando capacidade de entrega contínua de alto nível.

Domínio de Kubernetes: Conhecimento sólido em gerenciamento de pods, troubleshoot diário de workloads, Helm Charts e ciclo de vida de containers.

Vivência em Cloud (GCP): Experiência de mercado com os principais serviços da Google Cloud Platform.

Cultura de Automação: Prática no desenvolvimento de IaC com Terraform e habilidade para escrever scripts utilitários em Python ou Golang.

Foco em Entrega Contínua (CI/CD): Familiaridade com pipelines de integração e entrega contínua, utilizando ferramentas como Argo CD e Bitbucket.

Mente de Observabilidade: Prática na configuração de métricas, alertas e painéis utilizando Prometheus e Grafana.

Habilidade de Colaboração (Soft Skills): Boa comunicação para atuar de forma cross-functional com desenvolvedores, facilitando a cultura de qualidade e entrega segura.

O que fará nossos olhos brilharem (Diferenciais)

Conhecimento prático ou forte interesse em portais internos baseados em Backstage.

Noções de FinOps e análise de consumo de recursos em nuvem (GCP / Flexera / Spotinst).

Vivência com redes em nuvem (VPC, Cloud Ingress, Service Mesh).

Familiaridade com monitoramento e operação de bancos de dados gerenciados (como MongoDB Atlas).

Engenheiro de confiabilidade pleno - sre • BRASIL, BR, BR

Obtém a tua avaliação gratuita e confidencial do currículo.

ou arrasta e larga o ficheiro aqui.

Similar jobs

Ofertas semelhantes que vale a pena comparar

Engenheiro de Confiabilidade Pleno - SRE
Engenheiro de Confiabilidade Pleno - SRE

Reclame AQUI • Brasil

Presencial
BRL 180 000 - 240 000
SRE Partner
SRE Partner

Jusbrasil • São Paulo

Presencial
SRE (Site Reliability Engineer)
SRE (Site Reliability Engineer)

Sabiá Gaming • Belo Horizonte

Presencial
BRL 180 000 - 240 000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Proative Technology • Barueri

Presencial
BRL 180 000 - 240 000
Site Reliability Engineer (SRE) / Cloud Architect
Site Reliability Engineer (SRE) / Cloud Architect

EEMOVEL SERVICOS DE INFORMACOES S/A • Cascavel

Presencial
Analista SRE Sênior
Analista SRE Sênior

ZG Soluções • Brasil

Híbrido
BRL 180 000 - 300 000
SRE Devops Sênior
SRE Devops Sênior

mottu.com.br • São Paulo

Híbrido
BRL 180 000 - 240 000
SRE Devops Sênior
SRE Devops Sênior

Mottu • São Paulo

Presencial
BRL 180 000 - 240 000
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

Dell Technologies • Eldorado do Sul

Presencial
BRL 180 000 - 260 000
Site Reliability Engineer
Site Reliability Engineer

Gauge • Brasil

Teletrabalho
Vale Refeição/Vale Alimentação
Assistência médica
Assistência odontológica
+7