Engenheiro de Confiabilidade Pleno - SRE

Reclame AQUI

Brasil

Presencial

BRL 180 000 - 240 000

Tempo integral

Há 11 dias
Gerador de candidaturas

Destaca-te para esta função — cria um currículo personalizado e uma carta de apresentação em cerca de um minuto.

Ultrapassa os filtros ATS

Resumo da oferta

Reclame AQUI está buscando um SRE Pleno para atuar na escalada previsível da plataforma, com foco em confiabilidade e experiência do usuário. Você fará parte da squad, dimensionando tarefas e estabelecendo rotinas preditivas para mitigar falhas.

A posição envolve evolução de FAÍSCA, automação de provisionamento e gestão de recursos em GCP, com ênfase em monitoramento proativo, SLOs/SLAs e práticas de FinOps. Venha trabalhar com uma cultura de ownership e melhoria contínua.

Qualificações

  • Experiência prática consistente atuando como SRE/DevOps ou Engenheiro(a) de Infraestrutura.
  • Domínio de Kubernetes: gerenciamento de pods, troubleshoot diário e ciclo de vida de containers.
  • Vivência em Cloud (GCP): serviços principais da Google Cloud Platform.
  • Prática com IaC via Terraform e scripts utilitários em Python ou Golang.
  • Foco em entrega contínua (CI/CD) com pipelines e ferramentas como Argo CD e Bitbucket.
  • Mente de observabilidade com configuração de métricas, alertas e painéis (Prometheus/Grafana).
  • Boa comunicação para atuação cross-functional e cultura de qualidade.

Responsabilidades

  • Previsibilidade e planejamento: apoiar o time no dimensionamento de tarefas de SRE nas cerimônias da sprint.
  • Excelência em observabilidade: evoluir o monitoramento para os Golden Signals e antever impactos na jornada do consumidor.
  • Gestão de confiabilidade: acompanhar SLOs, SLAs e budgets para equilíbrio entre velocidade de deploy e estabilidade.
  • Engenharia de plataforma: colaborar na evolução do FAÍSCA, automatizando provisionamento de recursos.
  • Operação e resiliência em Kubernetes: troubleshoot de workloads, ajuste de recursos e contenção de gargalos.
  • Cultura blameless: participar de post-mortems para aprender com falhas e melhorar processos.
  • Infraestrutura como código (IaC): manter Terraform garantindo infra segura na GCP.
  • Eficiência financeira (FinOps): monitorar custos de nuvem e eficiência de escalabilidade.

Conhecimentos

Kubernetes
Google Cloud Platform
Terraform
Python
Golang
CI/CD
Argo CD
Prometheus
Grafana
Observability

Ferramentas

Backstage
Bitbucket

Descrição da oferta de emprego

Sobre a Vaga

No Reclame AQUI, não somos apenas um site de reclamações; somos a maior plataforma de confiança do país e estamos em plena expansão global. Nossa infraestrutura é o palco onde milhões de vozes encontram solução e onde as empresas constroem suas reputações. Como SRE Pleno, você entra em um momento estratégico: nosso desafio é escalar com previsibilidade e transformar nossa monitoração em uma aliada da experiência real do usuário.

Buscamos um(a) profissional que entenda que soft skills são tão importantes quanto hard skills e que demonstre capacidade de manter um alto nível de entrega continuamente, não apenas em projetos pontuais. Procuramos alguém com atitude colaborativa e mentalidade de dono para ajudar a blindar nossa plataforma, garantindo que a confiança nunca fique offline. Aqui, você terá autonomia para errar, aprender rápido e ser protagonista na evolução da nossa cultura de confiabilidade.

Missão do Cargo

Sua missão é ser o guardião da estabilidade, previsibilidade e performance do ecossistema Reclame AQUI. Esperamos que você colabore ativamente com a squad no dimensionamento de tarefas, trazendo previsibilidade para o fluxo de trabalho. Daqui a um ano, esperamos que você tenha consolidado um ambiente onde o monitoramento proativo seja o padrão, onde falhas simples sejam mitigadas por rotinas preditivas criadas por você, e onde a nossa plataforma de desenvolvimento (FAÍSCA) seja uma ferramenta de aceleração diária para todos os times de produto.

Principais Responsabilidades
  • Previsibilidade e Planejamento: Apoiar o time no dimensionamento e refinamento técnico de tarefas de SRE nas cerimônias da sprint, garantindo entregas consistentes e previsíveis.
  • Excelência em Observabilidade (Predictive Ops): Implementar rotinas preditivas para reduzir e evitar falhas simples, evoluindo nosso monitoramento para os Golden Signals (Latência, Erro, Tráfego e Saturação) com o objetivo de antecipar impactos na jornada do consumidor.
  • Gestão de Confiabilidade: Apoiar ativamente a definição e o cumprimento de SLOs e SLAs das squads, acompanhando os Error Budgets para equilibrar a velocidade de deploy com a estabilidade do sistema.
  • Engenharia de Plataforma (IDP): Colaborar na evolução do FAÍSCA (nosso portal baseado em Backstage), desenvolvendo templates e automatizando o provisionamento de recursos (como buckets, bancos e microsserviços) para eliminar a fricção operacional dos desenvolvedores.
  • Operação e Resiliência em Kubernetes: Realizar o troubleshoot e o ajuste fino de workloads no K8s, tratando problemas de recursos de forma ágil (como CPU, memória, storage) e atuando diretamente na contenção de gargalos como DiskPressure.
  • Cultura Blameless e Segurança Psicológica: Participar ativamente de rituais de post-mortem, focando no aprendizado técnico, na correção de processos e no fortalecimento da segurança psicológica do time para reportar erros e aprender com eles.
  • Infraestrutura como Código (IaC): Desenvolver, modularizar, versionar e manter códigos em Terraform, garantindo que nossa infraestrutura na GCP seja segura, padronizada e reprodutível.
  • Eficiência Financeira (FinOps): Auxiliar no controle de custos e desperdício de nuvem, apoiando o monitoramento do faturamento na GCP e a eficiência das ferramentas de escalabilidade inteligente (como Spotinst Ocean).
  • Automação e Redução de Toil: Mapear tarefas operacionais repetitivas no dia a dia da infraestrutura e desenvolver scripts (Python ou Golang) para eliminá-las, liberando o time para atuações mais estratégicas.
O que Buscamos (Pré-Requisitos)
  • Experiência Prática Consistente: Bagagem anterior atuando como SRE, DevOps ou Engenheiro(a) de Infraestrutura, demonstrando capacidade de entrega contínua de alto nível.
  • Domínio de Kubernetes: Conhecimento sólido em gerenciamento de pods, troubleshoot diário de workloads, Helm Charts e ciclo de vida de containers.
  • Vivência em Cloud (GCP): Experiência de mercado com os principais serviços da Google Cloud Platform.
  • Cultura de Automação: Prática no desenvolvimento de IaC com Terraform e habilidade para escrever scripts utilitários em Python ou Golang.
  • Foco em Entrega Contínua (CI/CD): Familiaridade com pipelines de integração e entrega contínua, utilizando ferramentas como Argo CD e Bitbucket.
  • Mente de Observabilidade: Prática na configuração de métricas, alertas e painéis utilizando Prometheus e Grafana.
  • Habilidade de Colaboração (Soft Skills): Boa comunicação para atuar de forma cross-functional com desenvolvedores, facilitando a cultura de qualidade e entrega segura.
O que fará nossos olhos brilharem (Diferenciais)
  • Conhecimento prático ou forte interesse em portais internos baseados em Backstage.
  • Noções de FinOps e análise de consumo de recursos em nuvem (GCP / Flexera / Spotinst).
  • Vivência com redes em nuvem (VPC, Cloud Ingress, Service Mesh).
  • Familiaridade com monitoramento e operação de bancos de dados gerenciados (como MongoDB Atlas).
Obtém a tua avaliação gratuita e confidencial do currículo.
ou arrasta e larga o ficheiro aqui.
Similar jobs

Ofertas semelhantes que vale a pena comparar

Engenheiro De Confiabilidade Pleno - Sre
Engenheiro De Confiabilidade Pleno - Sre

Netvagas • São Paulo

Presencial
BRL 180 000 - 240 000
SRE Partner
SRE Partner

Jusbrasil • São Paulo

Presencial
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Proative Technology • Barueri

Presencial
BRL 180 000 - 240 000
SRE (Site Reliability Engineer)
SRE (Site Reliability Engineer)

Sabiá Gaming • Belo Horizonte

Presencial
BRL 180 000 - 240 000
Site Reliability Engineer (SRE) / Cloud Architect
Site Reliability Engineer (SRE) / Cloud Architect

EEMOVEL SERVICOS DE INFORMACOES S/A • Cascavel

Presencial
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Ernst & Young Advisory Services Sdn Bhd • Pompeia

Híbrido
Engenheiro SRE Especialista
Engenheiro SRE Especialista

UDS Technology • Brasil

Presencial
SRE Devops Sênior
SRE Devops Sênior

Mottu • São Paulo

Presencial
BRL 180 000 - 240 000
SRE Devops Sênior
SRE Devops Sênior

mottu.com.br • São Paulo

Híbrido
BRL 180 000 - 240 000
Site Reliability Engineer
Site Reliability Engineer

Gauge • Brasil

Teletrabalho
Vale Refeição/Vale Alimentação
Assistência médica
Assistência odontológica
+7