Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

Dell Technologies

Eldorado do Sul

Presencial

BRL 180 000 - 260 000

Tempo integral

Há 8 dias
Gerador de candidaturas

Transforma esta função numa entrevista — um currículo e uma carta de apresentação criados à volta do que este empregador procura.

Ultrapassa os filtros ATS

Resumo da oferta

A Dell Technologies procura Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) para Eldorado do Sul/RS. Você projetará e gerenciará automações para todo o ciclo de vida da infraestrutura compute, assegurando escalabilidade, disponibilidade e confiabilidade dos serviços.

O profissional trabalhará com equipes de Compute, Automação e Observabilidade, definindo SLIs/SLOs, melhorias de monitoramento e soluções automatizadas para falhas recorrentes, envolvendo práticas de GitOps e pipelines CI/CD.

Qualificações

  • Graduação completa em área de computação ou similar, com experiência em SRE/Infraestrutura de larga escala.
  • Experiência prática com automação, Python, Git e pipelines CI/CD.
  • Conhecimento em observabilidade, diagnóstico de incidentes e resolução de falhas complexas.

Responsabilidades

  • Projetar, desenvolver e manter automações para ciclo de vida da infraestrutura compute.
  • Definir SLIs/SLOs, melhorar observabilidade e reduzir ruídos de monitoramento.
  • Atuar no escalonamento de incidentes críticos e em operações de plantão.
  • Colaborar com equipes de Compute, Automação e Observabilidade para padrões operacionais.
  • Conduzir melhoria contínua com base em métricas de automação e eficiência.

Conhecimentos

SRE
Infraestrutura compute
Ansible
Python
CI/CD
GitOps
Observabilidade

Formação académica

Graduação em Ciência da Computação

Ferramentas

VMware vSphere
Bare-metal servers
Linux (RHEL)
Windows Server

Descrição da oferta de emprego

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Infraestrutura Compute

Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo.

O que você conquistará

Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE), você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida da infraestrutura compute, garantindo escalabilidade, disponibilidade e confiabilidade dos serviços. Você trabalhará com equipes de Engenharia Compute, Automação de Plataforma, Observabilidade e Infraestrutura em uma plataforma corporativa baseada em automação, suportando cargas de trabalho críticas e impulsionando a excelência operacional por meio de práticas modernas de SRE e automação em larga escala.

Você irá:
  • Projetar, desenvolver e manter automações para todo o ciclo de vida da infraestrutura compute, incluindo descoberta de servidores, provisionamento bare-metal, implantação de sistemas operacionais, gerenciamento de firmware e patches, configuração de hipervisores, descomissionamento e processos automatizados de diagnóstico e remediação utilizando Ansible, Python e pipelines CI/CD
  • Definir e operar práticas de confiabilidade para serviços compute por meio da criação e manutenção de SLIs, SLOs e error budgets, além de aprimorar a observabilidade, reduzir ruídos de monitoramento, conduzir análises pós-incidente e transformar falhas recorrentes em soluções automatizadas
  • Colaborar com equipes de Engenharia Compute, Automação de Plataforma e Observabilidade para definir requisitos operacionais, integrar automações à plataforma corporativa de IA e automação, garantir critérios de prontidão operacional e contribuir para políticas como código voltadas à operação segura e escalável de plataformas compute
  • Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção de bases de conhecimento estruturadas, identificação de oportunidades para eliminação de atividades manuais e avaliação de novas ferramentas para integração ao ecossistema corporativo
  • Participar da escala de plantão da torre de Compute, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço definidos e utilizando informações de diagnóstico previamente consolidadas para acelerar a resolução
Dê o primeiro passo para a carreira dos seus sonhos

Todas as pessoas da nossa equipe agregam algo único. Veja o que estamos buscando para esta posição:

Requisitos Essenciais
  • Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em SRE, Engenharia de Infraestrutura, Engenharia de Servidores ou Operações de Plataformas em larga escala
  • Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais
  • Experiência prática avançada em pelo menos duas das seguintes áreas: VMware vSphere/vCenter, plataformas de servidores bare-metal (Dell PowerEdge, HPE, Cisco UCS ou equivalentes), sistemas operacionais Linux (Oracle Linux, RHEL ou equivalentes) ou ambientes Windows Server
  • Experiência comprovada no desenvolvimento de automações de infraestrutura utilizando Ansible, Python, Git, pipelines CI/CD e práticas de GitOps, incluindo gerenciamento automatizado do ciclo de vida de plataformas compute
  • Conhecimento sólido em observabilidade, monitoramento de infraestrutura, confiabilidade de sistemas, troubleshooting, gestão de incidentes, análise de causa raiz e resolução de falhas complexas envolvendo hardware, hipervisores, sistemas operacionais e ambientes distribuídos
Requisitos Desejáveis
  • Experiência com vROps, Zabbix, Dynatrace, ServiceNow CMDB, NetBox, GitLab CI, ferramentas de gerenciamento de imagens (Kickstart, Preseed, Packer), automação de firmware, práticas formais de Site Reliability Engineering (SRE) e ambientes regulados por requisitos de conformidade, como SOX, PCI-DSS ou ISO 27001
  • Familiaridade com plataformas corporativas de automação assistida por IA, soluções agentic AI, integração de LLMs em processos operacionais e ecossistemas avançados de observabilidade e automação empresarial
Obtém a tua avaliação gratuita e confidencial do currículo.
ou arrasta e larga o ficheiro aqui.
Similar jobs

Ofertas semelhantes que vale a pena comparar

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

Dell GmbH • Brasil

Presencial
BRL 180 000 - 260 000
Engenheiro De Confiabilidade Pleno - Sre
Engenheiro De Confiabilidade Pleno - Sre

Netvagas • São Paulo

Presencial
BRL 180 000 - 240 000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Proative Technology • Barueri

Presencial
BRL 180 000 - 240 000
Infrastructure Automation Engineer
Infrastructure Automation Engineer

Dell GmbH • Eldorado do Sul

Presencial
BRL 180 000 - 280 000
Engenheiro de Confiabilidade Pleno - SRE
Engenheiro de Confiabilidade Pleno - SRE

Reclame AQUI • Brasil

Presencial
BRL 180 000 - 240 000
Analista SRE Sênior
Analista SRE Sênior

ZG Soluções • Brasil

Híbrido
BRL 180 000 - 300 000
Site Reliability Engineer
Site Reliability Engineer

Banco Daycoval • São Paulo

Presencial
BRL 180 000 - 240 000
Engenheiro(a) Sênior de Software - IT
Engenheiro(a) Sênior de Software - IT

Dell Technologies • Eldorado do Sul

Presencial
BRL 150 000 - 230 000
Site Reliability Engineer (SRE) / Cloud Architect
Site Reliability Engineer (SRE) / Cloud Architect

EEMOVEL SERVICOS DE INFORMACOES S/A • Cascavel

Presencial
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Ernst & Young Advisory Services Sdn Bhd • Pompeia

Híbrido