Lead SRE: Observability, Reliability & Cloud Automation

CLOUDSUFI

Región Centro

Presencial

MXN 900.000 - 1.500.000

Jornada completa

Hace 2 días
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Transforma esta oferta en una entrevista — un currículum y una carta de presentación creados pensando en lo que quiere el empleador.

Supera los filtros ATS

Descripción de la vacante

CLOUDSUFI is seeking a Lead Site Reliability Engineer to drive enterprise reliability across production environments. You will own incident response, postmortems, and RCAs while shaping SLI/SLO frameworks and error budgets.

The role emphasizes building robust observability, dashboards, and alerts, plus automation via Python/Bash and API integrations. Mentorship of SRE/DevOps peers and collaboration with cross-functional teams are essential components.

Formación

  • Hands-on experience with observability/monitoring platforms (Datadog, New Relic, Dynatrace, Grafana/Prometheus, Splunk, ELK/OpenSearch, CloudWatch, AppDynamics).
  • Experience with APM, metrics and logs, distributed tracing, dashboards, alerting, and production troubleshooting.
  • Proficiency with alerting/paging platforms such as PagerDuty, Opsgenie, ServiceNow, Splunk On-Call, xMatters, or Grafana Alerting.

Responsabilidades

  • Lead Site Reliability Engineering initiatives across enterprise production environments.
  • Drive reliability, availability, scalability, and performance improvements.
  • Lead P1/P2 incident response, RCA, and postmortems.
  • Define and improve SLI, SLO, and Error Budget practices.
  • Build and maintain observability, monitoring, dashboards, and alerts.
  • Automate operational processes using Python/Bash and APIs.
  • Manage Infrastructure as Code using Terraform.
  • Support AWS cloud infrastructure, including Kubernetes/EKS, ECS/Fargate, Lambda, RDS/Aurora, SQS/SNS, and related services.
  • Mentor SRE/DevOps engineers and collaborate with development, security, platform, and architecture teams.
  • Contribute to AI-enabled reliability and AIOps initiatives.

Conocimientos

Observability
Monitoring
Incident response
Python
Bash
SRE
DevOps
Postmortems
Production troubleshooting

Herramientas

Terraform
AWS
Kubernetes (EKS)
ECS/Fargate
Lambda
RDS/Aurora
SQS/SNS
CloudWatch
Datadog
New Relic
Dynatrace
Grafana/Prometheus
Splunk
ELK/OpenSearch
PagerDuty

Descripción del empleo

CLOUDSUFI is seeking a Lead Site Reliability Engineer to drive enterprise reliability across production environments. You will own incident response, postmortems, and RCAs while shaping SLI/SLO frameworks and error budgets.

The role emphasizes building robust observability, dashboards, and alerts, plus automation via Python/Bash and API integrations. Mentorship of SRE/DevOps peers and collaboration with cross-functional teams are essential components.

Consigue la evaluación confidencial y gratuita de tu currículum.

o arrastra y suelta tu archivo aquí

Similar jobs

Puestos de trabajo similares que vale la pena comparar

Lead SRE Engineer
Lead SRE Engineer

CLOUDSUFI • Región Centro

Presencial
MXN 900.000 - 1.500.000
Senior Lead SRE & Automation Architect
Senior Lead SRE & Automation Architect

InfoVision Inc. • México

Presencial
MXN 1.200.000 - 1.800.000
Senior Site Reliability Engineer Lead
Senior Site Reliability Engineer Lead

HCL Technologies Limited • Región Centro

Presencial
MXN 900.000 - 1.200.000
Remote Senior SRE: High-Impact Reliability & Observability
Remote Senior SRE: High-Impact Reliability & Observability

Jobgether • México

A distancia
MXN 900.000 - 1.300.000
Fully remote working environment
Global engineering organization
Ownership over production reliability
Lead SRE Engineer
Lead SRE Engineer

Turtle Trax S.A. • Monterrey

Presencial
MXN 1.720.000 - 2.065.000
Lead Systems Reliability Engineer (Enterprise SRE)
Lead Systems Reliability Engineer (Enterprise SRE)

Talent Solutions ManpowerGroup • Ciudad de México

Presencial
MXN 900.000 - 1.300.000
Hybrid SRE: Production Reliability & Automation
Hybrid SRE: Production Reliability & Automation

Fulcrum Digital • Ciudad de México

Híbrido
MXN 900.000 - 1.500.000
Remote SRE Engineer - Automate, Observe & Own Reliability
Remote SRE Engineer - Automate, Observe & Own Reliability

AgileEngine • Ciudad de México

Híbrido
MXN 1.049.000 - 1.400.000
Senior SRE Lead - Salesforce & Azure Reliability
Senior SRE Lead - Salesforce & Azure Reliability

Turtle Trax S.A. • Monterrey

Presencial
MXN 1.720.000 - 2.065.000
Site Reliability Engineer ID53670
Site Reliability Engineer ID53670

AgileEngine • Rosarito

Híbrido
MXN 870.000 - 1.306.000
Professional growth
Competitive compensation
Exciting projects
+1