Lead SRE Engineer

CLOUDSUFI

Región Centro

Presencial

MXN 900.000 - 1.500.000

Jornada completa

Hace 2 días
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Destaca en este puesto — genera un currículum adaptado y una carta de presentación en aproximadamente un minuto.

Supera los filtros ATS

Descripción de la vacante

CLOUDSUFI is seeking a Lead Site Reliability Engineer to drive enterprise reliability across production environments. You will own incident response, postmortems, and RCAs while shaping SLI/SLO frameworks and error budgets.

The role emphasizes building robust observability, dashboards, and alerts, plus automation via Python/Bash and API integrations. Mentorship of SRE/DevOps peers and collaboration with cross-functional teams are essential components.

Formación

  • Hands-on experience with observability/monitoring platforms (Datadog, New Relic, Dynatrace, Grafana/Prometheus, Splunk, ELK/OpenSearch, CloudWatch, AppDynamics).
  • Experience with APM, metrics and logs, distributed tracing, dashboards, alerting, and production troubleshooting.
  • Proficiency with alerting/paging platforms such as PagerDuty, Opsgenie, ServiceNow, Splunk On-Call, xMatters, or Grafana Alerting.

Responsabilidades

  • Lead Site Reliability Engineering initiatives across enterprise production environments.
  • Drive reliability, availability, scalability, and performance improvements.
  • Lead P1/P2 incident response, RCA, and postmortems.
  • Define and improve SLI, SLO, and Error Budget practices.
  • Build and maintain observability, monitoring, dashboards, and alerts.
  • Automate operational processes using Python/Bash and APIs.
  • Manage Infrastructure as Code using Terraform.
  • Support AWS cloud infrastructure, including Kubernetes/EKS, ECS/Fargate, Lambda, RDS/Aurora, SQS/SNS, and related services.
  • Mentor SRE/DevOps engineers and collaborate with development, security, platform, and architecture teams.
  • Contribute to AI-enabled reliability and AIOps initiatives.

Conocimientos

Observability
Monitoring
Incident response
Python
Bash
SRE
DevOps
Postmortems
Production troubleshooting

Herramientas

Terraform
AWS
Kubernetes (EKS)
ECS/Fargate
Lambda
RDS/Aurora
SQS/SNS
CloudWatch
Datadog
New Relic
Dynatrace
Grafana/Prometheus
Splunk
ELK/OpenSearch
PagerDuty

Descripción del empleo

  • Lead Site Reliability Engineering initiatives across enterprise production environments.
  • Drive reliability, availability, scalability, and performance improvements.
  • Lead P1/P2 incident response, RCA, and postmortems.
  • Define and improve SLI, SLO, and Error Budget practices.
  • Build and maintain observability, monitoring, dashboards, and alerts.
  • Automate operational processes using Python/Bash and APIs.
  • Manage Infrastructure as Code using Terraform.
  • Support AWS cloud infrastructure, including Kubernetes/EKS, ECS/Fargate, Lambda, RDS/Aurora, SQS/SNS, and related services.
  • Mentor SRE/DevOps engineers and collaborate with development, security, platform, and architecture teams.
  • Contribute to AI-enabled reliability and AIOps initiatives.
Must-Have Experience
Observability / Monitoring – Mandatory

Hands-on experience with Datadog or an equivalent APM, logging, and monitoring platform such as New Relic, Dynatrace, Grafana/Prometheus, Splunk, ELK/OpenSearch, CloudWatch, or AppDynamics.

Experience should include:

  • APM
  • Metrics and logs
  • Distributed tracing
  • Dashboards and monitoring
  • Alerting
  • Production troubleshooting

Hands-on experience with PagerDuty or an equivalent alerting/paging platform, such as Opsgenie, ServiceNow, Splunk On-Call, xMatters, or Grafana Alerting.

Consigue la evaluación confidencial y gratuita de tu currículum.

o arrastra y suelta tu archivo aquí

Similar jobs

Puestos de trabajo similares que vale la pena comparar

Lead SRE: Observability, Reliability & Cloud Automation
Lead SRE: Observability, Reliability & Cloud Automation

CLOUDSUFI • Región Centro

Presencial
MXN 900.000 - 1.500.000
Site Reliability Engineer ID60188
Site Reliability Engineer ID60188

AgileEngine • Ciudad de México

Híbrido
MXN 1.049.000 - 1.400.000
Professional growth: Mentorship, TechTalks, and personalized growth roadmaps.
Competitive compensation: USD-based pay with education, fitness, and team activity budgets.
Exciting projects: Modern solutions with Fortune 500 and top product companies.
+1
Site Reliability Engineer ID53670
Site Reliability Engineer ID53670

AgileEngine • Rosarito

Híbrido
MXN 870.000 - 1.306.000
Professional growth
Competitive compensation
Exciting projects
+1
SRE (Engineering & Administration Background)
SRE (Engineering & Administration Background)

Fulcrum Digital • Ciudad de México

Híbrido
MXN 900.000 - 1.500.000
Senior Site Reliability Engineer Lead
Senior Site Reliability Engineer Lead

HCL Technologies Limited • Región Centro

Presencial
MXN 900.000 - 1.200.000
Lead SRE Engineer
Lead SRE Engineer

Turtle Trax S.A. • Monterrey

Presencial
MXN 1.720.000 - 2.065.000
Systems Reliability Engineer - Lead Engineer
Systems Reliability Engineer - Lead Engineer

Talent Solutions ManpowerGroup • Ciudad de México

Presencial
MXN 900.000 - 1.300.000
Senior Lead SRE & Automation Architect
Senior Lead SRE & Automation Architect

InfoVision Inc. • México

Presencial
MXN 1.200.000 - 1.800.000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

N-iX • México

Híbrido
MXN 1.200.000 - 1.600.000
Flexible working format
Competitive compensation package
Professional development
Lead Systems Reliability Engineer (Enterprise SRE)
Lead Systems Reliability Engineer (Enterprise SRE)

Talent Solutions ManpowerGroup • Ciudad de México

Presencial
MXN 900.000 - 1.300.000