Lead SRE Engineer

Cloudsufi

Región Centro

Presencial

MXN 900.000 - 1.400.000

Jornada completa

Hace 2 días
Sé de los primeros/as/es en solicitar esta vacante
Generador de candidaturas

Una candidatura completa en un minuto — currículum adaptado y carta de presentación, listos para enviar.

Supera los filtros ATS

Descripción de la vacante

Cloudsufi is seeking a Lead SRE Engineer to drive reliability across Guadalajara-based enterprise environments. The role requires hands-on expertise with observability platforms, incident management, and AWS/Kubernetes ecosystems.

You will mentor engineers and push for AI-enabled reliability improvements. Ideal candidates have 6–10 years of SRE/DevOps experience, proficiency with Terraform and monitoring tools, and a proven track record in incident RCA and postmortems.

Formación

  • 6–10 years of experience in SRE/DevOps or related roles.
  • Strong observability, monitoring, and incident management experience.
  • Hands-on with APM platforms and log management tools.
  • Experience with alerting, paging, and incident response processes.

Responsabilidades

  • Lead SRE initiatives across enterprise production environments.
  • Improve reliability, availability, scalability, and performance.
  • Lead P1/P2 incident response, RCA, and postmortems.
  • Define and improve SLI/SLO/Error Budget practices.
  • Build observability through monitoring dashboards and alerts.
  • Automate ops using Python/Bash and APIs.
  • Manage IaC with Terraform.
  • Support AWS cloud infrastructure including Kubernetes/EKS, ECS/Fargate, Lambda, RDS/Aurora, SQS/SNS.
  • Mentor SRE/DevOps engineers and collaborate with teams.
  • Contribute to AI-enabled reliability and AIOps initiatives.

Conocimientos

Observability/Monitoring
Distributed tracing
Dashboards & monitoring
Alerting/Incident Management
SRE/DevOps practices
Python/Bash scripting
Kubernetes/EKS familiarity
IaC with Terraform
AWS cloud infrastructure
AIOps awareness
Mentoring/leadership

Herramientas

Datadog
New Relic
Dynatrace
Grafana/Prometheus
Splunk/OpenSearch/ELK
CloudWatch
AppDynamics
PagerDuty
Grafana Alerting
Kubernetes
Terraform
Python

Descripción del empleo

Role: Lead SRE Engineer

Location: Guadalajara, Jalisco, Mexico

Experience: 6–10 years

Key Responsibilities
  • Lead Site Reliability Engineering initiatives across enterprise production environments.
  • Drive reliability, availability, scalability, and performance improvements.
  • Lead P1/P2 incident response, RCA, and postmortems.
  • Define and improve SLI, SLO, and Error Budget practices.
  • Build and maintain observability, monitoring, dashboards, and alerts.
  • Automate operational processes using Python/Bash and APIs.
  • Manage Infrastructure as Code using Terraform.
  • Support AWS cloud infrastructure, including Kubernetes/EKS, ECS/Fargate, Lambda, RDS/Aurora, SQS/SNS, and related services.
  • Mentor SRE/DevOps engineers and collaborate with development, security, platform, and architecture teams.
  • Contribute to AI-enabled reliability and AIOps initiatives.
Must-Have Experience
  • Observability / Monitoring – Mandatory
  • Hands‑on experience with Datadog or an equivalent APM, logging, and monitoring platform , such as New Relic, Dynatrace, Grafana/Prometheus, Splunk, ELK/OpenSearch, CloudWatch, or AppDynamics.
  • Experience should include:
    • APM Metrics and logs
    • Distributed tracing
    • Dashboards and monitoring
    • Alerting Production troubleshooting
  • Alerting / Incident Management – Mandatory
  • Hands‑on experience with PagerDuty or an equivalent alerting/paging platform , such as Opsgenie, ServiceNow, Splunk On-Call, xMatters, or Grafana Alerting.
  • Experience should include:
Consigue la evaluación confidencial y gratuita de tu currículum.

o arrastra y suelta tu archivo aquí

Similar jobs

Puestos de trabajo similares que vale la pena comparar

Site Reliability Engineering (SRE) Lead - 2770
Site Reliability Engineering (SRE) Lead - 2770

Xideral • Región Centro

A distancia
MXN 700.000 - 900.000
Attractive Salary
Performance bonuses
SGMM Medical insurance
Senior SRE Lead: Reliability, Observability & AI Ops
Senior SRE Lead: Reliability, Observability & AI Ops

Cloudsufi • Región Centro

Presencial
MXN 900.000 - 1.400.000
Remote SRE Lead - Observability, IaC & Automation
Remote SRE Lead - Observability, IaC & Automation

Xideral • Región Centro

A distancia
MXN 700.000 - 900.000
Attractive Salary
Performance bonuses
SGMM Medical insurance
SRE | On site in GDL or CDMX
SRE | On site in GDL or CDMX

gsbsolutions1 • Región Centro

Presencial
MXN 72.000 - 88.000
Excellent superior benefits
SRE (Engineering & Administration Background)
SRE (Engineering & Administration Background)

Fulcrum Digital • Ciudad de México

Híbrido
MXN 900.000 - 1.500.000
Remote SRE Engineer - Automate, Observe & Own Reliability
Remote SRE Engineer - Automate, Observe & Own Reliability

AgileEngine • Ciudad de México

Híbrido
MXN 1.049.000 - 1.400.000
Senior SRE Lead (IC): Reliability & AI Automation
Senior SRE Lead (IC): Reliability & AI Automation

Hobbsnews • México

A distancia
MXN 1.750.000 - 2.276.000
Remote Senior SRE: High-Impact Reliability & Observability
Remote Senior SRE: High-Impact Reliability & Observability

Jobgether • México

A distancia
MXN 900.000 - 1.300.000
Fully remote working environment
Global engineering organization
Ownership over production reliability
Site Reliability Engineer
Site Reliability Engineer

CTC • Estado de México

A distancia
MXN 1.433.000 - 1.793.000
Site Reliability Engineer
Site Reliability Engineer

BULLS SYSTEM SL • Región Centro

Presencial
MXN 600.000 - 800.000