Site Reliability Engineer/ 100% Remote in Mexico

Pyramid Consulting, Inc

México

A distancia

MXN 520.000 - 800.000

Jornada completa

hace 1 hora
Sé de los primeros/as/es en solicitar esta vacante

Recibe más respuestas de empleadores

Envía un currículum específico para el puesto de trabajo en cuestión de minutos.

Descripción de la vacante

Pyramid Consulting, Inc. is seeking a Senior Site Reliability Engineer to enhance the stability and reliability of production systems.

The role intersects systems engineering, data science, and resilience engineering to turn incident data into actionable reliability strategies. You will design observability solutions, deploy containerized workloads with Kubernetes on Google Cloud Platform, and collaborate with engineering, DevOps, data, and product teams to reduce toil and MTTR.

Formación

  • 4+ years of SRE/DevOps experience managing production environments.
  • Strong SQL and data analysis skills.
  • Proficiency in one of Golang, Java, Python or C++.
  • Deep understanding of observability (alerting, tracing, logging, metrics).
  • Experience with Kubernetes and container orchestration.
  • Strong experience with GCP cloud infrastructure.
  • Knowledge of statistical methods for anomaly detection and trend analysis.
  • Strong root cause analysis and preventative reliability skills.
  • Excellent communication and ability to translate incidents into business impact.

Responsabilidades

  • Analyze production incidents and system performance data to identify reliability trends.
  • Develop tooling to transform incident data into actionable reliability strategies.
  • Design and implement solutions to improve stability, availability, and scalability.
  • Build and maintain observability covering metrics, logging, alerting, and tracing.
  • Investigate complex production issues and perform root cause analysis across distributed systems.
  • Analyze operational data using SQL and statistics to identify anomalies and trends.
  • Apply statistical methods to system performance data for reliability improvements.
  • Develop automation and tooling using Golang, Java, Python, or C++.
  • Design, deploy, and maintain Kubernetes-based workloads on cloud platforms.
  • Manage and troubleshoot cloud infrastructure with GCP experience.
  • Partner with cross-functional teams to establish reliability best practices.
  • Apply resilience engineering principles to influence reliability across processes.

Conocimientos

SRE experience 4+ years
SQL and data analysis
Golang/Java/Python/C++
Observability
Kubernetes
GCP
Statistical methods
Root cause analysis
Communication
Resilience Engineering

Herramientas

Prometheus
Grafana
OpenTelemetry
Jaeger
Datadog
Splunk
Python data analysis

Descripción del empleo

Job Type: Long-Time based contract Job opportunity
Location: 100% Remote in Mexico
Job Description:

We are looking for an experienced Senior Site Reliability Engineer (SRE) / Reliability Engineer to improve the stability, availability, and reliability of production systems. This role focuses on the intersection of systems engineering, data science, and resilience engineering, using incident data and operational insights to identify trends, uncover root causes, and develop actionable reliability strategies.

Key Responsibilities
  • Analyze production incidents, system performance data, and incident logs to identify reliability trends and opportunities for improvement.
  • Develop tooling and processes to transform raw incident data into actionable reliability strategies.
  • Design and implement solutions that improve system stability, availability, scalability, and operational resilience.
  • Build and maintain observability solutions covering metrics, structured logging, alerting, and distributed tracing.
  • Investigate complex production issues and perform root cause analysis across distributed systems.
  • Analyze operational data using SQL and statistical techniques to identify anomalies, trends, and performance patterns.
  • Apply statistical methods such as outlier detection and regression analysis to system performance and reliability data.
  • Develop automation and engineering tools using Golang, Java, Python, C++, or other programming languages.
  • Design, deploy, and maintain containerized workloads using Kubernetes.
  • Manage and troubleshoot cloud infrastructure, with strong experience in Google Cloud Platform (GCP).
  • Partner with engineering, DevOps, data, and product teams to establish reliability best practices and improve operational processes.
  • Apply Resilience Engineering principles to understand how systems, processes, and human decision-making influence reliability.
  • Identify opportunities to reduce recurring incidents, operational toil, and mean time to recovery.
  • Translate complex technical failures and reliability issues into clear business-impact reports for technical and non-technical stakeholders.
  • Contribute to a culture of continuous learning, incident analysis, and proactive reliability improvement.
Required Skills & Experience
  • 4+ years of experience in SRE, DevOps, Systems Engineering, or related roles managing production environments at scale.
  • Strong hands-on experience with SQL and data analysis.
  • Strong programming experience in one or more of Golang, Java, Python, or C++.
  • Deep understanding of observability, including alerting systems, distributed tracing, structured logging, and metrics collection.
  • Experience with Kubernetes and container orchestration.
  • Strong experience with GCP cloud infrastructure.
  • Experience analyzing system performance and operational data using statistical methods.
  • Knowledge of outlier detection, regression analysis, trend analysis, anomaly detection.
  • Strong understanding of distributed systems, production troubleshooting, and reliability engineering.
  • Ability to perform effective root cause analysis and develop preventative reliability strategies.
  • Strong understanding of Resilience Engineering and the human factors that influence system reliability.
  • Excellent communication skills, with the ability to translate technical incidents into clear business impact and executive-level reporting.
Preferred Skills
  • Experience with Prometheus, Grafana, OpenTelemetry, Jaeger, Datadog, Splunk, or similar observability platforms.
  • Experience with Python-based data analysis and statistical libraries.
  • Experience building reliability dashboards and operational analytics.
  • Knowledge of SLOs, SLIs, SLAs, error budgets, and incident management.
  • Experience with incident response, postmortems, and reliability improvement programs.
    Preferred Skills
    • Familiarity with Resilience Engineering, Chaos Engineering, and distributed systems reliability.
Consigue la evaluación confidencial y gratuita de tu currículum.
o arrastra y suelta tu archivo aquí
Similar jobs

Puestos de trabajo similares que vale la pena comparar

SR SRE Engineer/ 100% Remote in Mexico
SR SRE Engineer/ 100% Remote in Mexico

Pyramid Consulting, Inc • México

A distancia
MXN 1.200.000 - 1.800.000
Site Reliability Engineer
Site Reliability Engineer

CTC • Estado de México

A distancia
MXN 1.433.000 - 1.793.000
Site Reliability Engineering (SRE) Lead - 2770
Site Reliability Engineering (SRE) Lead - 2770

Xideral • Región Centro

A distancia
MXN 700.000 - 900.000
Attractive Salary
Performance bonuses
SGMM Medical insurance
Senior Site Reliability Engineer — Remote (Mexico)
Senior Site Reliability Engineer — Remote (Mexico)

Pyramid Consulting, Inc • México

A distancia
MXN 520.000 - 800.000
Site Reliability Engineer ID45689
Site Reliability Engineer ID45689

AgileEngine • Rosarito

A distancia
MXN 1.531.000 - 2.212.000
Mentorship and TechTalks
Competitive USD-based compensation
Work on modern solutions
+1
Remote SRE Engineer - Automate, Observe & Own Reliability
Remote SRE Engineer - Automate, Observe & Own Reliability

AgileEngine • Ciudad de México

Híbrido
MXN 1.049.000 - 1.400.000
Remote Site Reliability Engineer — Automate & Scale Systems
Remote Site Reliability Engineer — Automate & Scale Systems

CTC • Estado de México

A distancia
MXN 1.433.000 - 1.793.000
Site Reliability Engineer ID53670
Site Reliability Engineer ID53670

AgileEngine • Rosarito

Híbrido
MXN 870.000 - 1.306.000
Professional growth
Competitive compensation
Exciting projects
+1
DevOps / SRE Engineer – Technical Debt Remediation - Remote in Mexico
DevOps / SRE Engineer – Technical Debt Remediation - Remote in Mexico

GSB • Ciudad de México

Híbrido
MXN 1.016.000 - 1.216.000
Excellent superior benefits
Site Reliability Engineer ID60188
Site Reliability Engineer ID60188

AgileEngine • Ciudad de México

Híbrido
MXN 1.049.000 - 1.400.000
Professional growth: Mentorship, TechTalks, and personalized growth roadmaps.
Competitive compensation: USD-based pay with education, fitness, and team activity budgets.
Exciting projects: Modern solutions with Fortune 500 and top product companies.
+1