Senior Site Reliability Engineer

Pyramid Consulting, Inc

United States

On-site

MXN 420,000 - 640,000

Full time

18 hours ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Pyramid Consulting, Inc. is seeking a Site Reliability Engineer (SRE) to improve the stability and performance of large-scale production systems.

This remote role focuses on incident response, automation, observability, and data analysis to drive reliability improvements across cloud-native environments. The role requires strong Python scripting, advanced SQL, and experience with RCA, monitoring, logging, and distributed tracing.

Qualifications

  • 4+ years of experience in SRE, DevOps, Systems Engineering, or Production Support.
  • Strong Python scripting and automation experience.
  • Advanced SQL and data analysis skills.
  • Experience with incident response, RCA, and production troubleshooting.
  • Strong understanding of observability, monitoring, logging, and distributed tracing.
  • Experience with Kubernetes and Google Cloud Platform (GCP).
  • Experience integrating and working with APIs.

Responsibilities

  • Respond to and manage production incidents, perform root cause analysis, and drive preventative solutions.
  • Develop automation and operational tooling using Python and APIs.
  • Analyze incident, log, and performance data using SQL and statistical methods to identify reliability improvements.
  • Build and enhance monitoring, alerting, logging, and distributed tracing capabilities.
  • Support and optimize Kubernetes-based applications running in GCP.
  • Create dashboards, reports, and reliability metrics to communicate technical and business impact.
  • Partner with engineering teams to improve system resilience, scalability, and operational efficiency.

Skills

Python
SQL
Incident response
RCA
APIs
Kubernetes
GCP
Observability
Monitoring
Logging
Distributed tracing
SRE
Production Support

Tools

Datadog
Splunk
Grafana
Prometheus
OpenTelemetry

Job description

Python, SQL, Incident Response, Root Cause Analysis (RCA), APIs, Kubernetes, GCP, Observability, Monitoring, Logging, Distributed Tracing, SRE, Reliability Engineering, Production Support.

Location: 100% REMOTE
Site Reliability Engineer (SRE) – Incident Response & Reliability Engineering

Site Reliability Engineer (SRE) to improve the stability, reliability, and performance of large-scale production systems. This role combines incident response, automation, observability, and data analysis to identify reliability trends, reduce operational risk, and drive continuous improvement across cloud-native environments.

Key Responsibilities
  • Respond to and manage production incidents, perform root cause analysis, and drive preventative solutions.
  • Develop automation and operational tooling using Python and APIs.
  • Analyze incident, log, and performance data using SQL and statistical methods to identify reliability improvements.
  • Build and enhance monitoring, alerting, logging, and distributed tracing capabilities.
  • Support and optimize Kubernetes-based applications running in GCP.
  • Create dashboards, reports, and reliability metrics to communicate technical and business impact.
  • Partner with engineering teams to improve system resilience, scalability, and operational efficiency.
Required Skills
  • 4+ years of experience in SRE, DevOps, Systems Engineering, or Production Support.
  • Strong Python scripting and automation experience.
  • Advanced SQL and data analysis skills.
  • Experience with incident response, RCA, and production troubleshooting.
  • Strong understanding of observability, monitoring, logging, and distributed tracing.
  • Experience with Kubernetes and Google Cloud Platform (GCP).
  • Experience integrating and working with APIs.
  • Excellent communication skills with the ability to explain technical issues to non-technical audiences.
Preferred Skills
  • Experience with statistical analysis, anomaly detection, or performance trend analysis.
  • Familiarity with Datadog, Splunk, Grafana, Prometheus, or OpenTelemetry.
  • Knowledge of SRE principles, SLIs/SLOs, and resilience engineering.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote SRE — Incident Response, Reliability & Observability
Remote SRE — Incident Response, Reliability & Observability

Pyramid Consulting, Inc • United States

Remote
MXN 420,000 - 640,000
Site Reliability Engineer
Site Reliability Engineer

JobCubby • Barrington (RI), Northern (KY)

On-site
USD 110,000 - 170,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

ACI Infotech • Seattle (WA), Northern (KY)

Hybrid
USD 120,000 - 170,000
Health insurance
Dental insurance
Vision insurance
+3
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer – Lead
Site Reliability Engineer – Lead

Jobtailor • Arizona

On-site
USD 140,000 - 230,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Kovoro • Denver (CO), Northern (KY)

Hybrid
USD 150,000 - 190,000
Staff Site Reliability Engineer, SRE
Staff Site Reliability Engineer, SRE

Jobtailor • California (MO)

On-site
USD 120,000 - 210,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000
Sr SRE Automation Engineer
Sr SRE Automation Engineer

Compunnel, Inc. • Austin (TX), Northern (KY)

Hybrid
USD 130,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000