Senior SRE: Scale Reliability & Observability

Megaport

Abbeyville (CO)

On-site

USD 130,000 - 190,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Contractor (PJ)
Paid Time Off
Competitive Compensation
Wellhub (former Gympass)
Annual Bonus
Flexible work hours
Growth opportunities

Job summary

Latitude.sh is seeking a Senior Site Reliability Engineer to focus on building reliable, observable, and self-healing systems at scale for our bare metal cloud platform.

You will design and implement tools to automate operations, improve incident response, and enhance system observability, ensuring the platform can handle customer workloads with high availability. This role emphasizes reliability, automation, and cloud-native security practices.

Qualifications

  • Must have strong experience with Linux/Unix production environments.
  • Experience designing and operating Kubernetes-based systems.
  • Proficiency with Terraform and Ansible for automation.
  • Experience with observability stacks (Prometheus, Grafana, Loki, ELK).
  • Solid scripting knowledge (Bash, Python, Go, or Ruby).
  • Working knowledge of Git and CI/CD pipelines.
  • Strong incident management and RCA skills.
  • Knowledge of cloud-native reliability and security best practices.
  • Excellent written and spoken English communication.

Responsibilities

  • Continuously improve platform reliability and performance.
  • Design, build, and maintain automation tools for operations and incident response.
  • Implement observability solutions: monitoring, alerting, tracing.
  • Collaborate with engineering and platform teams to design scalable systems.
  • Participate in on-call rotations and lead post-incident reviews.
  • Develop and document runbooks and processes for operational excellence.
  • Contribute to SLOs/SLIs and reliability metric adoption.

Skills

English communication
Linux/Unix production
Kubernetes
Infrastructure automation
Observability stacks
Scripting languages
Git & CI/CD
Incident management
Cloud-native reliability & security

Tools

Terraform
Ansible

Job description

Latitude.sh is seeking a Senior Site Reliability Engineer to focus on building reliable, observable, and self-healing systems at scale for our bare metal cloud platform.

You will design and implement tools to automate operations, improve incident response, and enhance system observability, ensuring the platform can handle customer workloads with high availability. This role emphasizes reliability, automation, and cloud-native security practices.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE - Cloud & Observability
Senior SRE - Cloud & Observability

Ridgeline • Reno (NV)

Hybrid
USD 153,000 - 210,000
Unlimited vacation
Education reimbursement
Wellness reimbursement
+1
Senior SRE — Scale Reliability for Healthcare Data Platform
Senior SRE — Scale Reliability for Healthcare Data Platform

CertifyOS • United States

On-site
USD 120,000 - 170,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Megaport • Abbeyville (CO)

On-site
USD 130,000 - 190,000
Contractor (PJ)
Paid Time Off
Competitive Compensation
+4
Senior SRE: Scale Reliability, Observability & CI/CD
Senior SRE: Scale Reliability, Observability & CI/CD

Breakout Tools • San Francisco (CA)

On-site
USD 120,000 - 160,000
Senior Platform SRE: Scale & Reliability
Senior Platform SRE: Scale & Reliability

United States Digital Space LLC • United States

Hybrid
USD 103,000 - 162,000
Health insurance
Vacation and RTT
Mental health and coaching
+7
Senior SRE & Platform Engineer — Observability & Automation
Senior SRE & Platform Engineer — Observability & Automation

Techunting • United States

On-site
USD 120,000 - 150,000
Senior SRE: Scalable Cloud Reliability & Observability
Senior SRE: Scalable Cloud Reliability & Observability

Latitude AI • Palo Alto (CA)

On-site
USD 179,000 - 269,000
Health insurance
401(k) match
Unlimited vacation
+2
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Latitude.sh • United States

Remote
USD 120,000 - 150,000
Paid Time Off
Competitive Compensation
Wellhub (former Gympass)
+2
Senior SRE II — Scale Systems with AI-Driven Reliability
Senior SRE II — Scale Systems with AI-Driven Reliability

Juniper Square • United States

On-site
USD 165,000 - 195,000
Health, dental, and vision care
Life insurance
Mental wellness coverage
+3
Senior SRE: Cloud-Native Reliability & Observability
Senior SRE: Cloud-Native Reliability & Observability

O.C. Tanner • Salt Lake City (UT)

On-site
USD 130,000 - 180,000