Staff Reliability Engineer: Observability & Resilience

Metropolis

Seattle, Northern (WA, KY)

Hybrid

USD 150,000 - 210,000

Full time

5 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Metropolis is seeking a Staff Software Engineer focused on Reliability to own reliability across the entire platform. You will drive failover strategies, chaos engineering, and observability improvements to sustain 99.9%+ uptime as we scale to new markets.

You will join the Product Foundations team and tackle external service failover, database replication, and disaster recovery planning while influencing architecture decisions and establishing company-wide reliability standards.

Qualifications

  • 8+ years of engineering experience in software or reliability-focused roles.
  • Expert-level reliability engineering skills including multi-region architectures and disaster recovery.
  • Experience implementing monitoring, alerting, tracing, and logging at scale (Datadog preferred).
  • Ability to design resilient distributed systems with strong systems thinking.

Responsibilities

  • Own the overall reliability posture for the Metropolis platform and establish metrics, systems, and practices for 99.9%+ uptime.

Skills

Reliability engineering
SRE practices
Production observability
Multi-region architectures

Tools

Datadog

Job description

Metropolis is seeking a Staff Software Engineer focused on Reliability to own reliability across the entire platform. You will drive failover strategies, chaos engineering, and observability improvements to sustain 99.9%+ uptime as we scale to new markets.

You will join the Product Foundations team and tackle external service failover, database replication, and disaster recovery planning while influencing architecture decisions and establishing company-wide reliability standards.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Staff Reliability Engineer - Multi-Region & Observability
Staff Reliability Engineer - Multi-Region & Observability

Metropolis Technologies • Seattle (WA)

On-site
USD 204,000 - 249,000
Stock options
Bonus plans
Healthcare benefits
+3
Staff Software Engineer, Reliability Seattle, Washington, United States
Staff Software Engineer, Reliability Seattle, Washington, United States

Metropolis • Seattle (WA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Site Reliability Engineer: Drive Resilience & Observability
Site Reliability Engineer: Drive Resilience & Observability

MaintainX (An Autodesk Company) • United States

Remote
USD 120,000 - 180,000
Senior Site Reliability Engineer: Observability & Resilience
Senior Site Reliability Engineer: Observability & Resilience

Remitly • Seattle (WA)

On-site
USD 180,000 - 225,000
Platform Reliability Engineer - Cloud, Observability, IaC
Platform Reliability Engineer - Cloud, Observability, IaC

Kalepa • Cincinnati (OH), Northern (KY)

Hybrid
USD 120,000 - 160,000
Medical insurance
Dental insurance
Vision insurance
+5
Staff Software Engineer, Reliability
Staff Software Engineer, Reliability

Metropolis Technologies • Seattle (WA)

On-site
USD 204,000 - 249,000
Stock options
Bonus plans
Healthcare benefits
+3
Systems Reliability Engineer: Observability & Incident Lead
Systems Reliability Engineer: Observability & Incident Lead

ITMC Systems, Inc • Berkeley Heights (NJ)

On-site
USD 124,000 - 193,000
Staff Reliability Engineer — Scale Cloud Infrastructure
Staff Reliability Engineer — Scale Cloud Infrastructure

EuroPython • Town of Sweden (NY)

On-site
USD 180,000 - 240,000
Senior Production Engineer Platform Reliability (Remote)
Senior Production Engineer Platform Reliability (Remote)

GitHub • United States

Remote
USD 255,000 - 425,000
Site Reliability Engineer — Platform Observability & Autonomy
Site Reliability Engineer — Platform Observability & Autonomy

MaintainX • San Francisco (CA), Northern (KY)

Hybrid
USD 130,000 - 180,000