Staff Reliability Engineer - Multi-Region & Observability

Metropolis Technologies

Seattle (WA)

On-site

USD 204,000 - 249,000

Full time

11 days ago
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Stock options
Bonus plans
Healthcare benefits
401(k) plan
Disability insurance
Life insurance

Job summary

Metropolis Technologies is seeking a Staff Software Engineer focused on Reliability to own reliability across the Metropolis platform and drive practices ensuring 99.9%+ uptime as we scale to new markets. You will join the Product Foundations team and build the foundational infrastructure powering mobility commerce.

You’ll design failover systems, implement chaos engineering, and enhance our observability foundation.

Qualifications

  • 8+ years of engineering experience at scale.
  • Expert-level reliability engineering with multi-region architectures and failover automation.
  • Observability expertise with monitoring/alerting/tracing at scale (Datadog or similar).
  • Systems thinking to design resilient distributed systems.
  • Knowledge of replication, backup/restore, and NoSQL/SQL databases.
  • Production AWS experience with multi-region deployments and DNS failover.
  • Experience with AI-powered development tools and context engineering.
  • Strong technical communication and cross-team influence.
  • Proficiency in Java and/or Scala, JVM performance and concurrency.

Responsibilities

  • Own the reliability posture and 99.9%+ uptime across services.
  • Design automatic failover for external dependencies (Twilio, Stripe) with circuit breakers.
  • Architect regional deployment strategies with DB replication and DNS-based traffic routing.
  • Establish comprehensive monitoring with Datadog (APM, logs, metrics).
  • Implement synthetic monitoring, SLO-based alerts, on-call rotation, and health dashboards.
  • Own incident management: workflows, post-mortems, runbooks, MTTR reduction.
  • Advance resilience patterns across services: health checks, graceful degradation, feature flags.
  • Build and maintain local mirrors for dependencies, including caching and security scans.

Skills

Reliability engineering
Multi-region architectures
Circuit breakers
Chaos engineering
Datadog monitoring
Observability
Java/Scala
JVM performance
AWS cloud
DNS failover
Incident management
MTTR reduction
Product Foundations
AI tooling context engineering

Tools

Datadog
Chaos Monkey
Gremlin
GitHub Copilot
GitHub

Job description

Metropolis Technologies is seeking a Staff Software Engineer focused on Reliability to own reliability across the Metropolis platform and drive practices ensuring 99.9%+ uptime as we scale to new markets. You will join the Product Foundations team and build the foundational infrastructure powering mobility commerce.

You’ll design failover systems, implement chaos engineering, and enhance our observability foundation.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Staff Reliability Engineer: Observability & Resilience
Staff Reliability Engineer: Observability & Resilience

Metropolis • Seattle (WA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Staff Software Engineer, Reliability Seattle, Washington, United States
Staff Software Engineer, Reliability Seattle, Washington, United States

Metropolis • Seattle (WA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Staff Software Engineer, Reliability
Staff Software Engineer, Reliability

Metropolis Technologies • Seattle (WA)

On-site
USD 204,000 - 249,000
Stock options
Bonus plans
Healthcare benefits
+3
Site Reliability Engineer: Drive Resilience & Observability
Site Reliability Engineer: Drive Resilience & Observability

MaintainX (An Autodesk Company) • United States

Remote
USD 120,000 - 180,000
Senior Multi-Region Backend Reliability Engineer
Senior Multi-Region Backend Reliability Engineer

fomo Labs • New York (NY)

On-site
USD 140,000 - 210,000
Senior Manager, Customer Experience Engineering
Senior Manager, Customer Experience Engineering

metropolis • New York (NY)

On-site
USD 217,000 - 265,000
Healthcare benefits
401(k) plan
Disability coverage
+3
Senior Site Reliability Engineer: Observability & Resilience
Senior Site Reliability Engineer: Observability & Resilience

Remitly • Seattle (WA)

On-site
USD 180,000 - 225,000
Staff Reliability Engineer — Scale Cloud Infrastructure
Staff Reliability Engineer — Scale Cloud Infrastructure

EuroPython • Town of Sweden (NY)

On-site
USD 180,000 - 240,000
Senior Site Reliability Engineer — Remote, AWS & Observability
Senior Site Reliability Engineer — Remote, AWS & Observability

Prove • United States

Hybrid
USD 140,000 - 190,000
Wellbeing reimbursement
401k Match
Parental Leave Policy
+5
Platform Reliability Engineer
Platform Reliability Engineer

Amplemarket • United States

Remote
USD 120,000 - 170,000
Health Insurance
Stock Options
Annual Company Trip
+2