Staff Reliability Engineer — Resilient Systems & Telemetry

Vanguard

Malvern (Chester County)

On-site

USD 140,000 - 200,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Vanguard is seeking a Staff Reliability Engineer to lead PWTech reliability initiatives, architecting enterprise-scale resiliency solutions and automating incident responses. You will drive observability, distributed tracing, and diagnostics across cloud-native stacks, while influencing teams and setting standards for reliability from inception.

The role requires deep experience in distributed systems, leadership, and hands-on development in AWS, OpenTelemetry, and Python, with a strong emphasis

Qualifications

  • Eight+ years related experience, with at least two years of development experience.
  • Undergraduate degree or equivalent combination of training and experience. Graduate degree preferred.

Responsibilities

  • Lead the technical strategy, architecture, and evolution of PWTech reliability engineering platforms and capabilities, ensuring they scale across hundreds of applications and client-facing systems.
  • Design and build production-grade software and platforms that improve reliability outcomes, including automated incident detection, diagnostics, remediation, resiliency engineering, and operational intelligence.
  • Drive enterprise observability and diagnostics capabilities, enabling telemetry, distributed tracing, metrics, and operational insights across cloud-native technologies and application stacks.
  • Define and codify resilient application and platform patterns, such as graceful degradation, circuit breakers, load shedding, fault isolation, failover, and automated recovery, driving adoption through reusable software and standards.
  • Influence engineering teams and technology leaders to embed reliability from inception and establish technical standards across the organization.
  • Lead the resolution of complex reliability and production challenges, performing root cause analysis and engineering durable solutions.
  • Participate in special projects as assigned.

Skills

Distributed systems
Leadership
Root cause analysis
System design
Communication

Education

Bachelor's degree or equivalent

Tools

AWS
OpenTelemetry
Python

Job description

Vanguard is seeking a Staff Reliability Engineer to lead PWTech reliability initiatives, architecting enterprise-scale resiliency solutions and automating incident responses. You will drive observability, distributed tracing, and diagnostics across cloud-native stacks, while influencing teams and setting standards for reliability from inception.

The role requires deep experience in distributed systems, leadership, and hands-on development in AWS, OpenTelemetry, and Python, with a strong emphasis

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Engineer, Site Reliability
Engineer, Site Reliability

Vanguard • Malvern

On-site
USD 140,000 - 200,000
Senior Site Reliability Engineer — Platform & Observability
Senior Site Reliability Engineer — Platform & Observability

Jobtailor • North Carolina

On-site
USD 180,000 - 240,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • North Carolina

On-site
USD 180,000 - 240,000
Senior SRE: Enterprise Resiliency & AI-Driven Reliability
Senior SRE: Enterprise Resiliency & AI-Driven Reliability

Vanguard • Charlotte (NC)

Hybrid
USD 120,000 - 160,000
Hybrid work model
Senior Site Reliability Engineer
Senior Site Reliability Engineer

O.C. Tanner • Salt Lake City (UT)

On-site
USD 130,000 - 180,000
Senior Observability & Reliability Engineer - Remote
Senior Observability & Reliability Engineer - Remote

Bright Vision Technologies • Sterling (VA)

On-site
USD 100,000 - 150,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Vanguard • Charlotte (NC)

Hybrid
USD 120,000 - 160,000
Hybrid work model
Remote Reliability Engineer — SRE for Cloud Platforms
Remote Reliability Engineer — SRE for Cloud Platforms

Bright Vision Technologies • Milpitas (CA)

On-site
USD 75,000 - 95,000
Reliability Engineer
Reliability Engineer

Compunnel, Inc. • Town of Texas (WI)

On-site
USD 140,000 - 190,000
Senior Reliability Engineer – Cloud, Monitoring & DevOps
Senior Reliability Engineer – Cloud, Monitoring & DevOps

Arctic Wolf Networks, Inc. • Eden Prairie (MN)

Remote
USD 145,000 - 180,000
Equity for all employees
Flexible time off
401k match