Lead Site Reliability Engineer — AI Ops & Resilience

NightDragon Acquisition Corp.

Santa Clara (CA)

On-site

USD 152,000 - 228,000

Full time

7 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

IonQ is seeking a Staff Site Reliability Engineer to lead reliability across regions and services in its Santa Clara, CA office with partial remote work. You will own the reliability direction, define standards, and mentor engineers while remaining hands-on with observability platforms and AI Ops workflows.

You will collaborate with Platform Engineering, DevSecOps, and Product Development to improve stateful and streaming platform reliability, capacity planning, and incident response—helping

Qualifications

  • 7+ years of production engineering experience with hands-on reliability work.
  • Hands-on experience operating large-scale, fault-tolerant production systems on AWS or GCP.
  • Observability ownership and governance of SLOs and error budgets.
  • Disaster recovery and incident command experience, with root-cause to systemic fixes.
  • Multi-team technical leadership and standards adoption beyond a single service.
  • Ability to design and lead resilient, automated platforms and AIOps workflows.

Responsibilities

  • Own production reliability end-to-end, including SLOs, error budgets, and production outcomes.
  • Design and operate the observability stack and ensure instrumented production services.
  • Define and manage service-level objectives, run reviews, and drive corrective actions.
  • Lead resilience by designing chaos experiments and validating recovery mechanisms.
  • Direct incident response as incident commander for high-severity events and ensure rapid remediation.
  • Run on-call rotations and clean handoffs across regions to ensure 24/7 coverage.
  • Drive disaster recovery testing and improvements based on exercise findings.
  • Co-own cloud security posture and runtime vulnerability detection with DevSecOps.
  • Oversee reliability of data and streaming services, including capacity planning and autoscaling.

Skills

Production engineering
Incident command
Observability ownership
Reliability improvements
Cross-team collaboration
SRE mindset

Tools

AWS
GCP
Postgres
Redis/Valkey
Kafka
OpenSearch

Job description

IonQ is seeking a Staff Site Reliability Engineer to lead reliability across regions and services in its Santa Clara, CA office with partial remote work. You will own the reliability direction, define standards, and mentor engineers while remaining hands-on with observability platforms and AI Ops workflows.

You will collaborate with Platform Engineering, DevSecOps, and Product Development to improve stateful and streaming platform reliability, capacity planning, and incident response—helping

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Staff Site Reliability Engineer - Platform Resilience
Staff Site Reliability Engineer - Platform Resilience

Physics World • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Staff Site Reliability Engineer: Platform Resilience & Observability
Staff Site Reliability Engineer: Platform Resilience & Observability

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Staff Reliability Engineer - Observability & AI Ops
Staff Reliability Engineer - Observability & AI Ops

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 280,000
Senior Service Reliability & AI Ops Engineer
Senior Service Reliability & AI Ops Engineer

NightDragon Acquisition Corp. • Santa Clara (CA)

On-site
USD 170,000 - 210,000
Home technology stipend
Medical, dental, vision coverage
401(k) matching
+1
Staff SRE & AI-Driven Observability Architect
Staff SRE & AI-Driven Observability Architect

Physics World • Santa Clara (CA)

Hybrid
USD 170,000 - 250,000
Senior Staff Reliability & Observability Architect
Senior Staff Reliability & Observability Architect

Ionq • Santa Clara (CA)

On-site
USD 162,000 - 270,000
Staff Site Reliability Engineer
Staff Site Reliability Engineer

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Staff Site Reliability Engineer — AI-Driven Reliability
Staff Site Reliability Engineer — AI-Driven Reliability

EarnIn • Mountain View (CA)

Hybrid
USD 252,000 - 308,000
Equity
Hybrid work model
Staff Site Reliability Engineer
Staff Site Reliability Engineer

Physics World • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Senior Site Reliability Engineer, AI-Driven Reliability
Senior Site Reliability Engineer, AI-Driven Reliability

AlphaSense • United States

Remote
USD 150,000 - 225,000