Senior Service Reliability & AI Ops Engineer

NightDragon Acquisition Corp.

Santa Clara (CA)

On-site

USD 170,000 - 210,000

Full time

7 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Home technology stipend
Medical, dental, vision coverage
401(k) matching
Unlimited PTO

Job summary

IonQ is seeking a Staff Service Reliability and Operational Intelligence Engineer to define the technical direction for reliability across regions and services. You will own the reliability strategy, establish standards for production operations, and mentor teams while hands-on designing observability platforms and SLO programs, leading incident response, and driving automation for resilience.

The role emphasizes observability, automation, and a blameless improvement culture, with focus on

Qualifications

  • 8+ years in production engineering, SRE, platform or cloud operations.
  • Hands-on reliability work with large-scale systems on AWS or GCP.
  • Deep understanding of distributed systems, Kubernetes, CI/CD, and networking.
  • Experience defining and governing SLOs, SLIs, and error budgets.
  • Proven ownership of reliability standards and incident leadership.
  • Experience with AI Ops capabilities and automated remediation.

Responsibilities

  • Shape multi-year roadmap for operational excellence and production readiness.
  • Govern service ownership standards and runbooks across teams.
  • Lead observability platform evolution with consistent logs, metrics, traces.
  • Define dashboards, alert policies, and telemetry quality controls.
  • Own reliability governance including SLIs/SLOs and error budgets.
  • Lead high-severity incident response and blameless post-incident reviews.
  • Drive capacity planning, cloud/Kubernetes scaling, and cost controls.
  • Deliver AI Ops workflows for event correlation and autonomous triage.
  • Provide hands-on technical leadership during major incidents and launches.
  • Use data to prioritize continuous improvement and resilience exercises.

Skills

Reliability engineering
Platform engineering
AWS
GCP
Kubernetes
Observability
SLOs & SLIs
Incident response
AI Ops
Python
Go
IaC
CI/CD
Leadership

Tools

Jira
Confluence
Source control
Observability platforms

Job description

IonQ is seeking a Staff Service Reliability and Operational Intelligence Engineer to define the technical direction for reliability across regions and services. You will own the reliability strategy, establish standards for production operations, and mentor teams while hands-on designing observability platforms and SLO programs, leading incident response, and driving automation for resilience.

The role emphasizes observability, automation, and a blameless improvement culture, with focus on

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Staff SRE & AI-Driven Observability Architect
Staff SRE & AI-Driven Observability Architect

Physics World • Santa Clara (CA)

Hybrid
USD 170,000 - 250,000
Senior Staff Reliability & Observability Architect
Senior Staff Reliability & Observability Architect

Ionq • Santa Clara (CA)

On-site
USD 162,000 - 270,000
Staff Reliability Engineer - Observability & AI Ops
Staff Reliability Engineer - Observability & AI Ops

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 280,000
Staff Site Reliability Engineer - Platform Resilience
Staff Site Reliability Engineer - Platform Resilience

Physics World • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Lead Site Reliability Engineer — AI Ops & Resilience
Lead Site Reliability Engineer — AI Ops & Resilience

NightDragon Acquisition Corp. • Santa Clara (CA)

On-site
USD 152,000 - 228,000
Staff Site Reliability Engineer: Platform Resilience & Observability
Staff Site Reliability Engineer: Platform Resilience & Observability

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Staff Site Reliability Engineer
Staff Site Reliability Engineer

IonQ • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Staff Site Reliability Engineer
Staff Site Reliability Engineer

Physics World • Santa Clara (CA)

Hybrid
USD 180,000 - 240,000
Senior Staff Service Reliability and Operational Intelligence Engineer
Senior Staff Service Reliability and Operational Intelligence Engineer

Ionq • Santa Clara (CA)

On-site
USD 162,000 - 270,000
Staff Service Reliability and Operational Intelligence Engineer
Staff Service Reliability and Operational Intelligence Engineer

Physics World • Santa Clara (CA)

Hybrid
USD 170,000 - 250,000