SRE Lead — Reliability, Observability & Incident Response

Shieldai

San Mateo (CA)

On-site

USD 180,000 - 260,000

Full time

5 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Bonus
Benefits
Equity

Job summary

Shield AI is seeking an experienced SRE lead to establish and mature the reliability program across our cloud infrastructure and platform services. You will define SLIs/SLOs, improve observability, and ensure production systems operate and recover predictably.

This is a deeply technical, hands-on role. You will investigate failures, enhance tooling, drive root-cause analysis, and mentor teams toward a reliability-first mindset.

Qualifications

  • 7+ years of experience in SRE, software/infra engineering or related fields.
  • Experience operating production services with defined availability requirements.
  • Experience implementing SLIs/SLOs, monitoring, alerting, and incident response.
  • Experience designing and operating infrastructure in AWS or another cloud.
  • Experience with infrastructure-as-code and automated provisioning.
  • Experience supporting containerized applications and distributed systems.
  • Experience developing tooling using Python, Go, or similar language.
  • Ability to diagnose complex failures across apps, infra, networking, and services.
  • Experience leading incident response and guiding technical vision.

Responsibilities

  • Define and implement reliability targets and measures (SLIs/SLOs).
  • Build and improve monitoring, logging, alerting, and tracing for services.
  • Lead technical response to complex incidents and root-cause analysis.
  • Eliminate recurring failure modes with engineering teams.
  • Improve resilience through automation, testing, and capacity planning.
  • Develop tooling that reduces manual operational work.
  • Incorporate reliability requirements into system design with product teams.
  • Establish incident response practices for better detection and recovery.
  • Mentor engineers in reliability and Cloud Engineering.
  • Define and manage short- and long-term SRE roadmap.

Skills

SRE leadership
Production reliability
SLIs/SLOs
AWS / cloud
IaC
Containerized apps
Python/Go tooling
Incident leadership
Technical vision

Tools

Kubernetes

Job description

Shield AI is seeking an experienced SRE lead to establish and mature the reliability program across our cloud infrastructure and platform services. You will define SLIs/SLOs, improve observability, and ensure production systems operate and recover predictably.

This is a deeply technical, hands-on role. You will investigate failures, enhance tooling, drive root-cause analysis, and mentor teams toward a reliability-first mindset.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

SRE Lead: Reliability & Cloud Observability Architect
SRE Lead: Reliability & Cloud Observability Architect

BlackCube Labs • San Diego (CA)

On-site
USD 190,000 - 280,000
SRE Lead: Reliability & Observability Champion (Cloud)
SRE Lead: Reliability & Observability Champion (Cloud)

Shield AI • San Diego (CA)

On-site
USD 190,000 - 280,000
Equity
Benefits
Senior SRE Lead: Reliability, Automation & Incidents
Senior SRE Lead: Reliability, Automation & Incidents

Shield AI • San Diego (CA)

On-site
USD 183,000 - 275,000
Equity
Bonus
Benefits
Senior SRE Lead — Cloud Reliability & Platform Architect
Senior SRE Lead — Cloud Reliability & Platform Architect

Shieldai • San Diego (CA)

On-site
USD 150,000 - 230,000
Senior SRE Lead - Cloud Reliability & Observability
Senior SRE Lead - Cloud Reliability & Observability

Shield AI • San Mateo (CA)

On-site
USD 220,000 - 340,000
Equity
Bonus
Benefits
Senior SRE Leader: Reliability & Observability
Senior SRE Leader: Reliability & Observability

Expedite Talent Solutions • United States

Hybrid
USD 130,000 - 160,000
SRE Manager: Lead Reliability & Observability at Scale
SRE Manager: Lead Reliability & Observability at Scale

Iac/interactivecorp • Sacramento (CA)

On-site
USD 150,000 - 210,000
Collaborative work environment
Commitment to carbon‑reduction mission
Flex schedule
+2
SRE Architecture Lead: Reliability & Cloud Platform
SRE Architecture Lead: Reliability & Cloud Platform

MACHINE LEARNING TECHNOLOGIES LLC • Atlanta (GA)

On-site
USD 140,000 - 190,000
Associate SRE: Automation & Reliability
Associate SRE: Automation & Reliability

Socket.dev • United States

Remote
USD 90,000 - 120,000
SRE Lead Architect — Cloud, Kubernetes & Reliability
SRE Lead Architect — Cloud, Kubernetes & Reliability

Tech Mirrors • City of Albany (NY)

On-site
USD 140,000 - 210,000