Senior SRE Lead: Reliability, Observability & Cloud

Shieldai

San Mateo (CA)

On-site

USD 180,000 - 240,000

Full time

14 days+
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Shield AI is seeking an experienced SRE Lead to establish and mature our reliability practices across cloud infrastructure and platform services. You will set targets, improve observability, and ensure production systems can be operated and recovered predictably.

This hands-on role involves investigating complex failures, improving tooling, and driving engineering improvements while mentoring the Cloud Engineering and Reliability teams toward a reliability-first mindset.

Qualifications

  • 7+ years of experience in SRE or related fields.
  • Experience operating production services with defined availability and reliability requirements.
  • Experience implementing SLIs, SLOs, monitoring, alerting, and incident response practices.
  • Experience designing and operating infrastructure in AWS or another major cloud environment.
  • Experience with infrastructure-as-code and automated infrastructure provisioning.
  • Experience supporting containerized applications and distributed systems.
  • Experience developing operational tooling or automation using Python, Go, or a similar language.
  • Ability to diagnose complex failures across applications, infrastructure, networking, and dependent services.
  • Experience leading incident response and root-cause analysis across engineering teams.
  • Experience leading and executing on technical vision of a team over multi-quarter timelines.

Responsibilities

  • Define and implement SLIs, SLOs, and other measures of service reliability.
  • Build and improve monitoring, alerting, logging, and tracing for infrastructure and platform services.
  • Lead technical response to complex incidents and drive root-cause analysis through resolution.
  • Identify recurring failure modes and work with engineering teams to eliminate them.
  • Improve system resilience through automation, testing, capacity planning, and failure recovery.
  • Develop tooling and automation that reduces manual operational work.
  • Partner with product and platform teams to incorporate reliability requirements into system design.
  • Establish incident response practices that improve detection, diagnosis, communication, and recovery.
  • Mentor product engineers and drive adoption of strong reliability and operational practices.
  • Mentor teammates in SRE and Cloud Engineering.
  • Define and manage short-and-long term SRE roadmap, distributing work across teammates.

Skills

SRE leadership
Cloud engineering
Python
Go
Kubernetes
AWS
Incident response
Root-cause analysis
Automation tooling
Observability
Capacity planning
Cost management

Tools

Terraform
AWS CloudFormation

Job description

Shield AI is seeking an experienced SRE Lead to establish and mature our reliability practices across cloud infrastructure and platform services. You will set targets, improve observability, and ensure production systems can be operated and recovered predictably.

This hands-on role involves investigating complex failures, improving tooling, and driving engineering improvements while mentoring the Cloud Engineering and Reliability teams toward a reliability-first mindset.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE Lead: Reliability & Cloud Platforms
Senior SRE Lead: Reliability & Cloud Platforms

Shield AI • San Mateo (CA)

On-site
USD 220,000 - 340,000
Bonus
Benefits
Equity
SRE Lead: Reliability & Cloud Observability Architect
SRE Lead: Reliability & Cloud Observability Architect

BlackCube Labs • San Diego (CA)

On-site
USD 190,000 - 280,000
SRE Lead: Cloud Reliability & Incident Response
SRE Lead: Cloud Reliability & Incident Response

Shieldai • San Diego (CA)

On-site
USD 180,000 - 240,000
Senior Production SRE: Cloud & On-Prem Reliability
Senior Production SRE: Cloud & On-Prem Reliability

Weights & Biases • New York (NY)

On-site
USD 140,000 - 180,000
Medical Insurance
Dental Insurance
Vision Insurance
+15
Senior SRE Leader: Reliability & Observability
Senior SRE Leader: Reliability & Observability

Expedite Talent Solutions • United States

Hybrid
USD 130,000 - 160,000
SRE Lead: Drive Reliability, Observability & Automation
SRE Lead: Drive Reliability, Observability & Automation

Shield AI • San Mateo (CA)

On-site
USD 150,000 - 230,000
Excellent Medical Coverage
Stock Benefits
401K Matching
+2
SRE Architecture Lead: Reliability & Cloud Platform
SRE Architecture Lead: Reliability & Cloud Platform

MACHINE LEARNING TECHNOLOGIES LLC • Atlanta (GA)

On-site
USD 140,000 - 190,000
Senior Applied AI SRE: Reliability & Observability Lead
Senior Applied AI SRE: Reliability & Observability Lead

PowerToFly • Tennessee

On-site
USD 120,000 - 190,000
Senior Staff Lead Site Reliability Engineer (R5803)
Senior Staff Lead Site Reliability Engineer (R5803)

Shieldai • San Diego (CA)

On-site
USD 180,000 - 240,000
Sr. Staff Lead Site Reliability Engineer (R5803)
Sr. Staff Lead Site Reliability Engineer (R5803)

Shieldai • San Mateo (CA)

On-site
USD 180,000 - 240,000