Staff SRE: Platform Reliability Architect

Anduril Industries

Costa Mesa (CA)

On-site

USD 191,000 - 253,000

Full time

4 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Anduril Industries is seeking a Staff SRE to define and scale the reliability architecture for its CorpTech Platform, impacting production across manufacturing and business operations. You will own observability, deployment safety, incident response, and SLO governance, guiding multiple engineering teams through platform-level decisions.

You will lead capacity planning, cost optimization, and AI-enabled reliability practices, partnering with senior engineers and leadership to drive durable

Qualifications

  • 10+ years in site reliability engineering or production/infrastructure engineering with architecture-level scope.
  • Experience owning reliability infrastructure used by multiple teams, including observability or deployment tooling.
  • Fluency across distributed systems, Kubernetes, cloud platforms (AWS/GCP/Azure).
  • Proficiency in Go, Python, or Rust for production tooling and automation.
  • Experience defining SRE standards and production-readiness frameworks.
  • Track record leading incident response and turning findings into durable improvements.
  • Ability to work independently in ambiguity and influence across teams without authority.
  • Excellent written and verbal communication with leadership.

Responsibilities

  • Set reliability architecture for CorpTech Platform production environment, including observability, deployment, incident management, capacity planning, and fault isolation.
  • Design and operate observability platform with metrics, tracing, logging, alerts, and dashboards for scale.
  • Own deployment infrastructure and release-safety mechanisms including canaries, rollbacks, and gates for fast yet safe shipping.
  • Define and govern SLOs, creating common language for trade-off decisions.
  • Identify systemic risks and drive investments to eliminate whole failure classes.
  • Establish production-readiness standards and embed reliability in the development lifecycle.
  • Lead incident response for complex failures and drive durable improvements.
  • Develop reliability patterns for AI-enabled systems including drift monitoring and graceful degradation.
  • Provide technical direction to SRE and infrastructure engineers and align platform planning.
  • Drive capacity planning, cost optimization, and performance engineering for critical paths.

Skills

SRE leadership
Observability platforms
Kubernetes
Cloud platforms
Systems programming
Production readiness
Incident response
Communication
Security clearance

Education

Bachelor's in CS/Engineering or related

Tools

Datadog
Grafana
Prometheus
OpenTelemetry

Job description

Anduril Industries is seeking a Staff SRE to define and scale the reliability architecture for its CorpTech Platform, impacting production across manufacturing and business operations. You will own observability, deployment safety, incident response, and SLO governance, guiding multiple engineering teams through platform-level decisions.

You will lead capacity planning, cost optimization, and AI-enabled reliability practices, partnering with senior engineers and leadership to drive durable

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Staff SRE: Reliability Architect for Enterprise Platforms
Staff SRE: Reliability Architect for Enterprise Platforms

Anduril Industries • Costa Mesa (CA)

On-site
USD 191,000 - 253,000
Staff SRE: Platform Reliability & AI Observability
Staff SRE: Platform Reliability & AI Observability

Anduril Industries, Inc. • Costa Mesa (CA), Northern (KY)

Hybrid
USD 191,000 - 253,000
Staff SRE: Platform Reliability & Observability Leader
Staff SRE: Platform Reliability & Observability Leader

Anduril Industries, Inc. • Costa Mesa (CA), Northern (KY)

Hybrid
USD 191,000 - 253,000
Equity grants
Competitive benefits
Health benefits
Staff SRE Engineer: AI-Driven Platform Reliability
Staff SRE Engineer: AI-Driven Platform Reliability

AI Chopping Block • Costa Mesa (CA), Northern (KY)

Hybrid
USD 191,000 - 253,000
Senior SRE & Reliability Architect for Scalable Platforms
Senior SRE & Reliability Architect for Scalable Platforms

Slope • Costa Mesa (CA)

On-site
USD 191,000 - 253,000
Comprehensive benefits package
Staff SRE: Reliability Architect for AI-Driven Platform
Staff SRE: Reliability Architect for AI-Driven Platform

Slope • Costa Mesa (CA)

On-site
USD 191,000 - 253,000
Benefits package
Senior Platform Reliability Architect (SRE)
Senior Platform Reliability Architect (SRE)

Anduril-1 • Costa Mesa (CA)

On-site
USD 191,000 - 253,000
Staff DevOps Engineer
Staff DevOps Engineer

Anduril-1 • Costa Mesa (CA)

On-site
USD 180,000 - 260,000
Senior Director, Site Reliability & Observability
Senior Director, Site Reliability & Observability

Anduril-1 • Costa Mesa (CA)

On-site
USD 253,000 - 336,000
Staff Platform Engineer — Scale Reliability & Automation
Staff Platform Engineer — Scale Reliability & Automation

Anduril Industries • United States

On-site
USD 125,000 - 182,000
Equity grants
Health benefits