Senior Reliability Engineer – AI Infrastructure

Fireworks AI

United States

On-site

USD 140,000 - 210,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Fireworks AI seeks a Reliability Engineer to own and drive production resiliency across GPU-accelerated inference and training systems. You will define SLOs, error budgets, and readiness criteria while leading incident response and postmortems.

Collaboration with cloud infra, ML infrastructure, and product teams is essential to ensure scalable, fail-fast systems. You will automate observability, implement standard tooling, and reduce toil with robust reliability practices across multi-region

Qualifications

  • 5+ years with Linux internals, system performance troubleshooting, and networking fundamentals.
  • Bachelor’s or Master’s in CS/CE or equivalent practical experience.
  • Experience with GPU and ML infrastructure exposure is a plus.
  • Strong emphasis on incident response and postmortems.

Responsibilities

  • Define reliability standards: SLOs, error budgets, production readiness criteria.
  • Own incident management, postmortems, and observability standards across services.
  • Automate failure testing, alerting, and runbooks to reduce toil.
  • Collaborate with cloud infra, AI systems, and product teams to ensure resiliency.

Skills

Linux internals
System performance troubleshooting
Networking fundamentals
Python
Go
C++
Rust
Kubernetes
Terraform
Docker
Prometheus
Grafana
OpenTelemetry
SRE practices
Incident response

Education

Bachelor's or Master's in Computer Science, Computer Engineering, or equivalent

Tools

Kubernetes
Terraform
Docker
Prometheus
Grafana
OpenTelemetry

Job description

Fireworks AI seeks a Reliability Engineer to own and drive production resiliency across GPU-accelerated inference and training systems. You will define SLOs, error budgets, and readiness criteria while leading incident response and postmortems.

Collaboration with cloud infra, ML infrastructure, and product teams is essential to ensure scalable, fail-fast systems. You will automate observability, implement standard tooling, and reduce toil with robust reliability practices across multi-region

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Reliability Engineer — AI Infrastructure & SRE
Senior Reliability Engineer — AI Infrastructure & SRE

Fireworks • San Mateo (CA)

On-site
USD 150,000 - 230,000
Member of Technical Staff (Reliability Engineering)
Member of Technical Staff (Reliability Engineering)

Fireworks AI • United States

On-site
USD 140,000 - 210,000
Senior Cloud Infrastructure Engineer for ML Platforms
Senior Cloud Infrastructure Engineer for ML Platforms

Fireworks AI • United States

On-site
USD 180,000 - 260,000
Member of Technical Staff - Reliability Engineering
Member of Technical Staff - Reliability Engineering

Fireworks AI • New York (NY)

On-site
USD 140,000 - 210,000
Member of Technical Staff - Reliability Engineering
Member of Technical Staff - Reliability Engineering

Fireworks • San Mateo (CA)

On-site
USD 150,000 - 230,000
Senior AI-Driven Infra & Reliability Engineer – Remote
Senior AI-Driven Infra & Reliability Engineer – Remote

IgniteTech • Germany (OH)

On-site
USD 130,000 - 170,000
AI-first culture
No limits on AI tooling or compute
Fully remote
+2
Performance Optimization Engineer for AI Infrastructure
Performance Optimization Engineer for AI Infrastructure

Fireworks AI • San Mateo (CA)

On-site
USD 180,000 - 260,000
Senior Cloud Infrastructure Engineer - Scalable ML Platform
Senior Cloud Infrastructure Engineer - Scalable ML Platform

Fireworks • New York (NY), San Mateo (CA)

On-site
USD 140,000 - 210,000
Senior Backend Engineer AI-Driven Reliability (Remote)
Senior Backend Engineer AI-Driven Reliability (Remote)

Affirm • Boise (ID)

On-site
USD 173,000 - 233,000
Health coverage for you and dependents
FSAs - tech spending
Time off
+1
LLM Infrastructure Engineer - Scalable AI Platform
LLM Infrastructure Engineer - Scalable AI Platform

Fireworks AI • San Mateo (CA)

On-site
USD 140,000 - 210,000