Site Reliability Engineer — Scale, Observability & Cloud

Air Apps

San Francisco (CA)

On-site

USD 140,000 - 180,000

Full time

2 days ago
Be an early applicant
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Apple hardware ecosystem for work.
Annual Bonus.
Medical Insurance (vision & dental)
Disability insurance - short and long‑
401k up to 4%

Job summary

Air Apps is seeking a Site Reliability Engineer to ensure the reliability, availability, and scalability of our AI-powered Personal & Entrepreneurial Resource Planner across cloud environments. You will join a team bridging software development and operations to minimize downtime.

You'll design scalable systems, implement observability, and automate deployments using IaC, Docker, and Kubernetes, while collaborating with cross-functional teams and supporting on-call rotations to keep services

Qualifications

  • 4+ years in SRE/DevOps or sys engineering.
  • Strong knowledge of AWS, Azure or GCP.
  • Experience with monitoring: Prometheus, Grafana, Datadog or ELK.
  • Proficient in IaC: Terraform, CloudFormation or Pulumi.
  • Hands-on with Docker, Kubernetes and Helm.
  • Strong Linux admin and networking basics.
  • Experience with incident management and RCA.

Responsibilities

  • Design scalable, reliable, and fault-tolerant systems across cloud environments.
  • Develop and maintain observability tools and dashboards.
  • Automate provisioning, deployment, and incident response with IaC.
  • Optimize performance, capacity, and incident response workflows.
  • Collaborate with development and DevOps to improve reliability.
  • Perform RCA and implement preventative measures.
  • Ensure high availability with load balancing and DR strategies.
  • Improve CI/CD pipelines for faster, stable deployments.
  • Manage cloud costs across AWS, Azure, or GCP.
  • Participate in on-call rotations to minimize downtime.

Skills

SRE/DevOps experience
Cloud platforms
Observability tools
IaC (Terraform/CF/Pulumi)
Containerization (Docker/K8s)
Linux admin
Incident management
Scripting (Bash/Python/Go)
Load balancing
Security/compliance
Cross-functional collab

Tools

Terraform
CloudFormation
Pulumi
Prometheus
Grafana
Datadog
ELK
New Relic
Docker
Kubernetes
Helm
Bash
Python
Go

Job description

Air Apps is seeking a Site Reliability Engineer to ensure the reliability, availability, and scalability of our AI-powered Personal & Entrepreneurial Resource Planner across cloud environments. You will join a team bridging software development and operations to minimize downtime.

You'll design scalable systems, implement observability, and automate deployments using IaC, Docker, and Kubernetes, while collaborating with cross-functional teams and supporting on-call rotations to keep services

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer — Scale an AI‑Powered SaaS Platform
Site Reliability Engineer — Scale an AI‑Powered SaaS Platform

Instrumental Inc. • Palo Alto (CA)

On-site
USD 140,000 - 165,000
Health insurance
Vision insurance
Dental plan
+2
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Air Apps • San Francisco (CA)

On-site
USD 140,000 - 180,000
Apple hardware ecosystem for work.
Annual Bonus.
Medical Insurance (vision & dental)
+2
Senior Site Reliability Engineer — AI Platform Scale
Senior Site Reliability Engineer — AI Platform Scale

Future Secure AI • Austin (TX)

On-site
USD 140,000 - 190,000
Site Reliability Engineer — Scale & Resilience for AI Ops
Site Reliability Engineer — Scale & Resilience for AI Ops

HappyRobot • San Francisco (CA)

On-site
USD 120,000 - 160,000
Site Reliability Engineer: Automation & Observability
Site Reliability Engineer: Automation & Observability

Randstad Digital Americas • Plano (TX)

On-site
USD 115,000 - 125,000
Medical insurance
401K plan
Site Reliability Engineer - Big Data Platform & Multi-Cloud
Site Reliability Engineer - Big Data Platform & Multi-Cloud

Apple Inc. • Austin (TX), Northern (KY)

Hybrid
USD 120,000 - 170,000
Site Reliability Engineer - Ad Tech Platform, Scalable
Site Reliability Engineer - Ad Tech Platform, Scalable

Socket.dev • Cupertino (CA)

On-site
USD 150,000 - 190,000
Site Reliability Engineer (Edge Services), Infrastructure Services
Site Reliability Engineer (Edge Services), Infrastructure Services

Apple Inc. • Austin (TX)

On-site
USD 110,000 - 150,000
AI-Driven SRE Engineer for Cloud & Automation
AI-Driven SRE Engineer for Cloud & Automation

Skill • Austin (TX)

On-site
USD 140,000 - 190,000
Subsidized health plan
Retirement plan with match
Paid sick leave
AI-Driven Azure SRE: Build Reliable Cloud at Scale
AI-Driven Azure SRE: Build Reliable Cloud at Scale

Intapp • United States

Hybrid
USD 120,000 - 160,000
Hybrid work model
Equity/Stock in Intapp
Home office stipend
+3