Site Reliability Engineer - Multi-Region Cloud & Automation

Evlo AI

San Francisco (CA)

On-site

USD 140,000 - 200,000

Full time

7 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Evlo AI is seeking a Site Reliability Engineer to own the reliability, scalability, and performance of production distributed systems across multi-region cloud environments. You will work with software squads to embed resilience, automate toil, and maintain strict SLAs.

You will design and maintain infrastructure on AWS or GCP using Terraform and Pulumi, implement observability with Prometheus, Grafana, OpenTelemetry, and Datadog, and drive incident response with blameless post-mortems.

Qualifications

  • 3–7 years of experience in SRE/DevOps or systems engineering in high-growth tech environments.
  • Strong Kubernetes administration and containerization expertise.
  • Proficiency in Python or Go for automation and tooling.
  • Experience with CI/CD, GitOps, and IaC frameworks.
  • Understanding of networking and distributed systems failure modes.

Responsibilities

  • Design, build, and maintain production infrastructure on AWS or GCP using IaC (Terraform, Pulumi).
  • Implement observability stacks (Prometheus, Grafana, OpenTelemetry, Datadog) for real-time monitoring and alerts.
  • Lead incident response and blameless postmortems to improve resilience.
  • Automate deployments with GitHub Actions, ArgoCD, and Kubernetes.
  • Optimize cloud costs, resources, and database performance without sacrificing reliability.
  • Enforce security, IAM policies, and disaster recovery runbooks across environments.

Skills

Kubernetes administration
Containerization (Docker)
Python or Go
CI/CD pipelines
Networking fundamentals
Distributed systems

Tools

Terraform
Pulumi
Prometheus
Grafana
OpenTelemetry
Datadog
GitHub Actions
ArgoCD

Job description

Evlo AI is seeking a Site Reliability Engineer to own the reliability, scalability, and performance of production distributed systems across multi-region cloud environments. You will work with software squads to embed resilience, automate toil, and maintain strict SLAs.

You will design and maintain infrastructure on AWS or GCP using Terraform and Pulumi, implement observability with Prometheus, Grafana, OpenTelemetry, and Datadog, and drive incident response with blameless post-mortems.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Cloud SRE: Build Resilient, Secure, Scalable Infra
Cloud SRE: Build Resilient, Secure, Scalable Infra

Evlo AI • Minneapolis (MN)

On-site
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Evlo AI • San Francisco (CA)

On-site
USD 140,000 - 200,000
Staff Site Reliability Engineer - Scale Global AWS Infra
Staff Site Reliability Engineer - Scale Global AWS Infra

Pearl Street Technologies • Pittsburgh

On-site
USD 130,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Evlo AI • Minneapolis (MN)

On-site
USD 120,000 - 180,000
Lead Site Reliability Engineer: AWS Cloud & Automation
Lead Site Reliability Engineer: AWS Cloud & Automation

Selby Jennings • Wilmington (NC)

On-site
USD 140,000 - 200,000
Site Reliability Engineer — Build Ultra-Reliable Systems
Site Reliability Engineer — Build Ultra-Reliable Systems

Virtual Tech Gurus • Puerto Rico

On-site
USD 140,000 - 210,000
Remote Senior Site Reliability Engineer - Cloud & Automation
Remote Senior Site Reliability Engineer - Cloud & Automation

Multi Media LLC • United States

On-site
USD 169,000 - 215,000
Fully Remote
Health Insurance
Vision Insurance
+10
DevOps & SRE Lead — Multi-Cloud Reliability & Incidents
DevOps & SRE Lead — Multi-Cloud Reliability & Incidents

AgileEngine, LLC. • Austin (TX)

On-site
USD 120,000 - 160,000
Growth without limits
Competitive compensation
Flexibility: 100% remote
+3
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Axiom Pursuits • San Francisco (CA)

On-site
USD 150,000 - 180,000
Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

MeridianLink • United States

Remote
USD 140,000 - 190,000