Observability & SRE Engineer — Cloud, Kubernetes, & Automation

Ontrac Solutions

Arizona

Hybrid

USD 140,000 - 190,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Verification cost reimbursement

Job summary

Ontrac Solutions is seeking an experienced Observability / Site Reliability Engineer (SRE) to design, scale, and maintain enterprise monitoring and alerting ecosystems across multi-cloud and native systems.

You will bridge development and operations, ensuring high availability, performance tuning, and deep visibility while driving automation and robust observability pipelines using cloud-native tools. The role emphasizes SRE best practices and measurable reliability targets.

Qualifications

  • Experience designing and operating cloud-based observability platforms.
  • Strong Linux/Unix administration and scripting skills.
  • Proficiency in Terraform and Ansible for IaC.
  • Hands-on with Kubernetes, GKE or OpenShift.
  • Proficiency with Prometheus and Grafana, plus Google Cloud Observability suites.
  • Programming in Python/Go/Java.

Responsibilities

  • Architect and maintain observability stacks across hybrid/multi-cloud environments.
  • Define SLIs, SLOs, and error budgets to ensure reliability.
  • Automate deployments and scaling with Terraform and Ansible.
  • Integrate CI/CD pipelines in Kubernetes/GKE/OpenShift.
  • Analyze and optimize system performance and resource utilization.
  • Collaborate with development and operations to improve reliability.

Skills

Linux/Unix mastery
Shell scripting
Programming (Python/Go/Java)
SRE practices
CI/CD concepts

Education

Bachelor's degree in CS/Engineering

Tools

Prometheus
Grafana
Google Cloud Monitoring
Cloud Logging
Cloud Tracing
Cloud Profiler
Kubernetes
GKE/OpenShift
Terraform
Ansible

Job description

Ontrac Solutions is seeking an experienced Observability / Site Reliability Engineer (SRE) to design, scale, and maintain enterprise monitoring and alerting ecosystems across multi-cloud and native systems.

You will bridge development and operations, ensuring high availability, performance tuning, and deep visibility while driving automation and robust observability pipelines using cloud-native tools. The role emphasizes SRE best practices and measurable reliability targets.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Cloud Observability & SRE Engineer
Senior Cloud Observability & SRE Engineer

Ontrac Solutions • Chicago (IL)

On-site
USD 120,000 - 180,000
Senior Observability & SRE Engineer — GCP/Kubernetes
Senior Observability & SRE Engineer — GCP/Kubernetes

Ontrac Solutions • United States

On-site
USD 120,000 - 180,000
Observability Engineer / Site Reliability Engineer
Observability Engineer / Site Reliability Engineer

Ontrac Solutions • Chicago (IL)

On-site
USD 120,000 - 180,000
Observability Engineer Site Reliability Engineer
Observability Engineer Site Reliability Engineer

Ontrac Solutions • United States

On-site
USD 120,000 - 180,000
Observability Engineer Site Reliability Engineer
Observability Engineer Site Reliability Engineer

Ontrac Solutions • Arizona

Hybrid
USD 140,000 - 190,000
Verification cost reimbursement
SRE/Observability Engineer
SRE/Observability Engineer

BlueSky Resource Solutions • United States

Remote
USD 100,000 - 130,000
SRE Architect: Cloud, Kubernetes & Observability
SRE Architect: Cloud, Kubernetes & Observability

Symphony Communication Services • New York (NY)

On-site
USD 140,000 - 170,000
Regional benefits
BYOB perks
Local events and team building
Senior SRE & Platform Engineer — Observability & Automation
Senior SRE & Platform Engineer — Observability & Automation

Techunting • United States

On-site
USD 120,000 - 150,000
Hybrid SRE – Observability & AI-Driven Ops
Hybrid SRE – Observability & AI-Driven Ops

United States Digital Space LLC • United States

Hybrid
USD 120,000 - 180,000
Hybrid work model
Site Reliability Engineer: Build Resilient, Automated Cloud
Site Reliability Engineer: Build Resilient, Automated Cloud

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000