Site Reliability Engineer

Shrive Technologies

Schaumburg (IL)

On-site

USD 120,000 - 180,000

Full time

3 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Shrive Technologies seeks an experienced Site Reliability Engineer to ensure reliability and performance of production systems across cloud and on-prem workloads. You will design observability, automated remediation, and scalable architectures, while supporting CI/CD pipelines and incident response.

Responsibilities include capacity planning, disaster recovery, and collaboration with DevOps, infrastructure, and platform teams to improve resilience and reduce outages.

Qualifications

  • Strong Linux/Unix administration experience.
  • Scripting in Python, Shell or PowerShell.
  • Cloud platforms: AWS, Azure, or GCP.
  • Docker and Kubernetes proficiency.
  • Observability tools: Prometheus, Grafana, ELK, Splunk, Dynatrace, Datadog.
  • CI/CD tooling: Jenkins, GitHub Actions, GitLab CI, Azure DevOps.
  • Infrastructure as Code: Terraform, Ansible, CloudFormation.
  • Troubleshooting, debugging and problem solving.
  • Networking, security and distributed systems basics.

Responsibilities

  • Monitor, maintain, and improve reliability, availability, and performance of production systems.
  • Design and implement monitoring, alerting, logging, and observability solutions.
  • Establish and track SLIs, SLOs, and error budgets.
  • Automate operational tasks using scripting and IaC.
  • Lead incident response, RCA, and post-incident reviews.
  • Collaborate with development, infrastructure, and platform teams to enhance resilience.
  • Perform capacity planning, performance tuning, and scalability assessments.
  • Support CI/CD pipelines and deployment automation.
  • Implement high-availability, disaster recovery, and failover strategies.

Skills

Site Reliability Engineering
Production Support
DevOps
Cloud Operations
Python
Shell
PowerShell
Linux/Unix administration
SRE tooling

Tools

Docker
Kubernetes
Prometheus
Grafana
ELK
Splunk
Dynatrace
Datadog
Jenkins
GitHub Actions
GitLab CI
Azure DevOps
Terraform
Ansible
CloudFormation

Job description

Mandatory Skills

Python/R and ML libraries (scikit-learn, TensorFlow, PyTorch), Data analysis and visualization (Pandas, NumPy, Power BI/Tableau), SQL and database management

Key Responsibilities
  • Monitor, maintain, and improve the reliability, availability, and performance of production systems.
  • Design and implement monitoring, alerting, logging, and observability solutions.
  • Establish and track Service Level Indicators (SLIs), Service Level Objectives (SLOs), and Error Budgets.
  • Automate operational tasks and repetitive processes using scripting and Infrastructure as Code (IaC).
  • Lead incident response activities, troubleshooting, root cause analysis (RCA), and post-incident reviews.
  • Collaborate with development, infrastructure, and platform teams to improve system reliability and resilience.
  • Perform capacity planning, performance tuning, and scalability assessments.
  • Support CI/CD pipelines and deployment automation initiatives.
  • Implement high-availability, disaster recovery, and failover strategies.
Required Skills
  • Strong experience with Linux/Unix administration.
  • Proficiency in scripting languages such as Python, Shell, or PowerShell.
  • Hands-on experience with cloud platforms (AWS, Azure, or GCP).
  • Experience with containerization technologies such as Docker and Kubernetes.
  • Knowledge of monitoring and observability tools such as Prometheus, Grafana, ELK, Splunk, Dynatrace, or Datadog.
  • Understanding of CI/CD tools such as Jenkins, GitHub Actions, GitLab CI, or Azure DevOps.
  • Experience with Infrastructure as Code tools such as Terraform, Ansible, or CloudFormation.
  • Strong troubleshooting, debugging, and problem-solving skills.
  • Understanding of networking, security, and distributed systems concepts.
Experience
  • 5 10+ years of overall IT experience.
  • 5+ years of hands-on experience in Site Reliability Engineering, Production Support, DevOps, or Cloud Operations roles.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

TechDigital Group • Houston (TX), Juno Beach (FL)

On-site
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Inherent Technologies • Schaumburg (IL)

Hybrid
USD 120,000 - 150,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • California (MO)

Hybrid
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • New Hampshire

On-site
USD 110,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

TechDigital Group • Englewood Cliffs (NJ)

On-site
USD 110,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Veloc Inc • Coppell (TX)

On-site
USD 140,000 - 190,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Jobtailor • Arlington (VA)

On-site
USD 140,000 - 200,000
Site Reliability Engineer
Site Reliability Engineer

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000
Senior Site Reliability Automation Engineer
Senior Site Reliability Automation Engineer

Jobtailor • Colorado

On-site
USD 140,000 - 200,000