Site Reliability Engineer

SRE

Puerto Rico

Hybrid

USD 120,000 - 180,000

Full time

6 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

SRE is seeking a Site Reliability Engineer to ensure reliability, scalability, and performance across hybrid cloud and on-prem environments. You will design and operate large-scale systems, automate deployments, and lead incident response with a focus on reducing toil.

The role emphasizes observability, capacity planning, and continuous improvement, collaborating with Platform Engineering, DevOps, and Security teams to deliver secure, highly available services.

Qualifications

  • Experience designing and operating large-scale distributed systems.
  • Strong incident response and RCA skills.
  • Familiarity with SLA/SLO/SLI definitions and error budgets.
  • Proven ability to automate operations and reduce toil.
  • Hands-on experience with observability platforms and dashboards.

Responsibilities

  • Ensure high availability, scalability, and performance of production environments.
  • Define, implement, and monitor SLIs, SLOs, and error budgets.
  • Perform capacity planning, tuning, and optimization of systems.
  • Lead RCA for incidents and implement preventive measures.
  • Design and develop IaC for automated deployments.
  • Build and improve CI/CD pipelines and release strategies (Blue/Green, Canary).
  • Design enterprise-grade monitoring and alerting (Grafana, ELK, CloudWatch).
  • Participate in 24x7 on-call rotations and drive post-incident reviews.

Skills

Distributed systems design
Incident response
DevOps collaboration
SRE best practices
Observability tooling

Education

Bachelor's degree in CS or related field

Tools

Terraform
Ansible
Pulumi
Kubernetes
AWS
VMware
Nutanix
Grafana
ELK Stack
CloudWatch
Splunk

Job description

Job Title: Site Reliability Engineer (SRE)

Position Overview

We are seeking a highly skilled Site Reliability Engineer (SRE) to ensure the reliability, scalability, performance, and operational excellence of mission-critical production environments. The ideal candidate will combine strong software engineering principles with infrastructure expertise to build resilient platforms, automate operations, enhance observability, and minimize operational toil.

As an SRE, you will collaborate closely with Platform Engineering, DevOps, Infrastructure, Security, and Development teams to deliver highly available, secure, and scalable services across hybrid cloud and on-premises environments.

Key Responsibilities
Reliability & System Performance
  • Ensure high availability, scalability, and performance of production environments.
  • Define, implement, and monitor Service Level Indicators (SLIs), Service Level Objectives (SLOs), and Error Budgets.
  • Perform proactive capacity planning, performance tuning, and system optimization.
  • Lead Root Cause Analysis (RCA) for production incidents and implement preventive solutions.
  • Design and develop automation to eliminate manual operational tasks.
  • Build reusable Infrastructure as Code (IaC) using Terraform, Ansible, Pulumi, or similar tools.
  • Automate deployments, provisioning, patching, configuration management, and operational workflows.
  • Improve developer productivity through self-service platform capabilities.
CI/CD & Release Engineering
  • Design, build, and optimize CI/CD pipelines.
  • Support automated deployments using:
  • GitHub Actions
  • Jenkins
  • Ensure safe, repeatable, and low-risk software releases.
  • Implement deployment strategies such as Blue/Green and Canary deployments.
Monitoring & Observability
  • Design enterprise-grade monitoring and alerting solutions.
  • Build dashboards and telemetry using:
  • Grafana
  • ELK Stack
  • CloudWatch
  • Splunk (preferred)
  • Improve application and infrastructure observability using logs, metrics, and distributed tracing.
Incident Response & Reliability Engineering
  • Participate in 24x7 on-call rotations.
  • Lead production incident response and service restoration.
  • Drive post-incident reviews and continuous improvement initiatives.
  • Reduce Mean Time to Detect (MTTD) and Mean Time to Recover (MTTR).
  • Manage cloud infrastructure across:
  • AWS
  • Support hybrid environments including:
  • VMware
  • Nutanix
  • Deploy and manage highly available infrastructure services.
  • Deploy and manage Kubernetes clusters.
  • Support:
  • Amazon EKS
  • Amazon ECS
  • Troubleshoot containerized workloads and optimize cluster performance.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Virtual Tech Gurus • Puerto Rico

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

myBridge Corporation • Austin (TX)

On-site
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

Knack Solutions • Richmond (VA)

On-site
USD 100,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

Jobtailor • New Hampshire

On-site
USD 110,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

Triwill Group • United States

Remote
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

TalentoHC • Miami (FL)

On-site
USD 100,000 - 130,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Veriipro • Washington

On-site
USD 120,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Mission Staffing • New York (NY)

Hybrid