Site Reliability Engineer (SRE)

Veriipro

Atlanta (GA)

On-site

USD 110,000 - 160,000

Full time

4 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Veriipro is seeking an experienced Site Reliability Engineer (SRE) to support and maintain production systems hosted on AWS. The role emphasizes production support, incident management, monitoring, observability, troubleshooting, and improving system reliability and availability.

You will triage incidents, participate in 24/7 on-call rotations, and work on health checks, performance issues, and uptime improvements across AWS services and Linux/Unix environments.

Qualifications

  • Experience supporting AWS production environments.
  • Experience in incident management and on-call rotations.
  • Strong knowledge of monitoring, observability tools and reliability patterns.
  • Proficient in troubleshooting and root-cause analysis.
  • Experience with CI/CD pipelines and Linux/Unix environments.

Responsibilities

  • Provide L1/L2 production support for AWS-hosted applications and infrastructure.
  • Monitor and troubleshoot AWS services including EC2, VPC, ALB/NLB, RDS, Lambda, and EKS.
  • Triage production incidents, identify root causes, restore services within defined SLAs, and upscale defects when required.
  • Participate in 24/7 on-call rotations, major incident management, and post-incident reviews.
  • Perform health checks and address performance, latency, and availability issues.
  • Build and maintain monitoring dashboards using CloudWatch, Dynatrace, and other observability tools.
  • Troubleshoot issues across infrastructure, networking, application, database, and Linux/Unix environments.
  • Support CI/CD pipelines and AWS deployment processes.

Skills

AWS production support
Incident management
Troubleshooting
Root cause analysis
CI/CD
Linux/Unix
Communication skills

Tools

CloudWatch
Dynatrace
Git
Observability dashboards
ThousandEyes
Quantum Metric

Job description

We are seeking an experienced Site Reliability Engineer (SRE) to support and maintain production systems hosted on AWS. The role focuses on production support, incident management, monitoring, observability, troubleshooting, and improving system reliability and availability.

Core Responsibilities
  • Provide L1/L2 production support for AWS-hosted applications and infrastructure.
  • Monitor and troubleshoot AWS services including EC2, VPC, ALB/NLB, RDS, Lambda, and EKS.
  • Triage production incidents, identify root causes, restore services within defined SLAs, and upscale application defects when required.
  • Participate in 24/7 on-call rotations, major incident management, and post-incident reviews.
  • Perform application and infrastructure health checks and proactively address performance, latency, resource utilization, and availability issues.
  • Build and maintain monitoring and observability dashboards using CloudWatch, Dynatrace, Quantum Metric, and ThousandEyes.
  • Troubleshoot issues across infrastructure, networking, application, database, and Linux/Unix environments.
  • Support CI/CD pipelines and AWS deployment processes.
  • Apply reliability patterns and continuously improve system stability and operational efficiency.
Required Skills
  • Strong experience supporting AWS production environments.
  • Hands-on experience with incident management and production support.
  • Strong knowledge of CloudWatch, Dynatrace, Git, observability, and reliability patterns.
  • Experience with monitoring dashboards and operational health checks.
  • Strong troubleshooting and root-cause analysis skills.
  • Working knowledge of CI/CD, databases, and Unix/Linux.
  • Excellent communication and incident coordination skills.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

myBridge Corporation • Austin (TX)

On-site
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

JobCubby • Barrington (RI), Northern (KY)

On-site
USD 110,000 - 170,000
AWS Site Reliability Engineer – Incident & Reliability
AWS Site Reliability Engineer – Incident & Reliability

Veriipro • Atlanta (GA)

On-site
USD 110,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

Brooksource • Hapeville (GA)

On-site
USD 110,000 - 170,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

Resolve Tech Solutions • Irving (TX)

On-site
USD 120,000 - 160,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Virtual Tech Gurus • Puerto Rico

On-site
USD 140,000 - 210,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Knack Solutions • Reston (VA)

On-site
USD 120,000 - 160,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

JPS Tech Solutions • Colorado

On-site
USD 160,000 - 230,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Methodic • San Francisco (CA)

On-site
USD 140,000 - 210,000