Site Reliability Engineer

Brooksource

Hapeville (GA)

On-site

USD 110,000 - 170,000

Full time

10 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Brooksource is seeking an experienced Site Reliability Engineering (SRE) Subject Matter Expert to establish and mature reliability practices within an AWS environment. The role focuses on scalable SRE frameworks, SLOs, and consistent standards for availability, performance, monitoring, and incident response across engineering teams.

The 12-month engagement emphasizes hands-on AWS, strategy, and process development to enable long-term reliability maturity across multiple teams.

Qualifications

  • Extensive experience in Site Reliability Engineering, DevOps, cloud infrastructure, or related field.

Responsibilities

  • Assess current reliability practices and identify improvement areas.
  • Develop reusable SRE frameworks and operating models.
  • Define SLIs, SLOs, and error budgets with stakeholders.
  • Establish monitoring, observability, alerting, and incident-management practices.
  • Improve availability, performance, scalability, and resilience across services.
  • Create dashboards and reporting for service health visibility.
  • Automate to reduce manual operational work.
  • Lead root-cause analysis and drive long-term improvements.
  • Develop governance docs, playbooks, and standards for adoption.
  • Coach teams on SRE principles and build internal capabilities.

Skills

SRE
DevOps
AWS
Reliability
Communication

Tools

CloudWatch
Datadog
Grafana
Dynatrace
Terraform
CloudFormation

Job description

We are seeking an experienced Site Reliability Engineering (SRE) Subject Matter Expert to help establish and mature reliability practices within an AWS environment. This individual will create scalable SRE frameworks, define service-level objectives (SLOs), and help engineering teams adopt consistent standards for system availability, performance, monitoring, and incident response.

This is a long-term, 12-month engagement with a high probability of extension. The ideal candidate will combine hands‑on AWS experience with the ability to establish strategy, frameworks, and processes across multiple technical teams.

Key Responsibilities
  • Assess the organization’s current reliability practices and identify areas for improvement.
  • Develop reusable SRE frameworks, standards, and operating models.
  • Partner with application and infrastructure teams to define service-level indicators (SLIs), SLOs, and error budgets.
  • Establish consistent monitoring, observability, alerting, and incident-management practices.
  • Improve system availability, performance, scalability, and operational resilience.
  • Create dashboards and reporting that provide visibility into service health and reliability.
  • Help teams reduce manual operational work through automation.
  • Facilitate root-cause analysis and translate findings into long-term improvements.
  • Develop documentation, playbooks, and governance standards that can be adopted across teams.
  • Coach engineering teams on SRE principles and help build sustainable internal capabilities.
Required Qualifications
  • Extensive experience in Site Reliability Engineering, DevOps, cloud infrastructure, or a related discipline.
  • Demonstrated experience building or maturing an SRE practice.
  • Strong understanding of SLIs, SLOs, SLAs, error budgets, and reliability measurement.
  • Hands‑on experience supporting applications and infrastructure in AWS.
  • Experience with observability, monitoring, alerting, and incident-management tools.
  • Strong understanding of infrastructure automation, CI/CD, and cloud operational practices.
  • Experience creating technical frameworks and driving adoption across multiple teams.
  • Ability to communicate effectively with engineering teams, technical leaders, and business stakeholders.
  • Strong documentation, facilitation, and technical leadership skills.
Preferred Qualifications
  • Experience working in a large, complex enterprise environment.
  • Familiarity with AWS services such as CloudWatch, EC2, ECS/EKS, Lambda, and related cloud-native tooling.
  • Experience with infrastructure-as-code tools such as Terraform or CloudFormation.
  • Experience with observability platforms such as Datadog, Dynatrace, Splunk, Grafana, or New Relic.
  • Previous experience serving as an SRE lead, architect, or enterprise-level subject matter expert.
  • Extension potential: High
  • Primary focus: SRE framework development, SLO implementation, reliability maturity, and long-term organizational adoption
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
SRE Lead engineer
SRE Lead engineer

TechDigital Group • Bellevue (WA)

On-site
USD 100,000 - 130,000
Site Reliability Engineer – Lead
Site Reliability Engineer – Lead

Jobtailor • Arizona

On-site
USD 140,000 - 230,000
Sr Software Engineer - Reliability Engineering
Sr Software Engineer - Reliability Engineering

Cox Enterprises • Village of North Hills (NY)

On-site
USD 150,000 - 185,000
Site Reliability Engineer
Site Reliability Engineer

Encora Digital Inc. • United States

On-site
USD 120,000 - 180,000
Senior SRE Architect: AWS Reliability & Frameworks
Senior SRE Architect: AWS Reliability & Frameworks

Brooksource • Hapeville (GA)

On-site
USD 110,000 - 170,000
SRE (Site Realiability Engineer)
SRE (Site Realiability Engineer)

STRATIS Cloud Tech Solutions INC • Arkansas

On-site
USD 100,000 - 130,000
Competitive salary and benefits
Growth and learning opportunities
Friendly and collaborative team environment
Senior Site Reliability Engineer
Senior Site Reliability Engineer

The ReWork Group • New York (NY)

On-site
USD 120,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Veriipro • Washington

On-site
USD 120,000 - 180,000