Senior Site Reliability Engineer: DR, Cloud & Automation Lead

Peraton

Herndon (VA)

On-site

USD 112,000 - 179,000

Full time

2 days ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Peraton in Herndon, VA seeks a Lead Site Reliability Engineer to ensure reliability and recoverability of mission-critical platforms. You will lead DR drills, validate platform rebuilds, and drive automation across IaC and CI/CD pipelines.

You will manage Kubernetes clusters, container workloads, and observability via CloudWatch and Datadog, while collaborating with cross-functional teams to improve resilience and on-call readiness.

Qualifications

  • 8–10 years of relevant SRE/DevOps/infrastructure experience; or 12+ years with a high school diploma.
  • Expert level hands-on knowledge of AWS services across compute, networking, storage, IAM, and serverless components.
  • Strong experience with Infrastructure as Code (Terraform, CloudFormation) and automation principles.
  • Experience building CI/CD pipelines and progressive delivery with GitHub Actions or similar tools.
  • Deep understanding of Kubernetes administration, container orchestration, and Docker deployments.
  • Proven experience validating DR processes, rebuilding systems, and data integrity checks.
  • Experience building monitoring tools using CloudWatch, Datadog, or similar observability tools.
  • Proficiency in Python, Java, C#, or Go for automation.
  • Experience debugging complex failure modes and cascading issues.
  • Strong analytical and documentation skills; able to communicate findings clearly.
  • Ability to work in a fast-paced environment on mission-critical systems; eligible for Public Trust clearance.
  • US Citizen or Green Card Holder.

Responsibilities

  • Lead lifecycle platform portability and DR drill execution, including validating rebuild procedures and DR playbooks.
  • Execute infrastructure-level drills to ensure recovery within the 48-hour target.
  • Verify data integrity during drills and document remediation recommendations.
  • Identify exit readiness gaps across infrastructure, automation, monitoring, and data recovery; drive corrective actions.
  • Design and implement automated IaC workflows with Terraform and CloudFormation; standardize CI/CD pipelines.
  • Manage and optimize Kubernetes clusters and container workloads (Docker) including provisioning and scaling.
  • Build and maintain observability solutions using CloudWatch, Datadog, and related tools.
  • Develop automation scripts in Python or Java to reduce manual work and improve repeatability.
  • Collaborate with platform engineering, security, applications, and data teams for compliant operations.
  • Participate in on-call rotations, root cause analyses, and incident response to improve resilience.

Skills

AWS
Terraform
CloudFormation
CI/CD
Kubernetes
Docker
Python
Java
Public Trust clearance
US Citizenship

Education

Bachelor's degree

Tools

GitHub Actions
Jenkins

Job description

Peraton in Herndon, VA seeks a Lead Site Reliability Engineer to ensure reliability and recoverability of mission-critical platforms. You will lead DR drills, validate platform rebuilds, and drive automation across IaC and CI/CD pipelines.

You will manage Kubernetes clusters, container workloads, and observability via CloudWatch and Datadog, while collaborating with cross-functional teams to improve resilience and on-call readiness.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer: DR, Cloud & Automation Leader
Site Reliability Engineer: DR, Cloud & Automation Leader

Peraton • Reston (VA)

On-site
USD 112,000 - 179,000
Lead Site Reliability Engineer - Cloud Reliability & DR
Lead Site Reliability Engineer - Cloud Reliability & DR

Peraton • Northern (KY)

Hybrid
USD 112,000 - 179,000
Senior Site Reliability Engineer — AWS, Kubernetes & DR
Senior Site Reliability Engineer — AWS, Kubernetes & DR

Peraton • United States

Remote
USD 130,000 - 180,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Peraton • United States

Remote
USD 130,000 - 180,000
Senior SRE: Automation & Cloud Reliability
Senior SRE: Automation & Cloud Reliability

Peraton • Washington

On-site
USD 112,000 - 179,000
Senior SRE with TS Clearance – Resilience & Automation
Senior SRE with TS Clearance – Resilience & Automation

Peerless Technologies Corporation • Dayton (OH)

On-site
USD 120,000 - 180,000
Senior Multi-Cloud SRE Lead — Automation & Reliability
Senior Multi-Cloud SRE Lead — Automation & Reliability

Leidos • San Antonio (TX)

On-site
USD 116,000 - 210,000
Senior SRE Architect | Cloud Reliability & Automation
Senior SRE Architect | Cloud Reliability & Automation

Ll Oefentherapie • Boise (ID)

On-site
USD 96,000 - 264,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Axiom Pursuits • San Francisco (CA)

On-site
USD 150,000 - 180,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Peraton • Herndon (VA)

On-site
USD 112,000 - 179,000