Lead Site Reliability Engineer

Peraton

United States

Remote

USD 130,000 - 180,000

Full time

29 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Peraton seeks a Lead Site Reliability Engineer to join our team of mission-focused professionals. You will drive reliability, resilience, and recoverability of critical platforms by leading disaster recovery drills, validating platform rebuilds, and automating deployment pipelines.

You will collaborate with platform engineering, security, applications, and data teams to modernize cloud environments, implement automation, and support high-visibility programs across federal initiatives.

Qualifications

  • Bachelor’s degree with 8–10 years relevant SRE/DevOps or 12 years with a high school diploma.
  • Expert level hands on knowledge of AWS services across compute, networking, storage, IAM, and serverless components.
  • Strong experience with Infrastructure as Code (Terraform, CloudFormation) and automation principles.
  • Experience building CI/CD deployment pipelines using GitHub Actions or similar tools.
  • Deep understanding of Kubernetes administration, container orchestration, and Docker based deployments.
  • Proven experience validating DR processes, performing system rebuilds, and data integrity checks.
  • Experience building monitoring tools using CloudWatch, Datadog, or similar observability tools.
  • Proficiency with programming/scripting languages such as Python, Java, or C# or Go.
  • Experience debugging complex failure modes and ensuring system resilience.
  • Strong analytical and documentation skills for cross-functional communication.
  • Ability to work in fast-paced, mission-critical environments.
  • Ability to obtain a Public Trust clearance.
  • US Citizen or Green Card Holder.

Responsibilities

  • Support full lifecycle platform portability and DR drill execution, including validation of DR playbooks.
  • Execute infrastructure-level drill activities to ensure rebuild within the 48-hour recovery target.
  • Verify end-to-end data completeness, integrity, and accuracy during drills and document results.
  • Identify exit readiness gaps and drive corrective actions with engineering teams.
  • Design, implement, and support automated IaaC workflows using Terraform and CloudFormation plus CI/CD pipelines.
  • Manage and optimize Kubernetes clusters and containerized workloads (Docker).
  • Build and maintain observability solutions using CloudWatch, Datadog, and other tools for reliability and incident response.
  • Develop automation and scripts using Python or Java to reduce manual processes.
  • Collaborate with platform engineering, security, applications, and data teams for secure, compliant operations.
  • Participate in on-call rotations, root-cause analyses, and incident response to improve resilience.

Skills

SRE experience
AWS expertise
Terraform
CloudFormation
CI/CD pipelines
Kubernetes
Docker
Observability
Python/Java/C# or Go
Disaster recovery
Documentation
Public Trust clearance
US citizenship or GC

Education

Bachelor's degree
High school diploma with 12 years experience

Tools

Terraform
CloudFormation
GitHub Actions
CI/CD platforms
Kubernetes
Docker
CloudWatch
Datadog
Python

Job description

Required Qualifications
  • Bachelor’s degree and 8-10 years of relevant SRE, DevOps, cloud engineering, or infrastructure engineering experience; or 12 years of experience with a high school diploma.
  • Expert level hands on knowledge of AWS services across compute, networking, storage, IAM, and serverless components.
  • Strong experience with Infrastructure as Code (Terraform, CloudFormation) and infrastructure automation principles.
  • Experience building CI/CD deployment pipelines and progressive delivery mechanisms using GitHub actions or similar tools
  • Deep understanding of Kubernetes administration, container orchestration, and Docker based deployments.
  • Proven experience validating DR processes, performing system rebuilds, and conducting data integrity checks.
  • Experience building monitoring tools like dashboards, metrics, logs, and alerting systems using CloudWatch, Datadog, or similar observability tools.
  • Proficiency with programming/scripting languages such as Python, Java, or C# or Go.
  • Experience debugging complex failure modes, including cascading failures, network partitions, backpressure, and eventual consistency issues.
  • Strong analytical and documentation skills with the ability to clearly communicate technical findings to cross functional teams.
  • Ability to work in a fast-paced environment supporting high visibility, mission critical systems.
  • Ability to obtain a Public Trust clearance.
  • US Citizen or Green Card Holder.
Preferred Qualifications
  • AWS DevSecOps Engineer certification (preferred).
  • Additional AWS certifications (Solutions Architect, SysOps, Developer) and/or Kubernetes certifications (CKA, CKAD).
  • Familiarity with Zero Trust security models and cloud security best practices.
  • Experience with GitLab, Jenkins, or similar CI/CD platforms.
  • Experience with highly regulated environments (healthcare, finance, DHS, DoD, CMS, etc.).
  • Experience supporting federal, defense, or largescale enterprise programs involving legacy-to-cloud modernization.
  • Prior involvement in large-scale DR drills, continuity of operations (COOP), or portability/executable readiness assessments.

Peraton is seeking a Lead Site Reliability Engineer to join our team of qualified, diverse individuals. The ideal candidate will play a critical role in ensuring the reliability, resilience, and recoverability of mission essential platforms by leading infrastructure level disaster recovery drills, platform rebuild validation, and automated deployment processes. This engineer will partner closely with cross functional teams to maintain and enhance complex cloud-based environments, integrate modern automation solutions, and support largescale modernization and continuity efforts across high visibility programs.

Responsibilities

The Lead Site Reliability Engineer’s responsibilities shall include, but are not limited to:

  • Supporting full lifecycle platform portability and disaster recovery (DR) drill execution, including validation of platform rebuild procedures and DR playbooks.
  • Executing infrastructure level drill activities to ensure the platform can be fully rebuilt within the 48hour recovery target.
  • Verifying end to end data completeness, integrity, and accuracy during drill exercises, documenting results and remediation recommendations.
  • Identifying exit readiness gaps across infrastructure, deployment automation, monitoring, and data recovery processes, and driving corrective actions with engineering teams.
  • Designing, implementing, and supporting automated IaaC workflows utilizing Terraform, AWS CloudFormation, and standardized CI/CD pipelines.
  • Managing and optimizing Kubernetes clusters and containerized workloads (Docker), including cluster provisioning, scaling, and workload reliability improvements.
  • Building and maintaining observability solutions using CloudWatch, Datadog, and other monitoring/alerting tools to ensure service reliability and proactive incident response.
  • Developing automation, tooling, and scripts using Python or Java to reduce manual processes and enhance operational repeatability.
  • Collaborating with platform engineering, security, applications, and data teams to ensure consistent, secure, and compliant platform operations.
  • Participating in on-call rotations, root cause analyses, and incident response activities to improve system resilience and operational excellence.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

External Job Posting Title Lead Site Reliability Engineer
External Job Posting Title Lead Site Reliability Engineer

Peraton • Northern (KY)

Hybrid
USD 112,000 - 179,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Peraton • Herndon (VA)

On-site
USD 112,000 - 179,000
Senior Site Reliability Engineer — AWS, Kubernetes & DR
Senior Site Reliability Engineer — AWS, Kubernetes & DR

Peraton • United States

Remote
USD 130,000 - 180,000
Lead Site Reliability Engineer
Lead Site Reliability Engineer

Peraton • Reston (VA)

On-site
USD 112,000 - 179,000
Site Reliability Engineer: DR, Cloud & Automation Leader
Site Reliability Engineer: DR, Cloud & Automation Leader

Peraton • Reston (VA)

On-site
USD 112,000 - 179,000
Lead Site Reliability Engineer - Cloud Reliability & DR
Lead Site Reliability Engineer - Cloud Reliability & DR

Peraton • Northern (KY)

Hybrid
USD 112,000 - 179,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Gen Digital Inc. • United States

Remote
USD 180,000 - 240,000
Senior Lead Site Reliability Engineer
Senior Lead Site Reliability Engineer

JPMorgan Chase & Co. • Jersey City (NJ)

On-site
USD 150,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Kontakt.io • United States

On-site
USD 150,000 - 190,000