Site Reliability Engineer II

Jobtailor

Arlington (VA)

On-site

USD 120,000 - 180,000

Full time

4 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Jobtailor is seeking an experienced SRE/DevOps professional to manage real-time monitoring, incident response, and root-cause analysis within AWS and EKS environments. The role emphasizes security compliance in a FedRAMP-authorised platform and requires on-site presence in the Arlington, VA area.

You will triage incidents across GovCloud and Commercial AWS, remediate CVEs, and drive deployments using GitLab CI/CD, ArgoCD, and Argo Workflows.

Qualifications

  • 3+ years in SRE, DevOps, systems administration, or cloud support.
  • Experience with Linux administration (RHEL, Amazon Linux, Ubuntu).
  • Bash/Python scripting proficiency.
  • Working knowledge of Kubernetes/EKS and AWS core services.
  • Familiarity with L4/L7 load balancing.
  • Experience with Prometheus and Grafana.
  • Slack-based ChatOps experience.
  • US citizenship and residence on US soil.
  • Willingness for overnight/weekend rotational shifts.
  • FedRAMP suitability in a FedRAMP Moderate environment.

Responsibilities

  • Perform real-time monitoring and first-response triage across AWS Commercial/GovCloud and EKS infrastructure.
  • Investigate root causes at the log level using Kibana and Elasticsearch.
  • Remediate CVEs and perform STIG hardening within FedRAMP SLA windows.
  • Execute deployments and troubleshoot through GitLab CI/CD, ArgoCD, and Argo Workflows.
  • Distinguish operational blips from breaches and act on incidents in a high-availability FedRAMP-authorised cloud platform.

Skills

SRE/DevOps mindset
Incident response
Problem solving
On-call readiness

Tools

Kubernetes
AWS Core Services
Prometheus
Grafana
GitLab CI/CD
ArgoCD
Argo Workflows
Kibana
Elasticsearch
Slack

Job description

  • Perform real-time monitoring and first-response triage across AWS Commercial/GovCloud and EKS infrastructure
  • Investigate root causes at the log level using Kibana and Elasticsearch
  • Remediate CVEs and perform STIG hardening within FedRAMP SLA windows
  • Execute deployments and troubleshoot through GitLab CI/CD, ArgoCD, and Argo Workflows
  • Distinguish operational blips from breaches and act on incidents in a high-availability FedRAMP-authorised cloud platform
Requirements
  • 3+ years in SRE, DevOps, systems administration, or cloud support
  • Solid Linux administration (RHEL, Amazon Linux, Ubuntu)
  • Bash/Python scripting
  • Working knowledge of Kubernetes/EKS and AWS core services
  • L4/L7 load balancing troubleshooting
  • Experience with Prometheus and Grafana
  • ChatOps-via-Slack experience
  • US citizenship and residence on US soil
  • Availability for overnight/weekend rotational shifts
  • FedRAMP suitability in a FedRAMP Moderate-authorised environment
Core Competencies

Demonstrates expertise in real-time monitoring, incident response, and root cause analysis within AWS and EKS environments, with a strong focus on security compliance and operational excellence in FedRAMP-authorized platforms.

Highest-signal resume keywords
  • AWS Infrastructure Management
  • Kubernetes/EKS Administration
  • Linux Administration
  • CI/CD Pipeline Execution
  • Root Cause Analysis
Hard Skills
  • Linux Administration
  • Bash Scripting
  • Python Scripting
  • Kubernetes
  • AWS Core Services
  • Prometheus
  • Grafana
  • GitLab CI/CD
  • ArgoCD
  • Argo Workflows
Soft Skills
  • Incident Response
  • Collaboration
  • Problem Solving
Certifications & Qualifications
  • FedRAMP Suitability
Industry Keywords
  • SRE
  • DevOps
  • Cloud Support
  • STIG Hardening
  • L4/L7 Load Balancing
Tools & Technologies
  • Kibana
  • Elasticsearch
  • Slack
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer II
Site Reliability Engineer II

Jobtailor • San Francisco (CA)

On-site
USD 120,000 - 180,000
#II Site Reliability Engineer II
#II Site Reliability Engineer II

C-Serv • Reston (VA)

Hybrid
USD 96,000 - 124,000
Senior Site Reliability Engineer – AWS/Datacenter
Senior Site Reliability Engineer – AWS/Datacenter

Jobtailor • Bellevue (WA)

On-site
USD 160,000 - 220,000
#1 Site Reliability Engineer II
#1 Site Reliability Engineer II

C-Serv • San Jose (CA)

Hybrid
USD 96,000 - 124,000
#1 Site Reliability Engineer II
#1 Site Reliability Engineer II

C-Serv • San Francisco (CA)

Hybrid
USD 96,000 - 124,000
Site Reliability Engineer II
Site Reliability Engineer II

C-Serv • Reston (VA)

On-site
USD 96,000 - 110,000
DevOps Engineer
DevOps Engineer

Jobtailor • San Antonio (TX)

On-site
USD 140,000 - 190,000
DevOps Engineer
DevOps Engineer

Jobtailor • Fort Meade (MD)

On-site
USD 120,000 - 180,000
Senior Forward Deployed Engineer
Senior Forward Deployed Engineer

Jobtailor • Washington

On-site
USD 140,000 - 185,000
Site Reliability Engineering Manager
Site Reliability Engineering Manager

Calance • United States

Hybrid
USD 150,000 - 200,000