Remote Senior DevOps Engineer: Observability & SRE

United States Digital Space LLC

United States

Remote

USD 120,000 - 150,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Health insurance
Flexible PTO
401K with employer match
Paid parental leave
Employee Assistance Program

Job summary

The company LLC is a remote‑first technology partner delivering federal, commercial, and nonprofit digital services. This DevOps Engineer IV role focuses on operational resilience, observability, and site reliability engineering for mission‑critical cloud services.

You will set up monitoring with AWS CloudWatch, Prometheus, Grafana, and Loki; build golden signals dashboards; implement CI/CD pipelines; manage Tier 2/3 production support; and mentor engineers while supporting recruiting efforts.

Qualifications

  • Bachelor's degree and 8+ years of relevant experience or equivalent
  • 5+ years of hands-on experience with AWS, Terraform (or similar IaC), and Git/GitLab in production environments
  • Experience supporting multiple engineering teams from a shared DevOps/platform function
  • Designing and building CI/CD pipelines in GitLab/Jenkins with gates
  • Strong knowledge of Docker and orchestration with AWS ECS/EKS/Fargate
  • Familiarity with DevSecOps practices and vulnerability remediation
  • Excellent communication in a collaborative Agile/SAFe environment
  • Proven experience in SRE, production operations, or incident response
  • BCDR planning and disaster recovery exercises

Responsibilities

  • Set up and operate monitoring and observability tooling (AWS CloudWatch, Prometheus, Grafana, Loki) for real-time visibility into health, performance, and infrastructure
  • Build and maintain Golden Signals dashboards measuring latency, traffic, errors, and saturation
  • Implement the DORA metrics roadmap using Grafana and GitLab analytics to establish performance baselines
  • Manage Tier 2/3 production support within strict SLAs: 1-hour initial response, 4-hour critical resolution, 99.9% uptime
  • Write Root Cause Analyses within 3 business days of severity-1 outages; maintain on-call runbooks
  • Author and maintain the BCDR plan with cross-region replication, Route 53 routing, and Secrets Manager; coordinate biannual drills
  • Configure centralized alerting and incident tooling (Jira/ServiceNow, MS Teams, AWS Chatbot)
  • Implement AWS Auto Scaling and ELB; deliver sprint performance reports and cost-optimization recommendations
  • Support recruiting by evaluating homework and potentially assisting with interviews

Skills

Communication
Agile
Mentoring
SRE
Incident response
Cloud monitoring
Documentation
Team leadership
Cross-team collaboration
Public sector experience

Education

Bachelor's degree

Tools

AWS
Terraform
Git/GitLab
Docker
Kubernetes
Prometheus
Grafana
Loki
Jira Service Desk/ServiceNow

Job description

The company LLC is a remote‑first technology partner delivering federal, commercial, and nonprofit digital services. This DevOps Engineer IV role focuses on operational resilience, observability, and site reliability engineering for mission‑critical cloud services.

You will set up monitoring with AWS CloudWatch, Prometheus, Grafana, and Loki; build golden signals dashboards; implement CI/CD pipelines; manage Tier 2/3 production support; and mentor engineers while supporting recruiting efforts.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Remote Fullstack Engineer - Grafana & Cloud Observability
Remote Fullstack Engineer - Grafana & Cloud Observability

United States Digital Space LLC • United States

Remote
USD 120,000 - 180,000
Remote work options
Health/dental/vision insurance
Retirement plan
+1
Remote Senior SRE: GCP, Observability & Reliability Lead
Remote Senior SRE: GCP, Observability & Reliability Lead

United States Digital Space LLC • United States

Remote
USD 130,000 - 170,000
SRE/Observability Engineer
SRE/Observability Engineer

BlueSky Resource Solutions • United States

Remote
USD 100,000 - 130,000
Remote Site Reliability Engineer - Cloud & Observability
Remote Site Reliability Engineer - Cloud & Observability

Prove • United States

On-site
USD 120,000 - 150,000
Competitive salary
Equity Plan
401(k) match
+2
Remote Senior SRE — AWS, Kubernetes & CI/CD Expert
Remote Senior SRE — AWS, Kubernetes & CI/CD Expert

SitusAMC • Jackson (MS)

Remote
USD 95,000 - 135,000
PTO
Paid holidays
Medical, dental, vision insurance
+1
Senior SRE - Remote Observability & Reliability Leader
Senior SRE - Remote Observability & Reliability Leader

DOMA Technologies • Leesburg (VA)

Remote
USD 120,000 - 150,000
Remote Release Engineer — Observability & Reliability
Remote Release Engineer — Observability & Reliability

Cognitive Medical Systems • Northern (KY)

Hybrid
USD 90,000 - 115,000
Senior SRE — AWS Reliability & Observability (Remote)
Senior SRE — AWS Reliability & Observability (Remote)

Jobgether • United States

Hybrid
USD 120,000 - 160,000
Competitive compensation package
Flexible work arrangements
Professional development opportunities
+2
Senior SRE & Observability Architect (Remote/Hybrid)
Senior SRE & Observability Architect (Remote/Hybrid)

The Judge Group • Chicago (IL)

Hybrid
USD 140,000 - 210,000
Competitive Salary
Equity
Comprehensive Benefits
Senior SRE, Observability & Reliability Platform
Senior SRE, Observability & Reliability Platform

Chainlink Labs • United States

On-site
USD 120,000 - 160,000
Flexible working hours
Career growth opportunities
Global remote team
+1