Senior Cloud Reliability Engineer

Alvaria

Town of Texas, Northern (WI, KY)

Hybrid

USD 120,000 - 180,000

Full time

14 hours ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Aspect Software is seeking a Site Reliability Engineer to help build and operate reliable, secure, and efficient cloud services. You will combine software engineering and systems expertise to improve availability, performance, scalability, observability, and operational readiness across our SaaS platforms.

This role partners with application engineering, platform, security, and product teams to define service-level objectives, automate repetitive work, strengthen incident response, and design

Qualifications

  • Bachelor’s degree in Computer Science, Engineering, or related field.
  • 4–5+ years of experience in site reliability engineering, DevOps, platform engineering, cloud operations, or production software engineering.
  • Hands-on experience operating production workloads in AWS; comparable experience with Azure or GCP is also valuable.
  • Experience with infrastructure as code and configuration automation, such as AWS CDK, CloudFormation, Terraform, or similar tools.
  • Experience building or supporting CI/CD pipelines and source-control workflows, preferably with GitHub and GitHub Actions.
  • Working knowledge of Linux, networking, DNS, load balancing, firewalls, certificates, and common distributed-systems failure modes.
  • Experience with observability and monitoring tools such as Datadog, Grafana, CloudWatch or equivalent platforms.
  • Understanding of incident management, root-cause analysis, and blameless post-incident practices.
  • Strong troubleshooting, documentation, collaboration, and communication skills

Responsibilities

  • Design, build, and operate highly available, scalable, and secure production services and cloud infrastructure
  • Partner with engineering teams to define and maintain service-level indicators (SLIs), service-level objectives (SLOs), error budgets, and actionable alerts
  • Build automation and self-service tooling that reduces toil, accelerates safe delivery, and improves operational consistency
  • Improve observability through meaningful metrics, logs, distributed tracing, dashboards, synthetic checks, and health monitoring
  • Participate in an on-call rotation and lead or support incident response, communication, mitigation, and recovery
  • Facilitate blameless post-incident reviews and ensure corrective actions address systemic causes
  • Improve CI/CD pipelines using automated validation, deployment health gates, progressive delivery, canary releases, and reliable rollback strategies
  • Review system designs for reliability, performance, capacity, security, recoverability, and cost efficiency
  • Strengthen resilience through redundancy, autoscaling, fault-tolerant patterns, disaster recovery planning, and appropriate load or chaos testing
  • Troubleshoot complex issues across applications, infrastructure, networking, databases, and third-party dependencies
  • Develop and maintain runbooks, operational standards, architectural documentation, and support procedures
  • Collaborate across teams and time zones while clearly communicating risk, trade-offs, incident status, and reliability priorities

Skills

Cloud basics
Observability
CI/CD
Incident response
Linux
Networking

Education

Bachelor’s degree in Computer Science or related field

Tools

Terraform
CloudFormation
GitHub Actions
Datadog
Grafana
CloudWatch
Kubernetes

Job description

Aspect Software is seeking a Site Reliability Engineer to help build and operate reliable, secure, and efficient cloud services. You will combine software engineering and systems expertise to improve availability, performance, scalability, observability, and operational readiness across our SaaS platforms.

This role partners with application engineering, platform, security, and product teams to define service-level objectives, automate repetitive work, strengthen incident response, and design

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Cloud Site Reliability Engineer: Build Resilient SaaS
Cloud Site Reliability Engineer: Build Resilient SaaS

ADP • Town of Texas (WI)

On-site
USD 120,000 - 150,000
Site Reliability Engineer
Site Reliability Engineer

Alvaria • Town of Texas (WI), Northern (KY)

Hybrid
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

ADP • Town of Texas (WI)

On-site
USD 120,000 - 150,000
Senior Site Reliability Engineer - Edge & Cloud Resilience
Senior Site Reliability Engineer - Edge & Cloud Resilience

Saasventurecapital • El Segundo (CA)

On-site
USD 170,000 - 190,000
Comprehensive health coverage
401(k) with 4% company match
Flexible paid time off
+2
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Ll Oefentherapie • Nashville (TN)

On-site
USD 140,000 - 180,000
AWS Cloud DevOps Engineer – SaaS Platform & CI/CD
AWS Cloud DevOps Engineer – SaaS Platform & CI/CD

ADP • Town of Texas (WI)

On-site
USD 90,000 - 140,000
Senior Cloud Reliability Engineer & Security Architect
Senior Cloud Reliability Engineer & Security Architect

SAP Belgium NV/SA • Reston (VA)

Hybrid
USD 176,000 - 374,000
Site Reliability Engineer – Cloud & On-Prem Reliability
Site Reliability Engineer – Cloud & On-Prem Reliability

Charles River Associates International • Boston (MA)

Hybrid
USD 130,000 - 150,000
Healthcare benefits
Paid time off
401(k) matching
Senior Site Reliability Engineer — Cloud, Resilience & Automation
Senior Site Reliability Engineer — Cloud, Resilience & Automation

Compunnel Inc. • Denton (TX)

Hybrid
USD 120,000 - 150,000
Senior Incident Command & Reliability Engineer
Senior Incident Command & Reliability Engineer

IBM • Boston (MA)

On-site
USD 140,000 - 190,000