Site Reliability Engineer - Reliability & Incident Response

Skybitra

New York (NY)

On-site

USD 125,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Skybitra is seeking a Senior Reliability Engineer to operate production systems and drive resilience across platforms. You will own SLOs, improve on‑call health, and design observable, failure‑tolerant architectures in collaboration with product teams.

Responsibilities include leading incident reviews, building dashboards, and automating runbooks. Strong Python/Go automation and Kubernetes familiarity are preferred, with a focus on scalable, secure operations.

Qualifications

  • Significant experience operating production systems and improving on‑call health.
  • Depth in observability tooling (metrics, logs, traces) and alert design.
  • Automation skills in Python, Go, or similar to codify runbooks and guardrails.
  • Proficiency with incident management practices and stakeholder communication.
  • Understanding of scalability basics: load patterns, capacity planning, and failure modes.

Responsibilities

  • Establish and evolve SLOs/error budgets, and align alerting to customer‑impacting signals
  • Build high‑signal dashboards, logging, and tracing for critical user journeys
  • Automate runbooks, chaos/failover drills, and toil reduction for on‑call teams
  • Lead post‑incident reviews, drive actions to completion, and track reliability trends
  • Partner on architecture and capacity plans that balance reliability, latency, and cost

Skills

Reliability engineering
On-call health
Stakeholder communication
Problem solving

Tools

Python
Go
Kubernetes
Service mesh

Job description

Skybitra is seeking a Senior Reliability Engineer to operate production systems and drive resilience across platforms. You will own SLOs, improve on‑call health, and design observable, failure‑tolerant architectures in collaboration with product teams.

Responsibilities include leading incident reviews, building dashboards, and automating runbooks. Strong Python/Go automation and Kubernetes familiarity are preferred, with a focus on scalable, secure operations.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

MeridianLink • United States

Remote
USD 140,000 - 190,000
Site Reliability Engineer
Site Reliability Engineer

JobCubby • Barrington (RI), Northern (KY)

Hybrid
USD 110,000 - 170,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Senior SRE: Cloud Reliability, Automation & Incidents
Senior SRE: Cloud Reliability, Automation & Incidents

Stelvio Inc. • Town of Texas (WI)

On-site
USD 125,000 - 145,000
Remote Senior SRE: Reliability & Automation
Remote Senior SRE: Reliability & Automation

Bright Vision Technologies • Framingham (MA)

On-site
USD 100,000 - 180,000
Remote Site Reliability Engineer: Cloud, Kubernetes & Incidents
Remote Site Reliability Engineer: Cloud, Kubernetes & Incidents

AssureSoft Corporation • United States

Remote
USD 120,000 - 180,000
Great Place To Work certification
English scholarships
English classes with company teachers
+3
Senior Site Reliability Engineer
Senior Site Reliability Engineer

O.C. Tanner • Salt Lake City (UT)

On-site
USD 130,000 - 180,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

myBridge Corporation • Austin (TX)

On-site
USD 120,000 - 160,000
Site Reliability Engineer - Build Resilient Cloud Infra
Site Reliability Engineer - Build Resilient Cloud Infra

ProdataKey • Draper (UT)

On-site
USD 75,000 - 125,000
Comprehensive medical coverage
Dental and vision coverage
401(k) with company match
+2
Senior Site Reliability Engineer: Build Resilient Systems
Senior Site Reliability Engineer: Build Resilient Systems

IRB USA Inspire Resources • Atlanta (GA)

On-site
USD 130,000 - 180,000