Site-Reliability Engineer, Application Operations

Scorpion Therapeutics

Irving (TX)

On-site

USD 120,000 - 180,000

Full time

3 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Scorpion Therapeutics is seeking an experienced SRE/Production Operations engineer to manage on-call for production incidents in FDA-regulated clinical applications. You will implement runbooks, monitor SLOs, assist with releases, and contribute to automation and incident reviews.

The role requires 5+ years in SRE/production ops, on-call experience for Tier 1 systems, and familiarity with privileged-action controls. On-call work includes after-hours; travel may be required.

Qualifications

  • BS in CS/IS/SE or related field, or equivalent experience.
  • 5+ years in SRE/production ops/DevOps/platform engineering (production support).
  • 2+ years on-call primary responder for Tier 1/business-critical systems.
  • Experience executing production runbooks/maintenance/change procedures with privileged-action controls.
  • Experience with production monitoring/alerting dashboards in an observability platform.
  • Experience in post-incident review/blameless retrospectives.
  • Hands-on use of AI coding assistants for operational automation.

Responsibilities

  • Serve as primary on-call responder for production incidents; triage, elevate and remediate per runbooks.
  • Execute approved production runbooks and maintenance scripts; document privileged actions for audits.
  • Implement/maintain application instrumentation and monitor SLO budgets; escalate when budgets are at risk.
  • Support releases: verify deployment health, monitor post-deploy behavior, rollback if needed.
  • Participate in post-incident reviews; reconstruct timelines and drive remediation actions to closure.
  • Maintain audit-ready access logs and privileged-action records.

Skills

SRE/DevOps
On-call responder
Monitoring/observability
Automation scripting
Post-incident reviews
Privileged-action controls

Education

BS in CS/IS/SE
Equivalent experience

Tools

Observability platform
Runbooks/playbooks

Job description

Responsibilities:


  • Serve as primary responder in scheduled on-call for production incidents across SOX- and FDA-regulated clinical applications; triage, elevate and remediate per runbooks/incident playbooks.

  • Execute approved production runbooks and maintenance scripts; document privileged actions for SOX ITGCs and FDA audit-trail requirements.

  • Implement/maintain application-layer instrumentation (dashboards, alert thresholds, SLO monitors) and monitor SLO/error-budget consumption; **escalate** when budgets are at risk.

  • Support releases/deployments: verify deployment health, monitor post-deploy behavior, and perform rollback when required.

  • Participate in post-incident reviews: reconstruct timelines, identify contributing factors, and drive remediation action items to closure.

  • Maintain audit-ready access logs, privileged-action records, and role-change documentation.

  • Automate recurring operational work; track manual-intervention rate and reduce it by retiring runbook steps into automation.

  • Author/update runbooks and known-issue documentation; improve operate discipline.

  • Collaborate with application engineering to validate production fixes; contribute to on-call tooling and alert-quality improvements.

  • Use AI coding assistants/agentic workflows for monitoring, triage, runbooks, and automation scripting (review as quality gate).


Required Qualifications:


  • BS in CS/IS/SE or related, or equivalent experience.

  • 5+ years in SRE/production ops/DevOps/platform engineering (production support).

  • 2+ years on-call primary responder experience for Tier 1/business-critical systems.

  • Experience executing production runbooks/maintenance/change procedures with privileged-action controls.

  • Experience with production monitoring/alerting dashboards in an observability platform.

  • Experience in post-incident review/blameless retrospectives.

  • Hands-on use of AI coding assistants for operational automation.


Preferred Qualifications:


  • Familiarity with SLO/error budgets and alerting design.

  • Experience reducing toil via automation.

  • Experience in SOX-controlled IT or CLIA/CAP-regulated environments.

  • Cloud-native observability at the application instrumentation layer; telemetry/tracing/APM.

  • Domain experience in clinical diagnostics/lab information systems/digital health.

  • Familiarity with SAST/DAST and secure CI/CD; deployment pipelines/container orchestration/release automation.

  • Relevant cloud/security certifications.


Physical/Other:


  • Ability to sit/stand/work at a computer for extended periods.

  • On-call includes required after-hours response (evenings/weekends); periodic travel may be required.


Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Director - Application Site-Reliability Engineering
Director - Application Site-Reliability Engineering

Scorpion Therapeutics • Irving (TX)

On-site
USD 140,000 - 210,000
Software Engineer
Software Engineer

Scorpion Therapeutics • Irving (TX)

On-site
USD 90,000 - 120,000
Cloud Solutions Engineer
Cloud Solutions Engineer

Tyler Technologies • Lakewood (CO)

On-site
USD 120,000 - 150,000
Site Reliability Engineer
Site Reliability Engineer

System One • Pittsburgh

On-site
USD 140,000 - 190,000
On-Call Site Reliability Engineer & Automation Lead
On-Call Site Reliability Engineer & Automation Lead

Scorpion Therapeutics • Irving (TX)

On-site
USD 120,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

SCIGON • Naperville (IL)

Hybrid
USD 110,000 - 170,000
Site Reliability Engineer -- SINDC5717546
Site Reliability Engineer -- SINDC5717546

Compunnel Inc. • Denton (TX)

Hybrid
USD 120,000 - 150,000
Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

MeridianLink, Inc. • Northern (KY)

Hybrid
USD 140,000 - 210,000
Site Reliability Engineer Lead (SRE) - Internal Kubernetes Container Platform (IKCP)
Site Reliability Engineer Lead (SRE) - Internal Kubernetes Container Platform (IKCP)

Koitecc Solutions • Chandler (AZ), Northern (KY)

Hybrid
USD 140,000 - 200,000
IT CONSULTANT SR
IT CONSULTANT SR

First Horizon Corp. • Memphis (TN), Northern (KY)

Hybrid
USD 120,000 - 160,000