SRE & DBA: Scale Reliability for High-Volume DBs

Backblaze

United States

Remote

ARS 3,000,000 - 5,000,000

Full time

5 days ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Backblaze, a leading cloud storage company, seeks a Site Reliability Engineer (DBA-focused) to ensure stability and scalability of production databases, primarily Vitess and Cassandra, while building automation and observability. You will collaborate with engineering, product, and operations teams to embed reliability practices in daily work and drive improvements.

The role involves on-call rotations, incident response, and contributing to runbooks, automation, and capacity planning to maintain

Qualifications

  • Bachelor’s degree in Computer Science, Engineering, or related field (or equivalent experience).
  • 2-4 years of experience in site reliability, systems engineering, or operations centered around database systems.
  • Exposure to large-scale, production-grade systems. This is a Level 2 role executing established database operations procedures - architecture and design ownership sits with our Level 3 DBA SREs.

Responsibilities

  • Operating and maintaining high-availability database systems - primarily Vitess (distributed MySQL) and Cassandra - against established architecture and runbooks.
  • Optimizing database performance through query tuning, indexing strategies, and schema design.
  • Executing documented backup, recovery, and replication procedures to ensure data durability; escalating architecture-level changes to senior DBA SREs.
  • Ensuring database security compliance and access control.
  • Support the availability and durability of critical services across production environments.
  • Monitor service health using SLIs, SLOs, and error budgets, and upscale issues when thresholds are at risk.
  • Participate in on-call rotations, incident response, and post-incident reviews to drive service improvements.
  • Follow established ITIL/OSS processes (incident, change, problem, and capacity management).
  • Develop automation for common operational tasks, reducing manual intervention and toil.
  • Contribute to monitoring, logging, and alerting frameworks (Prometheus, Grafana, Catchpoint, ELK), and help integrate runbooks with FireHydrant.
  • Work with CI/CD pipelines, configuration management, and infrastructure as code tools (Terraform, Ansible, Jenkins).
  • Write scripts (Bash, Python, Go) to improve system reliability and efficiency.
  • Partner with engineering, product, and operations teams to support resilient system design and operations.
  • Assist in capacity planning and disaster recovery exercises.
  • Work with vendors and service providers to troubleshoot service issues and track SLA performance.
  • Document systems, share learnings, and help grow a reliability-minded engineering culture.
  • Contribute to playbooks, runbooks, and operational documentation.
  • Identify recurring issues and propose long-term improvements.
  • Promote reliability-focused practices within development and operations teams.

Skills

Linux admin
Reliability concepts
Scripting (Python/Bash/Go)
Kubernetes & Docker
Incident response
MySQL performance tuning
Vitess / distributed MySQL
SQL & NoSQL

Education

Bachelor's degree in CS/Engineering
Equivalent experience considered

Tools

Vitess
MySQL
Terraform
Ansible
Jenkins
Prometheus
Grafana
Catchpoint
ELK

Job description

Backblaze, a leading cloud storage company, seeks a Site Reliability Engineer (DBA-focused) to ensure stability and scalability of production databases, primarily Vitess and Cassandra, while building automation and observability. You will collaborate with engineering, product, and operations teams to embed reliability practices in daily work and drive improvements.

The role involves on-call rotations, incident response, and contributing to runbooks, automation, and capacity planning to maintain

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Remote SRE DBA – Vitess & Cassandra
Remote SRE DBA – Vitess & Cassandra

WebHosting • Northern (KY)

Hybrid
USD 125,000 - 150,000
ESPP program
Senior SRE: Database Reliability (Vitess & Cassandra)
Senior SRE: Database Reliability (Vitess & Cassandra)

Backblaze External Website • United States

Remote
USD 125,000 - 150,000
MacBook Pro for work
Stipend for workstation setup
Flexible vacation policy
+6
Site Reliability Engineer ll (DBA)
Site Reliability Engineer ll (DBA)

Backblaze • United States

Remote
ARS 3,000,000 - 5,000,000
Site Reliability Engineer (SRE) - Database Focus
Site Reliability Engineer (SRE) - Database Focus

Zoho • United States

Remote
USD 120,000 - 180,000
Site Reliability Engineer III (DBA)
Site Reliability Engineer III (DBA)

WebHosting • Northern (KY)

Hybrid
USD 125,000 - 150,000
ESPP program
Senior SRE, Databases — Global DB Reliability & Automation
Senior SRE, Databases — Global DB Reliability & Automation

Vultr • United States

On-site
USD 125,000 - 135,000
Insurance
401(k) matching
Professional development reimbursement
+6
Senior DB Reliability Engineer: Scale & Automation
Senior DB Reliability Engineer: Scale & Automation

Adobe • San Jose (CA)

On-site
USD 178,000 - 258,000
Site Reliability Engineer II: Automation & Reliability
Site Reliability Engineer II: Automation & Reliability

Webhosting • Northern (KY)

Hybrid
USD 110,000 - 160,000
Remote Reliability Engineer: SRE for Cloud Systems
Remote Reliability Engineer: SRE for Cloud Systems

Bright Vision Technologies • Elk Grove (CA)

Remote
USD 75,000 - 95,000
Senior DB SRE (MySQL/PostgreSQL)
Senior DB SRE (MySQL/PostgreSQL)

WebHosting • Northern (KY)

Hybrid
USD 125,000 - 135,000
Premium health insurance
401(k) match up to 4%
Professional development reimbursement
+3