Site Reliability Engineer (SRE)

Tala Health

San Francisco, Northern (CA, KY)

On-site

USD 150,000 - 210,000

Full time

14 days+
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Job summary

Tala Health is seeking a Machine Learning Engineer with a strong SRE/DevOps background to help scale our platform in a compliant environment. You will define SLOs/SLAs, build observability pipelines, and automate infrastructure while ensuring secure, HIPAA-aligned operations.

The role emphasizes monitoring, automation, and cost/performance optimization for microservices and data endpoints in a regulated healthcare setting.

Qualifications

  • SRE/DevOps experience in production workloads.
  • Kubernetes expert with service meshes and load balancers.
  • Experience with monitoring/logging stacks: Prometheus, Grafana, OpenTelemetry, ELK.
  • Programming/scripting: Python, Go, or Bash.
  • Experience with relational and NoSQL databases, caches, and message brokers.
  • Security-first mindset in regulated/high-stakes environments.

Responsibilities

  • Define and uphold SLOs/SLAs for critical services; perform capacity planning and chaos drills.
  • Build observability pipelines (metrics, logs, traces) to surface issues before users notice.
  • Automate infrastructure provisioning and config with Terraform, Helm, and Kubernetes Operators.
  • Lead on-call rotations; drive root-cause analyses and document post-mortems for learning.
  • Optimize cost and performance of microservices, databases and real-time model endpoints.
  • Manage backups, disaster-recovery plans, secrets and certificate lifecycles in line with HIPAA.

Job description

Tala Health was built to transform a healthcare system that remains slow, expensive and inefficient. Today's patients often face a fragmented system that requires juggling doctor visits, lab work, referrals and long wait times just to reach a diagnosis. With Tala Health, patients will receive a new kind of care experience that brings AI agents and clinicians together from the start to deliver accurate, personalized care faster. We are building AI agents to support the full arc of the patient journey.

The Opportunity: Machine Learning Engineer

Patients count on our platform 24/7. You'll build and maintain the tooling, alerts and incident-response playbooks that keep latency low, data safe and uptime high as we scale from thousands to millions of sessions.

What You'll Do

Define and uphold SLOs/SLAs for critical services, running capacity planning and chaos drills.

Build observability pipelines—metrics, logs, traces—so issues surface before users notice.

Automate infra provisioning and config with Terraform, Helm and Kubernetes Operators.

Lead on-call rotations, drive root-cause analyses, and document post-mortems for continuous learning.

Optimize cost and performance of microservices, databases and real-time model endpoints.

Manage backups, disaster-recovery plans, secrets and certificate lifecycles in line with HIPAA.

What You Bring

5+years SRE/DevOps experience running production workloads on AWS, GCP or Azure.

Mastery of Kubernetes, service meshes, load balancers and CDN tuning.

Hands-on with monitoring & logging stacks (Prometheus, Grafana, OpenTelemetry, ELK).

Strong scripting or programming skills in Python, Go or Bash.

Familiarity with relational and NoSQL databases, caches and message brokers.

Security-first mindset and experience in regulated or high-stakes environments.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

SRE & Reliability Engineer — AI-Driven Health Platform
SRE & Reliability Engineer — AI-Driven Health Platform

Tala Health • San Francisco (CA), Northern (KY)

Hybrid
USD 150,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

Latent • San Francisco (CA)

On-site
USD 140,000 - 200,000
Site Reliability Engineer
Site Reliability Engineer

Harvey Nash • United States

Remote
USD 120,000 - 150,000
Principal Site Reliability Engineer (SRE)
Principal Site Reliability Engineer (SRE)

Symmetrio • United States

Hybrid
USD 120,000 - 160,000
Health Care Plan (Medical, Dental & Vision)
Retirement Plan (401k, IRA)
Paid Time Off (Vacation, Sick & Public Holidays)
Site Reliability Engineer
Site Reliability Engineer

Knack Solutions • Richmond (VA)

On-site
USD 100,000 - 130,000
Site Reliability Engineer
Site Reliability Engineer

Compunnel, Inc. • Greenwood Village (CO)

On-site
USD 120,000 - 150,000
Machine Learning Engineer
Machine Learning Engineer

Tala Health • San Francisco (CA), Northern (KY)

Hybrid
USD 140,000 - 190,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Madison-Davis, LLC • United States

On-site
USD 120,000 - 150,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Kontakt.io • United States

On-site
USD 150,000 - 190,000