Site Reliability Engineer — 99.9% Uptime, Kubernetes

Latent

San Francisco (CA)

On-site

USD 140,000 - 200,000

Full time

10 days ago

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Latent in San Francisco, CA is seeking an SRE to own production environments and ensure 99.9%+ stability for our clinical AI platform used by health systems. You will drive Kubernetes/Helm, IaC with Terraform, and optimize CI/CD pipelines for TypeScript and Python/ML, while improving DevX and supporting scalable deployments.

You will contribute to maintainability, reliability, and performance of distributed systems in a five-day in-office setting, collaborating with a cross-functional team in a

Qualifications

  • Extensive experience designing, implementing, and maintaining production-grade infrastructure.
  • Hands-on deployment optimization for TypeScript and Python/ML pipelines.
  • Experience with high-availability, distributed systems, and large-scale deployments.
  • Office-based in San Francisco, five days per week.

Responsibilities

  • Infrastructure Ownership: Design, implement, and maintain the production environment, having previously handled 500+ machine deployments.
  • Kubernetes Mastery: Own our containerized infrastructure, leveraging deep expertise in Kubernetes and Helm to manage deployment, scaling, and operational health.
  • CI/CD & Deployment Optimization: Optimize and streamline both the TypeScript and Python/ML deployment pipelines to support high-velocity feature release while maintaining the highest reliability.
  • DevX Support: Support Developer Experience (DevX) work to streamline developer workflows, enhance tool proficiency, and improve CI/CD systems.
  • Infrastructure as Code (IaC): Manage and maintain infrastructure definitions using Terraform.

Skills

Automation
Ownership
Problem solving
DevX support

Tools

Kubernetes
Helm
Terraform
TypeScript
Python/ML
PostgreSQL
Redis
Kafka
CI/CD pipelines

Job description

Latent in San Francisco, CA is seeking an SRE to own production environments and ensure 99.9%+ stability for our clinical AI platform used by health systems. You will drive Kubernetes/Helm, IaC with Terraform, and optimize CI/CD pipelines for TypeScript and Python/ML, while improving DevX and supporting scalable deployments.

You will contribute to maintainability, reliability, and performance of distributed systems in a five-day in-office setting, collaborating with a cross-functional team in a

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Site Reliability Engineer
Site Reliability Engineer

Latent • San Francisco (CA)

On-site
USD 140,000 - 200,000
Site Reliability Engineer
Site Reliability Engineer

SRE • Puerto Rico

Hybrid
USD 120,000 - 180,000
Senior Site Reliability Engineer — Kubernetes & AI-Driven Ops
Senior Site Reliability Engineer — Kubernetes & AI-Driven Ops

Fal • San Francisco (CA)

On-site
USD 180,000 - 250,000
Relocation assistance to San Francisco
Visa sponsorship
Competitive salary and equity
+1
Senior Kubernetes SRE — Scale AI Clusters & Automation
Senior Kubernetes SRE — Scale AI Clusters & Automation

Neura Market • San Francisco (CA), Northern (KY)

Hybrid
USD 180,000 - 240,000
Equity compensation
Health, dental and vision coverage
Wellness and commuter stipends
+2
Site Reliability Engineer
Site Reliability Engineer

Amiri Recruiting • Mountain View (CA)

On-site
USD 130,000 - 160,000
Site Reliability Engineer
Site Reliability Engineer

NextGen | GTA: A Kelly Telecom Company • Mount Laurel Township (NJ)

On-site
USD 110,000 - 170,000
Senior Site Reliability Engineer: Cloud, Kubernetes & CI/CD
Senior Site Reliability Engineer: Cloud, Kubernetes & CI/CD

Amiri Recruiting • Mountain View (CA)

On-site
USD 130,000 - 160,000
Kubernetes Platform SRE - Cloud-Native Infra Lead
Kubernetes Platform SRE - Cloud-Native Infra Lead

United States Digital Space LLC • Washington

Hybrid
USD 174,000 - 214,000
Health, dental & vision
401(k) plan
Paid time off
Global Remote SRE for AI Infrastructure & Kubernetes
Global Remote SRE for AI Infrastructure & Kubernetes

Andromeda Cluster • San Francisco (CA)

Hybrid
USD 120,000 - 160,000
SRE Leader: Real-Time Healthcare Reliability
SRE Leader: Real-Time Healthcare Reliability

Kontakt Micro-Location Sp. Z.o.o. • New York (NY)

Hybrid
USD 180,000 - 260,000
Equity in a high-growth company
Health, dental, and vision coverage
401k
+3