Platform Reliability Engineer - Kubernetes & Langfuse

Appnovation

New York (NY)

On-site

USD 140,000 - 200,000

Full time

5 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

Appnovation seeks a Site Reliability Engineer to build and operate a shared observability platform for LLM-based applications for a global life sciences client. The stack includes Kubernetes on AWS (EKS), ClickHouse, PostgreSQL, Redis, Helm and Argo CD, with Langfuse/LangSmith observability tools.

You will design monitoring, alerting and service levels from scratch, implement infrastructure as code, and create runbooks and SOPs to guide on-call teams and onboarding.

Qualifications

  • Hands-on Kubernetes on AWS (EKS) with Helm and Argo CD.
  • Experience running ClickHouse in production, including backups.
  • Proficient in PostgreSQL and Redis for metadata and queues.
  • Experience building monitoring, alerting and SLAs from scratch.
  • Strong operational writing: runbooks and SOPs.

Responsibilities

  • Platform Operations: diagnose and resolve failures across ClickHouse, PostgreSQL, Redis and Kubernetes.
  • ClickHouse Operations: manage replication, Keeper quorum, shard/topology and S3 tiering.
  • Backup and Restore: rehearse, document and test restores.
  • Safe Upgrades: plan rehearsals with rollback for partial migrations.
  • Monitoring and SLAs: build monitoring and alerting from scratch.
  • Infrastructure as Code: maintain Kubernetes manifests, Helm values and Argo CD.
  • Runbooks/SOPs: write and maintain on-call runbooks.
  • Onboarding and Support: manage internal team onboarding and support path.
  • Automation: convert recurring tasks into automation.
  • Upgrade Partnership: drive migration and rollback alongside platform engineers.

Skills

SRE fundamentals
Automation mindset
Runbooks writing
Incident response

Tools

Kubernetes (AWS EKS)
Helm
Argo CD
ClickHouse
PostgreSQL
Redis
OpenTelemetry
Grafana
Langfuse
LangSmith
Arize Phoenix
GitHub Actions

Job description

Appnovation seeks a Site Reliability Engineer to build and operate a shared observability platform for LLM-based applications for a global life sciences client. The stack includes Kubernetes on AWS (EKS), ClickHouse, PostgreSQL, Redis, Helm and Argo CD, with Langfuse/LangSmith observability tools.

You will design monitoring, alerting and service levels from scratch, implement infrastructure as code, and create runbooks and SOPs to guide on-call teams and onboarding.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer — AI Platform Observability
Site Reliability Engineer — AI Platform Observability

Appnovation • Miami (FL)

On-site
USD 120,000 - 180,000
Site Reliability Engineer — LLM Platform & Observability
Site Reliability Engineer — LLM Platform & Observability

Appnovation • Dallas (TX)

On-site
USD 140,000 - 190,000
Site Reliability Engineer - AI Observability for LLM Apps
Site Reliability Engineer - AI Observability for LLM Apps

Appnovation Technologies • New York (NY), Austin (TX), Dallas (TX), Miami (FL)

On-site
USD 130,000 - 180,000
Contractor role
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • New York (NY)

On-site
USD 140,000 - 200,000
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation Technologies • New York (NY), Austin (TX), Dallas (TX), Miami (FL)

On-site
USD 130,000 - 180,000
Contractor role
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • Dallas (TX)

On-site
USD 140,000 - 190,000
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • Miami (FL)

On-site
USD 120,000 - 180,000
Remote Senior Cloud Reliability Engineer
Remote Senior Cloud Reliability Engineer

United States Digital Space LLC • United States

Remote
USD 150,000 - 210,000
Healthcare contributions
Employee equity
Flexible time off
+2
Platform Reliability Engineer: Observability & SLOs on AWS
Platform Reliability Engineer: Observability & SLOs on AWS

Appnovation • New York (NY)

On-site
USD 140,000 - 200,000
Senior Site Reliability Engineer - Kubernetes Observability
Senior Site Reliability Engineer - Kubernetes Observability

Evlo AI • Denver (CO)

On-site
USD 120,000 - 180,000