Site Reliability Engineer — LLM Platform & Observability

Appnovation

Dallas (TX)

On-site

USD 140,000 - 190,000

Full time

38 hours ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Appnovation Technologies in Dallas seeks a Site Reliability Engineer to build and operate a shared observability platform for AI/ML applications. You will own monitoring, SLAs, and infrastructure as code across Kubernetes, AWS EKS, ClickHouse, PostgreSQL, Redis, Helm and Argo CD.

You will design runbooks, upgrade strategies, and incident response processes, plus help onboarding internal teams. Prior experience with Langfuse, OpenTelemetry, Grafana is a plus.

Qualifications

  • Hands-on experience with Kubernetes on AWS (EKS) and Helm/Argo CD.
  • Production exposure to ClickHouse, PostgreSQL and Redis; backup/restore skills.

Responsibilities

  • Platform Operations: Diagnose and resolve failures across ClickHouse, PostgreSQL, Redis and the Kubernetes layer.
  • ClickHouse Operations: Manage Keeper quorum, replication, shard/topology, and S3 tiering.
  • Backup and Restore: Rehearse restores, time them, document, and test failure modes.
  • Safe Upgrades: Plan upgrades in lower environments with rollback for partial migrations.
  • Monitoring and SLAs: Build monitoring, alerting and service levels from scratch.
  • Infrastructure as Code: Maintain Kubernetes manifests, Helm values and Argo CD apps.
  • Runbooks and SOPs: Write and maintain runbooks for on-call resolution.
  • Onboarding and Support: Guide internal teams on platform usage.
  • Automation: Turn recurring tasks into automation.
  • Upgrade Partnership: Coordinate migrations with platform engineers.

Skills

Kubernetes
AWS EKS
ClickHouse
PostgreSQL
Redis
Helm
Argo CD
Langfuse
OpenTelemetry
Grafana

Tools

Langfuse
LangSmith
Argo CD
Grafana

Job description

Appnovation Technologies in Dallas seeks a Site Reliability Engineer to build and operate a shared observability platform for AI/ML applications. You will own monitoring, SLAs, and infrastructure as code across Kubernetes, AWS EKS, ClickHouse, PostgreSQL, Redis, Helm and Argo CD.

You will design runbooks, upgrade strategies, and incident response processes, plus help onboarding internal teams. Prior experience with Langfuse, OpenTelemetry, Grafana is a plus.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Site Reliability Engineer — AI Platform Observability
Site Reliability Engineer — AI Platform Observability

Appnovation • Miami (FL)

On-site
USD 120,000 - 180,000
Site Reliability Engineer - AI Observability for LLM Apps
Site Reliability Engineer - AI Observability for LLM Apps

Appnovation Technologies • New York (NY), Austin (TX), Dallas (TX), Miami (FL)

On-site
USD 130,000 - 180,000
Contractor role
Platform Reliability Engineer - Kubernetes & Langfuse
Platform Reliability Engineer - Kubernetes & Langfuse

Appnovation • New York (NY)

On-site
USD 140,000 - 200,000
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • New York (NY)

On-site
USD 140,000 - 200,000
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation Technologies • New York (NY), Austin (TX), Dallas (TX), Miami (FL)

On-site
USD 130,000 - 180,000
Contractor role
Senior Site Reliability Engineer - AI Observability & Infra
Senior Site Reliability Engineer - AI Observability & Infra

Tulip Interfaces • Boston (MA)

Hybrid
USD 160,000 - 200,000
Company equity
Flexible schedule
Health, dental, vision
Site Reliability Engineer – Observability & Automation Lead
Site Reliability Engineer – Observability & Automation Lead

National Oilwell Varco • Houston (TX)

On-site
USD 140,000 - 180,000
Site Reliability Engineer, AI Platform & Observability
Site Reliability Engineer, AI Platform & Observability

Schonfeld • Northern (KY), New York (NY)

Hybrid
USD 175,000 - 225,000
Performance bonus
Competitive benefits package
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • Miami (FL)

On-site
USD 120,000 - 180,000
Site Reliability Engineer, AI Observability
Site Reliability Engineer, AI Observability

Appnovation • Dallas (TX)

On-site
USD 140,000 - 190,000