Senior Observability Engineer - AI Infra & Cloud (Remote)

Together Computer Inc

United States

Remote

USD 200,000 - 280,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Health insurance
Startup equity
Remote-friendly policy

Job summary

Together AI is building the AI Acceleration Cloud, an end-to-end platform for the full generative AI lifecycle. The AI Infrastructure team designs and scales foundational systems, including robust distributed storage and comprehensive observability for GPU utilization and data access.

The role focuses on building an observability platform, automated monitoring, and incident response using Go, Python, Terraform, Ansible, and Helm, with cloud-native tools across AWS/GCP/Azure.

Qualifications

  • Experience with observability platforms (Prometheus, Grafana, OpenTelemetry) and cloud-native monitoring services (AWS, GCP, Azure)
  • Strong programming in Go or Python; proficiency with IaC tools (Terraform, Ansible, Helm)
  • Experience designing, operating, and scaling large-scale distributed systems and data pipelines
  • Deep understanding of Docker and Kubernetes
  • Knowledge of microservices, service meshes, CI/CD pipelines, and GitOps workflows
  • Experience with databases (PostgreSQL, MongoDB, Redis) and time-series data

Responsibilities

  • Design and implement a scalable observability platform (metrics, logs, traces) using Prometheus, Grafana, ClickHouse, ClickStack, and OpenTelemetry.
  • Develop automated monitoring, alerting, and anomaly detection systems with SLIs/SLOs and runbooks.
  • Build and deploy observability tools using Go, Python, Terraform, Ansible, and Helm.
  • Collaborate with engineering teams to enhance tracing and monitoring; lead incident response with post-mortem analysis.
  • Define observability best practices.

Skills

Prometheus
Grafana
OpenTelemetry
Go
Python
Terraform
Ansible
Helm
Kubernetes
PostgreSQL
MongoDB
Redis
CI/CD pipelines
Distributed systems
Docker
GitOps

Tools

ClickHouse
ClickStack

Job description

Together AI is building the AI Acceleration Cloud, an end-to-end platform for the full generative AI lifecycle. The AI Infrastructure team designs and scales foundational systems, including robust distributed storage and comprehensive observability for GPU utilization and data access.

The role focuses on building an observability platform, automated monitoring, and incident response using Go, Python, Terraform, Ansible, and Helm, with cloud-native tools across AWS/GCP/Azure.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Observability Platform Engineer
Senior Observability Platform Engineer

Together AI • San Francisco (CA)

Hybrid
USD 200,000 - 280,000
Senior Observability Platform Engineer for AI GPU Cloud
Senior Observability Platform Engineer for AI GPU Cloud

Greenhouse Software, Inc. • Northern (KY)

Hybrid
USD 160,000 - 230,000
Medical
Dental
Vision
+3
Senior AI Infrastructure & Observability Engineer
Senior AI Infrastructure & Observability Engineer

NVIDIA • Westford (MA)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior AI Infra Engineer — Telemetry & Observability
Senior AI Infra Engineer — Telemetry & Observability

NVIDIA Corporation • Northern (KY)

Hybrid
USD 184,000 - 357,000
Equity
Benefits
Senior Observability Platform Engineer for AI/GPU Infra
Senior Observability Platform Engineer for AI/GPU Infra

Nscale • Seattle (WA)

On-site
USD 180,000 - 240,000
Senior AI Factory Observability Architect (Remote, Equity)
Senior AI Factory Observability Architect (Remote, Equity)

NVIDIA Corporation • Town of Texas (WI)

On-site
USD 184,000 - 287,500
Equity options
Comprehensive benefits package
Senior Observability Platform Engineer – AI GPU Scale
Senior Observability Platform Engineer – AI GPU Scale

Nscale • United States

On-site
USD 160,000 - 230,000
Medical, dental, vision insurance
Flexible paid time off (PTO)
Parental leave
+1
AI-Powered Observability Engineer
AI-Powered Observability Engineer

OpenAI • San Francisco (CA), Mountain View (CA), New York (NY)

On-site
USD 180,000 - 240,000
Senior AI Factory Observability Architect
Senior AI Factory Observability Architect

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior AI Infra Engineer | Equity Eligible, Observability Focus
Senior AI Infra Engineer | Equity Eligible, Observability Focus

NVIDIA • Washington

On-site
USD 184,000 - 357,000
Equity
Benefits