Senior AI/HPC Telemetry & Observability Engineer

NVIDIA Corporation

Santa Clara (CA)

On-site

USD 152,000 - 288,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Equity

Job summary

NVIDIA Corporation in California seeks an AI & HPC Observability Engineer to design and scale high-throughput telemetry platforms, building backend services for ingestion and processing, and extending OpenTelemetry collectors.

You'll work across distributed systems, time-series storage, and real-time pipelines, collaborating with platform and SRE teams to deliver production-grade observability solutions.

Qualifications

  • Bachelor's degree in Computer Science, Computer Engineering, or related field or equivalent experience.
  • 5+ years of experience building backend or distributed systems in production environments.
  • Strong programming skills in Python, Go, or Java, with experience developing production-quality software.
  • Hands-on experience with modern observability architectures, including metrics, logs, and traces.
  • Solid experience with PromQL and time-series data systems.
  • Experience building or operating distributed data pipelines using technologies such as Kafka, Spark, or Flink.
  • Experience working with Kubernetes and cloud-native infrastructure.
  • Strong understanding of distributed systems, concurrency, and fault-tolerant system design.
  • Strong debugging, performance tuning, and production operations skills.

Responsibilities

  • Design and scale observability platforms handling high-volume metrics, logs, and traces across distributed environments.
  • Build high-performance backend services for telemetry ingestion, processing, and routing.
  • Develop and extend OpenTelemetry collectors, processors, exporters, and instrumentation libraries.
  • Build and optimize metrics pipelines using large-scale time-series storage systems.
  • Design and operate real-time and batch telemetry pipelines using streaming and distributed data technologies.
  • Improve platform reliability, performance, and cost efficiency through tuning, capacity planning, and system optimization.
  • Develop monitoring, alerting, and service reliability frameworks to ensure platform health and performance.
  • Collaborate with platform engineering, infrastructure, and site reliability teams to deliver production-grade observability solutions.

Skills

Python
Go
Java
PromQL

Education

Bachelor's degree in Computer Science/Engineering

Tools

Kafka
Spark
Flink
Kubernetes

Job description

NVIDIA Corporation in California seeks an AI & HPC Observability Engineer to design and scale high-throughput telemetry platforms, building backend services for ingestion and processing, and extending OpenTelemetry collectors.

You'll work across distributed systems, time-series storage, and real-time pipelines, collaborating with platform and SRE teams to deliver production-grade observability solutions.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior AI/HPC Observability Architect
Senior AI/HPC Observability Architect

NVIDIA • Santa Clara (CA)

On-site
USD 152,000 - 241,500
Equity
Benefits
Senior AI and HPC Observability Engineer
Senior AI and HPC Observability Engineer

NVIDIA • Seattle (WA)

On-site
USD 152,000 - 241,500
Equity
Benefits
Senior AI Infra Engineer — Telemetry & Observability
Senior AI Infra Engineer — Telemetry & Observability

NVIDIA Corporation • Northern (KY)

Hybrid
USD 184,000 - 357,000
Equity
Benefits
Senior AI and HPC Observability Engineer
Senior AI and HPC Observability Engineer

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 152,000 - 288,000
Equity
Senior AI Infrastructure Engineer Observability & Automation
Senior AI Infrastructure Engineer Observability & Automation

NVIDIA Gruppe • California (MO)

On-site
USD 184,000 - 356,000
Equity
Benefits
Senior AI Infrastructure & Observability Engineer
Senior AI Infrastructure & Observability Engineer

NVIDIA • Westford (MA)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior AI Infra Engineer — Equity Eligible, Scale Telemetry
Senior AI Infra Engineer — Equity Eligible, Scale Telemetry

NVIDIA • California (MO)

On-site
USD 184,000 - 357,000
Senior Observability & Telemetry Platform Engineer
Senior Observability & Telemetry Platform Engineer

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 152,000 - 242,000
Equity
Benefits
Senior AI Factory Observability Architect
Senior AI Factory Observability Architect

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior AI and HPC Observability Engineer
Senior AI and HPC Observability Engineer

NVIDIA • Santa Clara (CA)

On-site
USD 152,000 - 241,500
Equity
Benefits