Senior SRE Lead: Scale Reliability & AI Ops

NVIDIA Gruppe

Santa Clara (CA)

Hybrid

USD 168,000 - 334,000

Full time

12 days ago
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Equity
Benefits

Job summary

NVIDIA is seeking an experienced Site Reliability Engineer to design, build, and maintain large-scale production systems with a focus on reliability and automation. You will lead cross-functional initiatives, architect distributed AI-enabled services, and drive improvements in observability and performance across enterprise platforms.

The role emphasizes collaboration with Cloud, Platform, Security, and AI/ML teams, mentoring engineers, and delivering scalable, resilient infrastructure in a

Qualifications

  • BS degree in Computer Science or a related technical field involving coding (e.g., physics or mathematics) or equivalent experience.
  • Strong proficiency in Python, Typescript, JavaScript, or Go with focus on automation and IaC.
  • Experience with infrastructure-as-code tools (AWS CDK, CloudFormation, Terraform or CrossPlane).
  • Solid understanding of OpenTelemetry or other observability implementations at scale.
  • Deep expertise in systems architecture, networking, Kubernetes, and public cloud services (AWS/Azure/GCP).

Responsibilities

  • Lead the technical strategy and roadmap for large-scale, cross-functional SRE initiatives.
  • Design and build resilient distributed systems powering AI-driven enterprise products.
  • Architect and develop AI Agents and AI Skills to accelerate platform operations.
  • Drive automation and observability improvements using metrics to boost performance and reliability.
  • Collaborate across Cloud, Platform, Security, and AI/ML teams to ensure high availability and secure operations.
  • Analyze and troubleshoot complex systems, champion best practices in incident management and postmortems.
  • Mentor engineers to foster reliability engineering culture.

Skills

Python
Typescript
JavaScript
Go
Automation
Infrastructure-as-code
Kubernetes
Public cloud
OpenTelemetry

Education

BS in Computer Science or related technical field

Tools

AWS CDK
AWS CloudFormation
Terraform
CrossPlane
OpenTelemetry
Kubernetes

Job description

NVIDIA is seeking an experienced Site Reliability Engineer to design, build, and maintain large-scale production systems with a focus on reliability and automation. You will lead cross-functional initiatives, architect distributed AI-enabled services, and drive improvements in observability and performance across enterprise platforms.

The role emphasizes collaboration with Cloud, Platform, Security, and AI/ML teams, mentoring engineers, and delivering scalable, resilient infrastructure in a

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE — Scale AI Systems, Equity Eligible
Senior SRE — Scale AI Systems, Equity Eligible

NVIDIA AI • Santa Clara (CA)

On-site
USD 168,000 - 334,000
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale

NVIDIA • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Principal SRE: AI Platform Reliability & Automation
Principal SRE: AI Platform Reliability & Automation

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Senior SRE – AI Infrastructure Reliability Leader
Senior SRE – AI Infrastructure Reliability Leader

Nscale • San Francisco (CA), Seattle (WA), Houston (TX)

On-site
USD 170,000 - 265,000
Equity
Ownership from start
Flexible schedule
Senior SRE: Automate Reliability for AI/GPU Platform
Senior SRE: Automate Reliability for AI/GPU Platform

Nscale • Seattle (WA)

On-site
USD 130,000 - 200,000
Principal SRE: AI Platform Reliability Leader (Equity)
Principal SRE: AI Platform Reliability Leader (Equity)

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Principal SRE - AI Platform Reliability Architect
Principal SRE - AI Platform Reliability Architect

NVIDIA AI • Santa Clara (CA)

On-site
USD 248,000 - 397,000
Lead AI Platform Reliability Architect
Lead AI Platform Reliability Architect

NVIDIA • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Senior SRE Lead, Site Reliability Operations (Equity)
Senior SRE Lead, Site Reliability Operations (Equity)

NVIDIA Gruppe • Seattle (WA)

On-site
USD 184,000 - 265,000
Equity
Benefits
Senior SRE: Global HPC & Multi-Cloud Reliability
Senior SRE: Global HPC & Multi-Cloud Reliability

NVIDIA Corporation • Durham (CA), Northern (KY)

Hybrid
USD 152,000 - 288,000