Senior SRE Lead - AI-Driven Reliability & Scale

NVIDIA Corporation

Santa Clara (CA)

Hybrid

USD 168,000 - 334,000

Full time

2 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Benefits offered by this job

Equity
Benefits
Hybrid work model

Job summary

NVIDIA is seeking a Site Reliability Engineer to lead strategy for large-scale, cross-functional SRE initiatives and improve reliability across enterprise systems.

You will design resilient distributed architectures, drive automation and observability, and collaborate with Cloud, Platform, Security, and AI/ML teams to ensure high availability and secure operations.

Join a team that mentors engineers, champions a culture of reliability, and accelerates AI-driven enterprise platforms.

Qualifications

  • 10+ years of experience in Site Reliability Engineering, Platform Engineering, or Cloud Architect roles.
  • BS degree in Computer Science or a related technical field involving coding, or equivalent experience
  • Strong proficiency in programming languages such as Python, Typescript, JavaScript, or Go, with a focus on automation and infrastructure-as-code.
  • Experience with infrastructure-as-code such as AWS CDK, AWS CloudFormation, Terraform or CrossPlane
  • Solid understanding of OpenTelemetry or other Observability implementation at scale.
  • Deep expertise in systems architecture, networking, Kubernetes, and public cloud services (AWS, Azure, or GCP).
  • Outstanding problem-solving, communication, and teamwork skills, with the ability to influence across technical and interpersonal boundaries.

Responsibilities

  • Lead the technical strategy and roadmap for large-scale, cross-functional SRE initiatives that improve reliability, scalability, and developer productivity across enterprise systems.
  • Design, and build resilient distributed systems that power NVIDIA’s next-generation AI-driven enterprise products and services.
  • Architect and develop AI Agents, AI Skills to accelerate platform operations.
  • Drive automation and observability improvements, using metrics and analytics to enhance performance, reliability, and efficiency.
  • Collaborate across Cloud, Platform, Security, and AI/ML teams to implement modern SRE components that ensure high availability and secure operations.
  • Analyze and troubleshoot complex systems, championing best practices in system design, incident management, and postmortem analysis.
  • Mentor and influence engineers across teams, fostering technical excellence and a culture of reliability engineering.

Skills

SRE Leadership
Cloud architecture
Kubernetes
Python/Go/TypeScript
Observability
Automation

Education

BS in CS or related field

Tools

AWS CDK
Terraform
CloudFormation
CrossPlane
OpenTelemetry
Kubernetes

Job description

NVIDIA is seeking a Site Reliability Engineer to lead strategy for large-scale, cross-functional SRE initiatives and improve reliability across enterprise systems.

You will design resilient distributed architectures, drive automation and observability, and collaborate with Cloud, Platform, Security, and AI/ML teams to ensure high availability and secure operations.

Join a team that mentors engineers, champions a culture of reliability, and accelerates AI-driven enterprise platforms.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer – AI-Driven, Hybrid Scale
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale

NVIDIA • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Lead AI Platform Reliability Architect
Lead AI Platform Reliability Architect

NVIDIA • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Senior SRE: AI/GPU Scale & Automation
Senior SRE: AI/GPU Scale & Automation

Nscale • New York (NY), Northern (KY)

Hybrid
USD 130,000 - 200,000
Competitive base plus equity
Real scope early
Flexible work expectations
Principal SRE - AI Platform Reliability & Automation
Principal SRE - AI Platform Reliability & Automation

NVIDIA Corporation • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Hybrid work model
Senior SRE — AI/ML Infra & Global CDN Reliability
Senior SRE — AI/ML Infra & Global CDN Reliability

NVIDIA • Santa Clara (CA)

On-site
USD 168,000 - 265,000
Senior SRE: Global HPC & Multi-Cloud Reliability
Senior SRE: Global HPC & Multi-Cloud Reliability

NVIDIA Corporation • Durham (CA), Northern (KY)

Hybrid
USD 152,000 - 288,000
Staff Site Reliability Engineer - AI Platform Runtime
Staff Site Reliability Engineer - AI Platform Runtime

NVIDIA Corporation • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Hybrid work model
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA Corporation • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Hybrid work model
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Staff Site Reliability Engineer - AI Platform Runtime
Staff Site Reliability Engineer - AI Platform Runtime

NVIDIA • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits