Principal SRE: AI Platform Reliability Leader (Equity)

Nvidia Corporation in

Santa Clara (CA)

Hybrid

USD 248,000 - 397,000

Full time

5 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Equity
Benefits

Job summary

NVIDIA is seeking a Principal Site Reliability Engineer (Finance) to shape the reliability strategy for the AI Platform Runtime and lead cross‑functional initiatives at enterprise scale.

You will architect scalable, observable systems, drive automation, and guide incident response while mentoring senior engineers and influencing architecture across Cloud, Platform, Security, and AI groups.

Qualifications

  • 15+ years of experience in SRE/platform engineering or related roles.
  • BS or MS in Computer Science or equivalent experience.
  • Experience setting technical strategy across multiple teams.
  • Deep expertise in distributed systems, networking, Linux, Kubernetes, and public clouds.
  • Proficiency in Python, Go, TypeScript, JavaScript, or Java with automation experience.
  • Extensive IaC and platform automation experience (Terraform, Crossplane, AWS CDK/CFN).
  • Strong observability know-how with OpenTelemetry, metrics, logs, traces, and analytics.
  • Experience with SRE practices: SLOs, error budgets, capacity planning, DR, postmortems.

Responsibilities

  • Define long-term reliability vision and architecture for NVIDIA's AI Platform Runtime.
  • Architect highly available, scalable distributed platforms powering AI products.
  • Lead design of AI agents and automation to speed platform operations and incident response.
  • Set platform reliability standards including SLOs, budgets, and capacity models.
  • Identify systemic risks and drive cross-functional improvement programs.
  • Advance observability across complex environments using OpenTelemetry and analytics.
  • Collaborate with Cloud, Platform, Security, Networking, and AI teams on architecture decisions.
  • Provide technical leadership during incidents and translate learnings into durable improvements.
  • Develop reference architectures and automation frameworks for adoption across teams.
  • Mentor senior engineers and raise technical standards across the company.

Skills

Kubernetes
Linux
AWS
Azure
GCP
Python
Go
TypeScript
JavaScript
Java
Terraform
Crossplane
AWS CDK
AWS CloudFormation
OpenTelemetry
Observability
Distributed systems
Incident management
Blameless postmortems

Education

BS/MS in Computer Science

Tools

Terraform
Crossplane
AWS CDK
AWS CloudFormation

Job description

NVIDIA is seeking a Principal Site Reliability Engineer (Finance) to shape the reliability strategy for the AI Platform Runtime and lead cross‑functional initiatives at enterprise scale.

You will architect scalable, observable systems, drive automation, and guide incident response while mentoring senior engineers and influencing architecture across Cloud, Platform, Security, and AI groups.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Principal SRE - AI Platform Reliability Architect
Principal SRE - AI Platform Reliability Architect

NVIDIA AI • Santa Clara (CA)

On-site
USD 248,000 - 397,000
Principal SRE: AI Platform Reliability & Automation
Principal SRE: AI Platform Reliability & Automation

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Lead AI Platform Reliability Architect
Lead AI Platform Reliability Architect

NVIDIA • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Staff SRE: AI Platform Runtime & Automation
Staff SRE: AI Platform Runtime & Automation

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Senior SRE — Scale AI Systems, Equity Eligible
Senior SRE — Scale AI Systems, Equity Eligible

NVIDIA AI • Santa Clara (CA)

On-site
USD 168,000 - 334,000
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale

NVIDIA • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Senior SRE Lead: Scale Reliability & AI Ops
Senior SRE Lead: Scale Reliability & AI Ops

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA AI • Santa Clara (CA)

On-site
USD 248,000 - 397,000