Staff SRE: AI Platform Runtime & Automation

Nvidia Corporation in

Santa Clara (CA)

Hybrid

USD 168,000 - 334,000

Full time

5 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

NVIDIA is seeking a Staff Site Reliability Engineer for the AI Platform Runtime in Finance to lead reliability, scalability, and automation across large-scale enterprise systems. You will design resilient distributed systems powering NVIDIA's AI-driven enterprise products, mentor engineers, and collaborate with Cloud, Platform, Security, and AI/ML teams to ensure high availability.

This hybrid role offers equity and benefits, with base salary ranges shown on the posting; applications are welcome

Qualifications

  • 10+ years of experience in SRE, Platform Engineering, or Cloud architecture.
  • BS degree in CS or related technical field.
  • Strong programming in Python, TypeScript, JavaScript, or Go focusing on automation.
  • Experience with IaC tools: AWS CDK, CloudFormation, Terraform or CrossPlane.
  • Solid understanding of OpenTelemetry and observability at scale.
  • Deep expertise in systems architecture, networking, Kubernetes, and public cloud services (AWS/Azure/GCP).
  • Excellent problem-solving and collaboration skills.

Responsibilities

  • Lead the technical strategy and roadmap for large-scale SRE initiatives.
  • Design and build resilient distributed systems powering AI platform.
  • Architect and develop AI Agents and AI Skills to accelerate platform ops.
  • Drive automation and observability improvements using metrics.
  • Collaborate with Cloud, Platform, Security, and AI/ML teams for high availability.
  • Mentor engineers and promote reliability engineering practices.

Skills

Python
TypeScript
Go
Automation
IaC
Kubernetes
Cloud platforms
Observability

Education

BS in Computer Science or related field

Tools

AWS CDK
Terraform
CloudFormation
CrossPlane

Job description

NVIDIA is seeking a Staff Site Reliability Engineer for the AI Platform Runtime in Finance to lead reliability, scalability, and automation across large-scale enterprise systems. You will design resilient distributed systems powering NVIDIA's AI-driven enterprise products, mentor engineers, and collaborate with Cloud, Platform, Security, and AI/ML teams to ensure high availability.

This hybrid role offers equity and benefits, with base salary ranges shown on the posting; applications are welcome

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Principal SRE: AI Platform Reliability & Automation
Principal SRE: AI Platform Reliability & Automation

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Staff Site Reliability Engineer - AI Platform Runtime
Staff Site Reliability Engineer - AI Platform Runtime

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Principal SRE: AI Platform Reliability Leader (Equity)
Principal SRE: AI Platform Reliability Leader (Equity)

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Staff Site Reliability Engineer - AI Platform Runtime
Staff Site Reliability Engineer - AI Platform Runtime

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Staff Site Reliability Engineer - AI Platform Runtime
Staff Site Reliability Engineer - AI Platform Runtime

NVIDIA • Santa Clara (CA)

On-site
USD 168,000 - 334,000
Equity
Benefits
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA AI • Santa Clara (CA)

On-site
USD 248,000 - 397,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Nvidia Corporation in • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Principal Site Reliability Engineer
Principal Site Reliability Engineer

NVIDIA Gruppe • Santa Clara (CA)

Hybrid
USD 248,000 - 397,000
Equity
Benefits
Senior SRE — Scale AI Systems, Equity Eligible
Senior SRE — Scale AI Systems, Equity Eligible

NVIDIA AI • Santa Clara (CA)

On-site
USD 168,000 - 334,000
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale
Senior Site Reliability Engineer – AI-Driven, Hybrid Scale

NVIDIA • Santa Clara (CA)

Hybrid
USD 168,000 - 334,000
Equity
Benefits