Senior SRE: Global HPC & Multi-Cloud Reliability

NVIDIA Corporation

Durham, Northern (CA, KY)

Hybrid

USD 152,000 - 288,000

Full time

5 days ago
Be an early applicant
Application generator

Don’t send a generic resume — generate a resume and cover letter tailored to this exact role.

Get past ATS filters

Job summary

NVIDIA Corporation is seeking a Senior Site Reliability Engineer for its Compute Farm to own end-to-end SRE solutions, ensure high uptime, and drive automation across a global multi-cloud hybrid environment. You will design for failure, orchestrate capacity planning, and collaborate across teams to deliver reliable services.

Join a team delivering scalable infrastructure, observability, and auto-healing, with strong emphasis on on-call reliability and performance optimization.

Qualifications

  • B.S. degree in Computer Science or related field with 5+ years of professional experience.
  • Experience supporting large-scale HPC clusters using Slurm, LSF or Kubernetes.
  • Proficiency in CI/CD techniques and Infrastructure as Code (IaC).
  • Experience building large-scale infrastructure platforms for automated host lifecycle management and observability.
  • Proficient in monitoring, metrics, container management, and log collection tools.
  • 5+ years of coding/scripting in at least two languages (Python, Go, Perl, Ruby).
  • Mentored engineers and influenced technical direction through design reviews and docs.
  • Creative problem solver with strong communication and documentation abilities.

Responsibilities

  • Own SRE solutions end-to-end, from design and implementation to operation and continuous improvement.
  • Use IaC and config management to standardize provisioning everywhere.
  • Deliver solutions in a global multi-cloud hybrid environment - On-prem, AWS, GCP, OCI.
  • Design for failure with redundancy, failure domains, and strict change control.
  • Ensure uptime and QoS for internal customers through operational excellence.
  • Conduct capacity management and planning to meet ongoing needs.
  • Detect performance issues and recommend solutions for world-class service quality.
  • Collaborate with teams in a fast-paced environment to ensure project success.
  • Participate in on-call, incident reviews, RCA reports.

Skills

Python/Go/Ruby scripting
Troubleshooting

Education

B.S. degree in Computer Science or related technical field

Tools

Slurm/LSF/Kubernetes
CI/CD & IaC
Monitoring & logging tools

Job description

NVIDIA Corporation is seeking a Senior Site Reliability Engineer for its Compute Farm to own end-to-end SRE solutions, ensure high uptime, and drive automation across a global multi-cloud hybrid environment. You will design for failure, orchestrate capacity planning, and collaborate across teams to deliver reliable services.

Join a team delivering scalable infrastructure, observability, and auto-healing, with strong emphasis on on-call reliability and performance optimization.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior SRE: Global HPC & Multi-Cloud Reliability
Senior SRE: Global HPC & Multi-Cloud Reliability

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 152,000 - 288,000
Equity
Benefits package
Senior SRE — Global HPC/AI Infra with Equity
Senior SRE — Global HPC/AI Infra with Equity

Socket.dev • North Carolina

On-site
USD 152,000 - 288,000
Senior Staff SRE — Global Infra, Automation & Observability
Senior Staff SRE — Global Infra, Automation & Observability

NVIDIA Corporation • Santa Clara (CA), Northern (KY)

Hybrid
USD 200,000 - 322,000
Senior SRE: Global Infra & Automation (Equity)
Senior SRE: Global Infra & Automation (Equity)

Socket.dev • California (MO)

Hybrid
USD 200,000 - 322,000
Equity
Benefits
Senior Staff SRE: Global On-Prem & Cloud Infra Lead
Senior Staff SRE: Global On-Prem & Cloud Infra Lead

NVIDIA • United States

On-site
USD 200,000 - 322,000
Senior SRE - Scalable Infra & Reliability (Equity)
Senior SRE - Scalable Infra & Reliability (Equity)

NVIDIA • Durham (NC)

On-site
USD 224,000 - 431,250
Equity
Benefits
Senior HPC Storage SRE: On-Prem & Cloud Automation
Senior HPC Storage SRE: On-Prem & Cloud Automation

JobCubby • Santa Clara (CA), Northern (KY)

Hybrid
USD 168,000 - 334,000
Equity
Benefits
Senior Site Reliability Engineer - HPC
Senior Site Reliability Engineer - HPC

NVIDIA Corporation • Durham (CA), Northern (KY)

On-site
USD 152,000 - 288,000
Senior Site Reliability Engineer - HPC
Senior Site Reliability Engineer - HPC

NVIDIA Corporation • Santa Clara (CA)

On-site
USD 152,000 - 288,000
Equity
Benefits package
Senior Site Reliability Engineer - HPC
Senior Site Reliability Engineer - HPC

Socket.dev • North Carolina

On-site
USD 152,000 - 288,000