Senior HPC SRE: Global Multi-Cloud Reliability

NVIDIA

Durham (NC)

On-site

USD 152,000 - 241,500

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Highly competitive salaries
Comprehensive benefits package
Equity eligibility

Job summary

A leading technology company is seeking a Senior SRE to join their Compute Farm team in Durham, North Carolina. You will be responsible for owning SRE solutions end-to-end, ensuring system uptime, and delivering services across a multi-cloud environment. The ideal candidate will hold a B.S. degree in Computer Science or equivalent, have over 5 years of experience, and strong proficiency in HPC clusters and modern CI/CD techniques. The role provides competitive compensation, equity, and benefits.

Qualifications

  • 5+ years professional experience in supporting critical services.
  • Experience with large-scale HPC clusters.
  • Proficiency in modern CI/CD techniques.
  • 5+ years coding experience in at least two high-level programming languages.

Responsibilities

  • Own SRE solutions from design to continuous improvement.
  • Automate provisioning using Infrastructure as Code.
  • Ensure uptime and quality of service.
  • Conduct capacity management and planning.

Skills

HPC (High-Performance Computing)
Python
Infrastructure as Code (IaC)
Container management
CI/CD techniques
Coding/Scripting
Debugging skills
Strong communication

Education

B.S. degree in Computer Science or related technical field

Tools

Slurm
LSF
Kubernetes

Job description

A leading technology company is seeking a Senior SRE to join their Compute Farm team in Durham, North Carolina. You will be responsible for owning SRE solutions end-to-end, ensuring system uptime, and delivering services across a multi-cloud environment. The ideal candidate will hold a B.S. degree in Computer Science or equivalent, have over 5 years of experience, and strong proficiency in HPC clusters and modern CI/CD techniques. The role provides competitive compensation, equity, and benefits.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior HPC SRE: Global Multi-Cloud Reliability
Senior HPC SRE: Global Multi-Cloud Reliability

NVIDIA • Austin (TX)

On-site
USD 152,000 - 242,000
Senior HPC SRE Engineer - Automation & Linux Systems
Senior HPC SRE Engineer - Automation & Linux Systems

Omega Enterprise Solutions, LLC • Corridor North (MD)

On-site
USD 100,000 - 130,000
Senior HPC SRE: Scale Research Clusters & Uptime
Senior HPC SRE: Scale Research Clusters & Uptime

The Voleon Group • Berkeley (CA)

On-site
USD 120,000 - 150,000
Principal SRE: Hybrid Cloud-Native Reliability Leader
Principal SRE: Hybrid Cloud-Native Reliability Leader

ViziRecruiter,LLC. • Salisbury (NC)

Hybrid
USD 146,000 - 221,000
Senior Cloud SRE – FedRAMP & Multi-Cloud Infra
Senior Cloud SRE – FedRAMP & Multi-Cloud Infra

Palo Alto Networks • Santa Clara (CA)

On-site
USD 120,000 - 200,000
Senior Software Engineer, HPC & Cloud Infrastructure
Senior Software Engineer, HPC & Cloud Infrastructure

NVIDIA • Durham (NC)

On-site
USD 152,000 - 242,000
Senior Site Reliability Engineer: Multi-Cloud & IaC
Senior Site Reliability Engineer: Multi-Cloud & IaC

STRATIS Cloud Tech Solutions INC • Arkansas

On-site
USD 100,000 - 130,000
Competitive salary and benefits
Growth and learning opportunities
Friendly and collaborative team environment
Senior SRE Transformation Consultant
Senior SRE Transformation Consultant

TechDigital Group • North Carolina

On-site
USD 120,000 - 150,000
Hybrid Cloud SRE Engineer – Automation & Reliability
Hybrid Cloud SRE Engineer – Automation & Reliability

DryvIQ • United States

Hybrid
USD 120,000 - 160,000
Senior SRE: Build Reliability for Global Bare Metal Cloud
Senior SRE: Build Reliability for Global Bare Metal Cloud

Latitude.sh • United States

Remote
USD 120,000 - 150,000