Senior Slurm Support & Reliability Engineer

NVIDIA Gruppe

Austin (TX)

On-site

USD 108,000 - 173,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Benefits offered by this job

Equity
Benefits package
Career growth

Job summary

NVIDIA is seeking a Technical Support Engineer to own Slurm cases in production AI and HPC deployments. You will diagnose and resolve complex scheduling and system issues across Slurm daemons, Linux, and related components, helping customers achieve reliable, scalable workloads.

The role emphasizes strong problem-solving, documentation, and collaboration with engineering to deliver actionable guidance and improvements. Equity and comprehensive benefits are offered.

Qualifications

  • BS degree in Computer Science, Engineering, or a related field, or equivalent experience.
  • 5+ years of hands-on experience administering and supporting Slurm in production HPC or AI environments.
  • Expert-level understanding of Slurm architecture, daemons, configuration, scheduling behavior, accounting, resource management, and failure modes.
  • Ability to identify sophisticated Slurm incidents independently and guide to resolution.
  • In-depth Linux system-administration and solved experience, including systemd, cgroups, authentication, networking, and database-backed services.
  • Experience operating Slurm across multi-user clusters with complex scheduling policies and heterogeneous compute resources.
  • Strong analytical and research skills with ability to distinguish Slurm defects from other problems.
  • Excellent written and verbal communication skills to explain findings clearly.

Responsibilities

  • Own Slurm support cases from investigation through resolution for production AI/HPC clusters.
  • Diagnose complex problems involving slurmctld, slurmd, slurmdbd, scheduling, node management, and resources.
  • Investigate performance, reliability, and scalability issues using logs and configurations.
  • Isolate problems across Slurm and dependencies like Linux, MUNGE, databases, networking, and GPUs.
  • Advise customers on Slurm configuration, upgrades, and operational practices.
  • Collaborate with engineering to produce clear defect reports and training materials.
  • Develop guides and diagnostic tools to strengthen Slurm expertise across the team.

Skills

Slurm expert
Linux administration
Troubleshooting
Customer support
Documentation
Communication skills

Education

BS in CS/Engineering

Tools

Slurm daemons
Lua
SPANK
Containers
Pyxis

Job description

NVIDIA is seeking a Technical Support Engineer to own Slurm cases in production AI and HPC deployments. You will diagnose and resolve complex scheduling and system issues across Slurm daemons, Linux, and related components, helping customers achieve reliable, scalable workloads.

The role emphasizes strong problem-solving, documentation, and collaboration with engineering to deliver actionable guidance and improvements. Equity and comprehensive benefits are offered.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Slurm Support Engineer for AI & HPC - Equity
Senior Slurm Support Engineer for AI & HPC - Equity

Nvidia Corporation in • Austin (TX)

On-site
USD 108,000 - 207,000
Senior Slurm Support Engineer for HPC/AI Clusters
Senior Slurm Support Engineer for HPC/AI Clusters

NVIDIA • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits
Senior Technical Support Engineer - Slurm
Senior Technical Support Engineer - Slurm

Nvidia Corporation in • Austin (TX)

On-site
USD 108,000 - 207,000
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA Gruppe • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits package
Career growth
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits
Senior HPC Scheduler Engineer (LSF/Slurm) - Hybrid & Equity
Senior HPC Scheduler Engineer (LSF/Slurm) - Hybrid & Equity

NVIDIA Corporation • Santa Clara (CA), Northern (KY)

Hybrid
USD 152,000 - 288,000
Equity
Benefits package
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 150,000 - 190,000
Senior HPC Scheduler & Reliability Engineer — Equity Options
Senior HPC Scheduler & Reliability Engineer — Equity Options

NVIDIA Gruppe • Santa Clara (CA)

On-site
USD 152,000 - 241,500
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)

BranchFactor • Austin (TX), Northern (KY)

Hybrid
USD 184,000 - 357,000
Equity
Benefits
Senior HPC and LSF Operations Engineer
Senior HPC and LSF Operations Engineer

NVIDIA Gruppe • Santa Clara (CA)

On-site
USD 152,000 - 241,500