Senior Slurm Support Engineer for HPC/AI Clusters

NVIDIA

Austin (TX)

On-site

USD 108,000 - 173,000

Full time

14 days+
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Equity
Benefits

Job summary

NVIDIA is seeking a Technical Support Engineer to own Slurm support for production AI and HPC environments, diagnosing issues across Slurm daemons, Linux, networking, storage, authentication, and GPUs. You will investigate, reproduce, and resolve complex cases for customers running production clusters.

You will collaborate with engineering teams and contribute to guides, diagnostics, and training to strengthen Slurm expertise across the support organization.

Qualifications

  • BS degree in Computer Science, Engineering, or related field or equivalent experience.
  • 5+ years of hands-on experience administering and supporting Slurm in production HPC or AI environments including business-critical outage incidents.
  • Expert-level understanding of Slurm architecture, daemons, configuration, scheduling behavior, accounting, resource management, and failure modes.
  • Capacity to identify sophisticated Slurm incidents independently and guide them to a technically sound resolution.
  • In-depth Linux system-administration and solve experience, including systemd, cgroups, authentication, networking, and database-backed services.
  • Experience operating Slurm across multi-user clusters with complex scheduling policies and heterogeneous compute resources.
  • Strong analytical and research skills, showing proficiency in distinguishing Slurm defects from configuration, integration, infrastructure, and workload problems.
  • Excellent written and verbal communication skills, including the ability to turn detailed technical findings into clear explanations and actionable recommendations.

Responsibilities

  • Own Slurm support cases from initial investigation through resolution for customers running production AI and HPC clusters.
  • Diagnose complex problems involving slurmctld, slurmd, slurmdbd, job scheduling, node management, resource allocation, accounting, authentication, and high availability.
  • Solve Slurm configuration and policy features, including partitions, reservations, priorities, fair-share, quality of service, backfill, preemption, GRES/TRES, cgroups, and job constraints.
  • Investigate performance, reliability, and scalability issues using logs, diagnostic data, configuration analysis, reproductions, and source-level debugging when required.
  • Isolate problems across Slurm and its surrounding dependencies, including Linux, MUNGE, databases, networking, parallel storage, containers, GPUs, and cluster-management systems.
  • Advise customers on Slurm configuration, upgrades, operational practices, managing system resources, and safe recovery from production incidents.
  • Collaborate with engineering teams by producing clear technical descriptions, reproducible test cases, and well-supported defect reports.
  • Develop guides, knowledge-base articles, diagnostic tools, and internal training that strengthen Slurm expertise across the support organization.

Skills

Slurm administration
Linux troubleshooting
Analytical reasoning
Technical communication
Production support

Education

BS degree in Computer Science, Engineering, or related field

Tools

Slurm
SPANK
Lua plugins
Pyxis
Enroot
Apptainer
Singularity
MUNGE

Job description

NVIDIA is seeking a Technical Support Engineer to own Slurm support for production AI and HPC environments, diagnosing issues across Slurm daemons, Linux, networking, storage, authentication, and GPUs. You will investigate, reproduce, and resolve complex cases for customers running production clusters.

You will collaborate with engineering teams and contribute to guides, diagnostics, and training to strengthen Slurm expertise across the support organization.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Slurm Support Engineer for AI & HPC - Equity
Senior Slurm Support Engineer for AI & HPC - Equity

Nvidia Corporation in • Austin (TX)

On-site
USD 108,000 - 207,000
Senior Slurm Support & Reliability Engineer
Senior Slurm Support & Reliability Engineer

NVIDIA Gruppe • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits package
Career growth
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA Gruppe • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits package
Career growth
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits
Senior Technical Support Engineer - Slurm
Senior Technical Support Engineer - Slurm

Nvidia Corporation in • Austin (TX)

On-site
USD 108,000 - 207,000
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 150,000 - 190,000
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)

BranchFactor • Austin (TX), Northern (KY)

Hybrid
USD 184,000 - 357,000
Equity
Benefits
Senior Cloud-Native AI Data Center Engineer Kubernetes/Slurm
Senior Cloud-Native AI Data Center Engineer Kubernetes/Slurm

NVIDIA • California (MO)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior HPC Systems Engineer — Slurm, GPU, Cloud-Native
Senior HPC Systems Engineer — Slurm, GPU, Cloud-Native

Nscale • New York (NY)

On-site
USD 180,000 - 260,000
Bonus
Equity
Medical Insurance
+5
Senior HPC Systems Engineer: Slurm, GPU & Hybrid Clusters
Senior HPC Systems Engineer: Slurm, GPU & Hybrid Clusters

Parallel Works • United States

Hybrid
USD 180,000 - 230,000
Medical, vision, and dental coverage
401(k) with company match
Paid vacation & sick time
+1