Senior Slurm Support Engineer for AI & HPC - Equity

Nvidia Corporation in

Austin (TX)

On-site

USD 108,000 - 207,000

Full time

14 days+
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

NVIDIA is seeking a Senior Technical Support Engineer to own Slurm support for production AI and HPC clusters. You will diagnose complex issues in Slurm, Linux, networking, and storage, and guide customers to reliable resolutions.

You will work with a dedicated team of experts, developing guides and tools, and helping customers optimize performance, scalability, and reliability of their Slurm environments. This role emphasizes strong debugging and clear communication.

Qualifications

  • BS degree in Computer Science, Engineering, or related field.
  • 5+ years in production Slurm administration.
  • Expert-level understanding of Slurm architecture, daemons, configuration, scheduling behavior, accounting, resource management, and failure modes.
  • In-depth Linux system-administration experience including systemd, cgroups, authentication, networking, and database-backed services.
  • Experience operating Slurm across multi-user clusters with complex scheduling policies and heterogeneous resources.
  • Excellent written and verbal communication skills.

Responsibilities

  • Own Slurm support cases from initial investigation through resolution for customers running production AI and HPC clusters.
  • Diagnose complex problems involving slurmctld, slurmd, slurmdbd, job scheduling, node management, resource allocation, accounting, authentication, and high availability.
  • Investigate performance, reliability, and scalability issues using logs and configuration analysis.
  • Advise customers on Slurm configuration, upgrades, operational practices, and safe recoveries from production incidents.
  • Collaborate with engineering teams by producing clear technical descriptions and reproducible test cases.
  • Develop guides, knowledge-base articles, and diagnostic tools to strengthen Slurm expertise.

Skills

Slurm administration
Linux system administration
Problem solving
Communication skills

Education

BS degree in Computer Science or related field

Job description

NVIDIA is seeking a Senior Technical Support Engineer to own Slurm support for production AI and HPC clusters. You will diagnose complex issues in Slurm, Linux, networking, and storage, and guide customers to reliable resolutions.

You will work with a dedicated team of experts, developing guides and tools, and helping customers optimize performance, scalability, and reliability of their Slurm environments. This role emphasizes strong debugging and clear communication.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Slurm Support Engineer for HPC/AI Clusters
Senior Slurm Support Engineer for HPC/AI Clusters

NVIDIA • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits
Senior Slurm Support & Reliability Engineer
Senior Slurm Support & Reliability Engineer

NVIDIA Gruppe • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits package
Career growth
Senior Technical Support Engineer - Slurm
Senior Technical Support Engineer - Slurm

Nvidia Corporation in • Austin (TX)

On-site
USD 108,000 - 207,000
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA Gruppe • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits package
Career growth
Senior Technical Support Engineer – Slurm
Senior Technical Support Engineer – Slurm

NVIDIA • Austin (TX)

On-site
USD 108,000 - 173,000
Equity
Benefits
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)
Senior Slurm & HPC Cluster Engineer (GPU/AI Infra)

Bitdeer (NASDAQ: BTDR) • Austin (TX)

On-site
USD 150,000 - 190,000
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)
Senior AI Datacenter Software Engineer (Kubernetes/Slurm)

BranchFactor • Austin (TX), Northern (KY)

Hybrid
USD 184,000 - 357,000
Equity
Benefits
Senior Cloud-Native AI Data Center Engineer Kubernetes/Slurm
Senior Cloud-Native AI Data Center Engineer Kubernetes/Slurm

NVIDIA • California (MO)

On-site
USD 184,000 - 357,000
Equity
Benefits
Senior HPC-AI Cluster Architect (Equity)
Senior HPC-AI Cluster Architect (Equity)

NVIDIA • Santa Clara (CA)

On-site
USD 176,000 - 334,000
Equity
Benefits
Senior HPC Scheduler Engineer (LSF/Slurm) - Hybrid & Equity
Senior HPC Scheduler Engineer (LSF/Slurm) - Hybrid & Equity

NVIDIA Corporation • Santa Clara (CA), Northern (KY)

Hybrid
USD 152,000 - 288,000
Equity
Benefits package