HPC Networking Engineer for GPU & Data Center AI

Supermicro

San Jose (CA)

On-site

USD 120,000 - 140,000

Full time

6 days ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Supermicro is seeking a Network Engineer to assist with rollouts and maintenance of business-critical applications and services. You will collaborate with senior engineers to resolve escalated issues, implement complex projects, and deliver on-site deployment services with post-support.

The role emphasizes HPC/AI workloads, system-level testing, and robust documentation. Ideal candidates hold a BS/MS in relevant engineering or CS, have 1+ years in Deep Learning/ML, and are familiar with Linux

Qualifications

  • Requires BS/MS in Electrical Engineering, Computer Engineering or Computer Science.
  • 1+ years of work-related experience in Deep Learning and Machine Learning.
  • Familiar with Linux/networking debugging/testing or relevant experience preferred.
  • Familiar with data center, enterprise, or telecommunications networking.
  • Knowledge of DevOps or cloud environments including Docker/Containers and Kubernetes.
  • Hands-on experience with workload/scheduler Managers (Slurm) for rack/cluster.
  • Familiar with MLPerf Training/Inference benchmarks, LLM, HPL-AI or RCCL/NCCL.
  • Programming experience with Windows and Linux shell scripting.
  • Strong teamwork and communication skills.

Responsibilities

  • Execute system-level rack tests on GPUs and processors, covering functionality and performance.
  • Address HPC/AI application customer issues and build robust processes.
  • Prototype test designs and optimize benchmarks for HPC/AI workloads.
  • Deliver on-site deployment services and provide post-level 1&2 support.
  • Document hardware/software issues and feedback to Product Management.
  • Contribute to HPC roadmap and software/hardware upgrades.
  • Develop test plans, reports, and automation scripts.

Skills

Deep Learning
Machine Learning
Linux debugging
Scripting
DevOps
Cloud environments
Teamwork
CUDA/oneAPI/ROCm
SLURM

Education

BS/MS in Electrical Engineering, Computer Engineering or Computer Science

Tools

Docker
Kubernetes
Slurm

Job description

Supermicro is seeking a Network Engineer to assist with rollouts and maintenance of business-critical applications and services. You will collaborate with senior engineers to resolve escalated issues, implement complex projects, and deliver on-site deployment services with post-support.

The role emphasizes HPC/AI workloads, system-level testing, and robust documentation. Ideal candidates hold a BS/MS in relevant engineering or CS, have 1+ years in Deep Learning/ML, and are familiar with Linux

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

HPC Network Systems Engineer for AI & Data Center
HPC Network Systems Engineer for AI & Data Center

Supermicro • Wayne (CA)

On-site
USD 120,000 - 140,000
Data Center Network Engineer for AI/GPU Spine-Leaf
Data Center Network Engineer for AI/GPU Spine-Leaf

Supermicro • San Jose (CA)

On-site
USD 115,000 - 130,000
Senior System Engineer, HPC/AI & Cloud Clusters
Senior System Engineer, HPC/AI & Cloud Clusters

Supermicro • San Jose (CA)

On-site
USD 137,000 - 156,000
Network Systems Engineer
Network Systems Engineer

Supermicro • Wayne (CA)

On-site
USD 120,000 - 140,000
Network Systems Engineer
Network Systems Engineer

Supermicro • San Jose (CA)

On-site
USD 120,000 - 140,000
Data Center Network Engineer: Spine-Leaf & GPU Compute
Data Center Network Engineer: Spine-Leaf & GPU Compute

Supermicro • San Jose (CA)

On-site
USD 115,000 - 130,000
AI Data Center Network Engineer (100G+ & Spine-Leaf)
AI Data Center Network Engineer (100G+ & Spine-Leaf)

Supermicro • Wayne (CA)

On-site
USD 115,000 - 130,000
Senior GPU Platform Engineer
Senior GPU Platform Engineer

Supermicro • Wayne (CA)

On-site
USD 137,000 - 156,000
Data Center Network Engineer (30061)
Data Center Network Engineer (30061)

Supermicro • San Jose (CA)

On-site
USD 115,000 - 130,000
Senior Data Center Network Architect for AI Fabric
Senior Data Center Network Architect for AI Fabric

Supermicro • San Jose (CA)

On-site
USD 160,000 - 170,000