Remote Senior Training Infrastructure Engineer—Multi-GPU AI

Luma AI

San Francisco (CA)

Hybrid

USD 187,500 - 395,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Luma AI in SF Bay Area is hiring for a Research Scientist/Engineer in Training Infrastructure. You will design distributed training systems for thousands of GPUs and enable researchers to push multimodal foundation models.

You should have deep experience with PyTorch, CUDA and distributed systems, plus Linux and scripting. The role offers remote/international options including London; hybrid/remote work supported.

Qualifications

  • Experience with distributed PyTorch training on GPUs.

Responsibilities

  • Design, implement, and optimize distributed training systems for models with thousands of GPUs
  • Research and implement advanced parallelization techniques (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel)
  • Build monitoring, visualization, and debugging tools for large-scale training runs
  • Optimize training stability, convergence, and resource utilization across massive clusters

Skills

Large-scale GPU training
Distributed PyTorch training
GPU clusters
Linux scripting
Containerization
Cloud infrastructure
NCCL
MPI
CUDA

Tools

PyTorch
CUDA
Distributed systems
NCCL
MPI
Linux
Scripting
Containerization
Cloud infra

Job description

Luma AI in SF Bay Area is hiring for a Research Scientist/Engineer in Training Infrastructure. You will design distributed training systems for thousands of GPUs and enable researchers to push multimodal foundation models.

You should have deep experience with PyTorch, CUDA and distributed systems, plus Linux and scripting. The role offers remote/international options including London; hybrid/remote work supported.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Research Scientist / Engineer – Training Infrastructure
Research Scientist / Engineer – Training Infrastructure

Luma AI • San Francisco (CA)

Hybrid
USD 187,000 - 395,000
Senior Distributed AI Training Architect
Senior Distributed AI Training Architect

Luma AI • United States

Remote
USD 180,000 - 280,000
Research Scientist / Engineer – Training Infrastructure
Research Scientist / Engineer – Training Infrastructure

Luma • Redwood City (CA)

On-site
USD 210,000 - 260,000
ML Infra Engineer — GPU Clusters & Distributed Systems
ML Infra Engineer — GPU Clusters & Distributed Systems

AI Breaking Wire • San Francisco (CA), Northern (KY)

Hybrid
USD 170,000 - 250,000
Industry-leading compensation and/or:?
Unlimited PTO
Top-tier medical, dental, and vision
+1
Lead AI Infrastructure Engineer: GPU Clusters & Reliability
Lead AI Infrastructure Engineer: GPU Clusters & Reliability

Luma AI • San Francisco (CA)

On-site
USD 300,000 - 420,000
Senior GPU Infra Reliability Engineer - Remote
Senior GPU Infra Reliability Engineer - Remote

Luma AI • United States

Remote
USD 180,000 - 240,000
Distributed Training Engineer for Multimodal Models
Distributed Training Engineer for Multimodal Models

Luma • Redwood City (CA)

On-site
USD 210,000 - 260,000
Staff ML Infra Engineer: Distributed Training & Inference
Staff ML Infra Engineer: Distributed Training & Inference

Jobtailor • Boston (MA)

On-site
USD 120,000 - 160,000
Lead ML Systems Engineer — Distributed GPU Training & Infra
Lead ML Systems Engineer — Distributed GPU Training & Infra

Nvidia Corporation • Santa Clara (CA)

On-site
USD 224,000 - 431,000
Equity
Benefits
Senior ML Infra Engineer - Scale GPU Clusters, Remote
Senior ML Infra Engineer - Scale GPU Clusters, Remote

AI Breaking Wire • San Francisco (CA), Northern (KY)

Hybrid
USD 320,000 - 500,000
Equity
Medical/Dental/Vision coverage
Unlimited PTO
+1