Distributed Training Engineer for Multimodal Models

Luma

Redwood City (CA)

On-site

USD 210,000 - 260,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Luma is seeking an engineer to design and optimize distributed training systems for multimodal models across thousands of GPUs. You will tackle advanced parallelism, training stability, and utilization at scale.

You will work with PyTorch, CUDA, NCCL, and Tensor Parallel, building monitoring and tooling for large-scale runs. This role suits someone who has shipped foundation-model training at scale and can improve stability and efficiency on massive clusters.

Qualifications

  • Experience in extensive distributed PyTorch training and parallelisms for foundation-models.
  • Deep understanding of GPU clusters, networking, and storage systems.
  • Familiarity with communication libraries (NCCL, MPI) and distributed-system optimization.

Responsibilities

  • Design, implement, and optimize distributed training systems for models across thousands of GPUs.
  • Research and implement advanced parallelization (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel).
  • Build monitoring, visualization, and debugging tools for large-scale training runs.
  • Optimize training stability, convergence, and resource utilization across massive clusters.
  • Immerse & diagnose training stacks, land a parallelization or stability improvement, and scale tooling for reliability.

Skills

Distributed PyTorch training
GPU clusters & networking
Distributed-system optimization

Tools

NCCL
MPI

Job description

Luma is seeking an engineer to design and optimize distributed training systems for multimodal models across thousands of GPUs. You will tackle advanced parallelism, training stability, and utilization at scale.

You will work with PyTorch, CUDA, NCCL, and Tensor Parallel, building monitoring and tooling for large-scale runs. This role suits someone who has shipped foundation-model training at scale and can improve stability and efficiency on massive clusters.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Distributed AI Training Architect
Senior Distributed AI Training Architect

Luma AI • United States

Remote
USD 180,000 - 280,000
Research Scientist / Engineer – Training Infrastructure
Research Scientist / Engineer – Training Infrastructure

Luma • Redwood City (CA)

On-site
USD 210,000 - 260,000
Research Scientist / Engineer – Training Infrastructure
Research Scientist / Engineer – Training Infrastructure

Luma AI • San Francisco (CA)

Hybrid
USD 187,000 - 395,000
Remote Senior Training Infrastructure Engineer—Multi-GPU AI
Remote Senior Training Infrastructure Engineer—Multi-GPU AI

Luma AI • San Francisco (CA)

Hybrid
USD 187,000 - 395,000
Distributed AI Training Architect
Distributed AI Training Architect

cerence • United States

On-site
USD 180,000 - 250,000
LLM Distributed Training Engineer (1000+ GPUs)
LLM Distributed Training Engineer (1000+ GPUs)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 100,000 - 130,000
Distributed Training Infra Engineer for Large Models
Distributed Training Infra Engineer for Large Models

Kindredventures • San Francisco (CA)

On-site
USD 180,000 - 240,000
LLM Pre-training & Distributed Engineer (AI Infrastructure)
LLM Pre-training & Distributed Engineer (AI Infrastructure)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
LLM Pre-training & Distributed Engineer (AI Infrastructure)
LLM Pre-training & Distributed Engineer (AI Infrastructure)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 100,000 - 130,000
LLM Distributed Training Engineer (1000+ GPUs)
LLM Distributed Training Engineer (1000+ GPUs)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000