LLM Distributed Training Engineer (1000+ GPUs)

Hyphen Connect Limited

San Francisco (CA)

On-site

USD 120,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Hyphen Connect Limited is seeking a highly skilled LLM Pre-training & Distributed Systems Engineer to optimize large-scale machine learning training runs. The ideal candidate will have deep expertise in GPU clusters and extensive systems engineering experience to ensure efficiency and reliability in training processes.

Key responsibilities include orchestrating distributed training runs, optimizing networking and memory management, and automating checkpointing during long training periods. If you have a passion for cutting-edge technology and system architecture, we want to hear from you.

Qualifications

  • Deep expertise in orchestrating distributed training runs across multiple GPUs.
  • Strong systems engineering skills with experience in C++, CUDA, and Python.

Responsibilities

  • Orchestrate distributed training runs across 1,000+ GPUs using PyTorch, DeepSpeed, or Megatron-LM.
  • Optimize networking (InfiniBand/RDMA) and memory management to prevent out-of-memory errors.
  • Automate checkpointing and failure recovery during month-long training runs.

Skills

3D parallelism expertise
Systems engineering (C++, CUDA, Python)

Job description

Hyphen Connect Limited is seeking a highly skilled LLM Pre-training & Distributed Systems Engineer to optimize large-scale machine learning training runs. The ideal candidate will have deep expertise in GPU clusters and extensive systems engineering experience to ensure efficiency and reliability in training processes.

Key responsibilities include orchestrating distributed training runs, optimizing networking and memory management, and automating checkpointing during long training periods. If you have a passion for cutting-edge technology and system architecture, we want to hear from you.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

LLM Distributed Training Engineer (1000+ GPUs)
LLM Distributed Training Engineer (1000+ GPUs)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 100,000 - 130,000
LLM Pre-training & Distributed Engineer (AI Infrastructure)
LLM Pre-training & Distributed Engineer (AI Infrastructure)

Hyphen Connect Limited • Oregon (WI)

On-site
USD 100,000 - 130,000
LLM Pre-training & Distributed Engineer (AI Infrastructure)
LLM Pre-training & Distributed Engineer (AI Infrastructure)

Hyphen Connect Limited • San Francisco (CA)

On-site
USD 120,000 - 160,000
Distributed AI Training Architect
Distributed AI Training Architect

cerence • United States

On-site
USD 180,000 - 250,000
Distributed Training Engineer for Multimodal Models
Distributed Training Engineer for Multimodal Models

Luma • Redwood City (CA)

On-site
USD 210,000 - 260,000
Senior Distributed AI Training Architect
Senior Distributed AI Training Architect

Luma AI • United States

Remote
USD 180,000 - 280,000
Training Infra Engineer for Scalable LLM Systems
Training Infra Engineer for Scalable LLM Systems

Inception • San Francisco (CA)

On-site
USD 180,000 - 240,000
Distributed ML Training Engineer - Scale GPUs, Unlimited PTO
Distributed ML Training Engineer - Scale GPUs, Unlimited PTO

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health benefits
Unlimited PTO
Parental leave
+1
Lead ML Systems Engineer — Distributed GPU Training & Infra
Lead ML Systems Engineer — Distributed GPU Training & Infra

Nvidia Corporation • Santa Clara (CA)

On-site
USD 224,000 - 431,000
Equity
Benefits
Member of Technical Staff, Training Infra
Member of Technical Staff, Training Infra

Inception • San Francisco (CA)

On-site
USD 180,000 - 240,000