Senior ML Engineer, Distributed Training & P2P Systems

Pluralis Research

California (MO)

Remote

USD 120,000 - 160,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Equity-heavy compensation
Visa sponsorship
Remote-first
Access to Melbourne hub

Job summary

A mission-driven technology company in California is seeking experienced Senior/Staff Engineers proficient in building distributed ML systems. Applicants should possess strong experience in optimizing large-scale training under low-bandwidth conditions, with expertise in Python and frameworks like DeepSpeed. The role emphasizes resilience in decentralized environments and offers equity-heavy compensation, remote-friendly work, and a world-class team atmosphere.

Qualifications

  • 5+ years of experience in distributed systems and ML large-scale training.
  • Strong experience building and operating distributed systems in production.
  • Hands-on expertise with distributed training frameworks.

Responsibilities

  • Design and implement large-scale distributed training systems.
  • Develop and optimise model-parallel training strategies.
  • Architect resilient training systems that handle failures.
  • Implement NAT traversal and dynamic routing.

Skills

Distributed systems
ML large-scale training
Model parallelism
Expert-level Python
Networking fundamentals
Optimizing GPU workloads

Tools

FSDP
DeepSpeed
Megatron

Job description

A mission-driven technology company in California is seeking experienced Senior/Staff Engineers proficient in building distributed ML systems. Applicants should possess strong experience in optimizing large-scale training under low-bandwidth conditions, with expertise in Python and frameworks like DeepSpeed. The role emphasizes resilience in decentralized environments and offers equity-heavy compensation, remote-friendly work, and a world-class team atmosphere.
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Senior Distributed ML Systems Engineer (Remote • Equity)
Senior Distributed ML Systems Engineer (Remote • Equity)

Pluralis Research • San Francisco (CA)

Remote
Equity-heavy compensation
Competitive base salary
Visa sponsorship
+2
Staff ML Systems Engineer — Distributed Training at Scale
Staff ML Systems Engineer — Distributed Training at Scale

RadixArk • Palo Alto (CA)

On-site
USD 120,000 - 160,000
Comprehensive benefits
Flexible work arrangements
Senior ML Training Systems Engineer - Distributed GPU Infra
Senior ML Training Systems Engineer - Distributed GPU Infra

Baseten • San Francisco (CA)

On-site
USD 150,000 - 200,000
Competitive compensation, including equity
100% coverage of medical, dental, and vision insurance
Generous PTO policy
+2
Senior ML Performance Engineer - Distributed Training
Senior ML Performance Engineer - Distributed Training

Odyssey • Santa Clara (CA)

On-site
USD 120,000 - 160,000
Senior ML Engineer: Distributed Training on Neuron
Senior ML Engineer: Distributed Training on Neuron

Amazon • Seattle (WA)

On-site
USD 151,300 - 261,500
Comprehensive medical benefits
Flexible work-life balance
Mentorship opportunities
Senior ML Systems Engineer: Scalable Training Frameworks
Senior ML Systems Engineer: Scalable Training Frameworks

Cohere • San Francisco (CA)

Hybrid
USD 150,000 - 180,000
Staff Engineer, Distributed Pre-Training Infra
Staff Engineer, Distributed Pre-Training Infra

Reflection • San Francisco (CA)

On-site
Top-tier compensation
Comprehensive health and wellness benefits
Paid parental leave
+2
Senior Distributed ML Training Engineer
Senior Distributed ML Training Engineer

Visa Hunt • San Francisco (CA), Northern (KY)

Hybrid
USD 220,000 - 310,000
Stock options
Health/dental/vision insurance
Meals provided in office
+1
Senior ML & Distributed Systems Engineer
Senior ML & Distributed Systems Engineer

Amazon • Mountain View (CA)

On-site
USD 165,200 - 223,600
Health insurance
401(k) matching
Paid time off
Principal ML Engineer - Large-Scale Training Performance
Principal ML Engineer - Large-Scale Training Performance

Advanced Micro Devices, Inc. • San Jose (CA)

On-site
USD 130,000 - 160,000