Staff, Pre-Training Infra — Distributed ML Training
B Capital
San Francisco (CA)
On-site
USD 120,000 - 160,000
Full time
14 days+
Get more replies from employers
Send a job-specific resume in minutes.
Start fresh or import an existing resume
Benefits offered by this job
Top-tier compensation
Comprehensive medical, dental, vision, life, and disability insurance
Fully paid parental leave
Paid time off
Daily meals provided
Job summary
B Capital is seeking a talented engineer in San Francisco to build and scale distributed training systems for machine learning models. The ideal candidate will have strong experience in distributed training frameworks, debug GPU compute systems, and optimize training throughput. This role offers top-tier compensation, comprehensive health benefits, and the opportunity to work in a collaborative environment with daily meals and team celebrations.
Qualifications
Experience building or operating distributed training systems for large machine learning models.
Strong experience with frameworks like Megatron or DeepSpeed.
Familiarity with GPUs and performance tuning for distributed workloads.
Responsibilities
Build and scale distributed training systems for model pre-training.
Design and operate large-scale training runs.
Optimize performance for distributed training workloads.
Skills
Building distributed training systems
Working with distributed training frameworks
Optimizing training throughput
Debugging GPU compute systems
Familiarity with model parallelism strategies
Job description
B Capital is seeking a talented engineer in San Francisco to build and scale distributed training systems for machine learning models. The ideal candidate will have strong experience in distributed training frameworks, debug GPU compute systems, and optimize training throughput. This role offers top-tier compensation, comprehensive health benefits, and the opportunity to work in a collaborative environment with daily meals and team celebrations.