Staff Engineer: Large-Scale ML Training Systems

United States Digital Space LLC

San Francisco (CA)

Hybrid

USD 180,000 - 290,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Benefits offered by this job

Equity
Travel cost coverage
Hybrid/onsite collaboration

Job summary

Black Forest Labs in San Francisco, with Freiburg ties, is hiring a senior training-systems engineer to optimize production training of large multimodal models. You will work closely with researchers to improve attention performance, kernels, data movement, and training throughput.

You will profile GPU workloads using Nsight tools, validate numerical stability, and help drive low-precision training and quantization paths while ensuring model-quality outcomes.

Qualifications

  • Experience working deeply on large-scale training systems, ideally with researchers.
  • Strong PyTorch fluency, including reading and modifying low-level training code.
  • Experience with distributed training concepts (FSDP, tensor/model parallelism, NCCL).
  • Hands-on experience improving throughput, memory footprint, or stability in real training runs.
  • Experience profiling GPU workloads with Nsight tools or Torch Profiler.

Responsibilities

  • Improve production training performance, reliability, and numerical stability for large multimodal models.
  • Profile full training steps across model code, attention, kernels, data loading, and memory pressure.
  • Implement GPU-level optimizations: fused kernels, low-precision paths, and quantization kernels.
  • Advance FP8/FP4-style training and convergence-safe quantization approaches.
  • Collaborate with researchers to translate architecture changes into efficient training implementations.

Skills

PyTorch
Distributed training
Performance profiling
GPU kernels
Low-precision training

Tools

Nsight Systems
Nsight Compute
Torch Profiler
Trace Viewers
Custom Telemetry

Job description

Black Forest Labs in San Francisco, with Freiburg ties, is hiring a senior training-systems engineer to optimize production training of large multimodal models. You will work closely with researchers to improve attention performance, kernels, data movement, and training throughput.

You will profile GPU workloads using Nsight tools, validate numerical stability, and help drive low-precision training and quantization paths while ensuring model-quality outcomes.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Research Engineer: Large-Scale AI Training Systems
Research Engineer: Large-Scale AI Training Systems

BlackForestLabs • San Francisco (CA)

Hybrid
USD 180,000 - 290,000
Equity
Research Engineer - Large-Scale Training (Remote + Equity)
Research Engineer - Large-Scale Training (Remote + Equity)

Black Forest Labs • San Francisco (CA)

Hybrid
USD 180,000 - 290,000
Senior Model Serving & API Backend Engineer
Senior Model Serving & API Backend Engineer

Black Forest Labs • San Francisco (CA)

Hybrid
USD 180,000 - 300,000
ML Model Serving & High-Performance API Engineer
ML Model Serving & High-Performance API Engineer

Black Forest Labs Inc. • San Francisco (CA)

On-site
USD 180,000 - 260,000
Travel reimbursement
Senior ML Training Systems Engineer - Distributed GPU Infra
Senior ML Training Systems Engineer - Distributed GPU Infra

Baseten • San Francisco (CA)

On-site
USD 150,000 - 200,000
Competitive compensation, including equity
100% coverage of medical, dental, and vision insurance
Generous PTO policy
+2
Senior Distributed ML Training Engineer
Senior Distributed ML Training Engineer

Visa Hunt • San Francisco (CA), Northern (KY)

Hybrid
USD 220,000 - 310,000
Stock options
Health/dental/vision insurance
Meals provided in office
+1
Senior LLM Research & Training Engineer
Senior LLM Research & Training Engineer

Pragmatike • San Francisco (CA)

On-site
USD 200,000 - 350,000
AI Infrastructure Kernel Engineer for Large-Scale Training
AI Infrastructure Kernel Engineer for Large-Scale Training

Thinking Machines Lab Inc. • San Francisco (CA), Northern (KY)

Hybrid
USD 350,000 - 475,000
Health, dental, and vision benefits
Unlimited PTO
Parental leave
+1
ML Systems Engineer: Optimizing Training & GPU Kernels
ML Systems Engineer: Optimizing Training & GPU Kernels

Jobtailor • Massachusetts

On-site
USD 120,000 - 180,000
Member of Technical Staff - Research Engineer San Francisco (USA), Freiburg (Germany)
Member of Technical Staff - Research Engineer San Francisco (USA), Freiburg (Germany)

BlackForestLabs • San Francisco (CA)

Hybrid
USD 180,000 - 290,000
Equity